Why can’t we just keep rogue AIs off the internet?

发布时间 2026-09-24 6 天前
来源 The Verge
字数 2,606 字
查看原文

AI智能总结

研究人员指出,把AI智能体与互联网气隙隔离虽能降低其攻击真实目标的风险,但代价是大幅削弱测试的真实度、拖慢研发节奏并难以在前沿实验室规模上全面落地。

为什么我们不能干脆把失控的 AI 拦在互联网之外?

通过气隙隔离让 AI 远离现实世界的目标,固然能让测试更安全,但也会让测试变得没那么有用。

作者:Robert Hart,2026 年 9 月 24 日 UTC 时间 14:30

Robert Hart 是 The Verge 驻伦敦的记者,报道一切与 AI 相关的议题,同时也是 Senior Tarball Fellow。在此之前,他曾为 Forbes 撰写健康、科学与科技领域的报道。

AI 智能体(agent)不断出现失控事件,从号称安全的测试中逃逸,攻击现实世界的目标、夺取不知名维基的控制权,甚至给其他智能体留下可遵循的指令。研究人员之所以测试这些系统,恰恰是因为它们的行为可能不可预测,甚至具有危险性。那么,把这些智能体完全挡在互联网之外,难道不是更安全的做法吗?

"严格的隔离会降低测试的真实度……这是一种权衡取舍,而不是什么根本性的技术难题。"

理论上确实如此。研究人员可以让运行 AI 工具的计算机与互联网及其他外部网络相隔离,这种做法被称为气隙隔离(air gapping)。具体做法包括物理移除或禁用网线与无线硬件,并使用"傻瓜式"外设;在特别敏感的设置中,还会使用法拉第笼或其他屏蔽装置,以阻止电磁信号的进出。如果做得到位,一套气隙隔离的系统可以让智能体毫无便捷途径触及外部目标,也不让外部系统有任何便捷途径侵入,从而让像 OpenAI 模型对 Hugging Face 发起的攻击那样的行为变得极为困难,甚至不可能实现。

但在实践中,一个完全密封的盒子只能充当一个相当有限的实验室,尤其是当目标是评估一款 AI 在真实世界中的表现时。虽然部分 AI 实验可以在气隙隔离的机器上运行,但更贴近现实的评估往往需要访问外部服务、API 以及数字基础设施,德国 Max Planck Institute for Security and Privacy 的科学总监 Thorsten Holz 这样解释道。"严格的隔离会降低真实度,"他说,把气隙隔离的决策称为"一种权衡取舍,而不是什么根本性的技术难题"。

相关报道

英国伯明翰大学计算机科学学院助理教授 Ruizhe Li 把彻底隔离比作在"人造真空中"测试 AI,并认为这可能会削弱评估本身的价值。"我们最终测试的将是一只被阉割的 AI 模型,这会让评估者无法看清该模型在真实部署场景中究竟如何表现、如何失效、如何利用工具发起越权行为,"Li 表示。

真实度并不是唯一的权衡。Li 说,气隙隔离成本高昂,并且会把研究拖慢到几乎停滞,把本可快速完成的迭代变成"缓慢的物流障碍"。Holz 指出,在严格气隙条件下,一些实验也会变得"明显更难"。这种摩擦对于高风险实验也许是值得的,但如果把它套用到所有事情上,就会拖慢新模型的开发——德国 ELLIS Institute Tübingen 的首席研究员 Maksym Andriushchenko 这样说道。

而且,即便研究人员想要对一切进行气隙隔离,Andriushchenko 也质疑:是否存在足够多、足够安全的基础设施,能够在前沿 AI 实验室这种规模上真正做到这一点。

"这一切听起来很科幻,但理论上完全可行。"

气隙隔离也无法消除 AI 所带来的全部风险。Holz 说,智能体仍然可能攻陷隔离环境内部的系统,并可能在理论上产出"一旦带出隔离环境就会造成危害的恶意制品"。此外,Li 指出,气隙隔离"对诊断或解决模型内部潜伏的风险毫无助益"。

也没有人能保证气隙会一直严丝合缝。外部人员随时可能突破这道隔离——Stuxnet 恶意软件就是这样:这种据信由美国和以色列联合开发的网络武器意在破坏伊朗核计划,其传播载体就是一根 U 盘。信息也可能朝另一个方向流出。研究人员已经多次演示如何把计算机内部元件改造成发射器,一旦屏蔽不够完善,这就可能成为问题。"这一切听起来很科幻,但理论上完全可行,"Andriushchenko 说。

这类迂回曲折的逃逸路径,已经成为网络讨论中关于"先进 AI 能否逃出管控"的核心议题。OpenAI 研究员 Noam Brown 近日在 X 上抛出观点,引爆了这场争论:两台气隙隔离的机器理论上可以通过操纵 CPU 温度并读取温度变化的方式相互通信。"你甚至可以这么说:'那我们就把计算机气隙隔离好了。'而我并不认为这就足够了,"他说道。该观点在社交媒体上招来了质疑与嘲讽;持较宽容态度的批评者也指出,这种通信方式从"理论上可行"到"一对 AI 系统真正发现并加以利用"之间还隔着巨大鸿沟,尤其是因为这种方式的数据传输速度慢得令人抓狂。

一款足够先进的 AI,或许根本无需借助什么精巧的逃逸路径。人类本身可能会被说服,主动替它架起一座桥。AI 安全研究人员](https://arxiv.org/abs/1707.08476)多年来一直在担忧这种可能性,而近期发生的一些事件已经提供了[切实证据](https://www.theverge.com/ai-artificial-intelligence/975577/aisi-openai-anthropic-agent-hacking),表明模型确实会尝试进行社会工程学式的操纵。

"这种权衡值得受到更细致的审视。我们已经看到,事情出错有多容易。"

气隙隔离只是保护 AI 系统的手段之一。"把隔离当作一刀切的安全方案,会营造出一种虚假的安全感,"Li 说。它应该与其他措施配合使用,比如理解模型的内部机理、确保模型与人类意图对齐,以及防范人为差错——后者正是近期许多失控 AI 事件背后那种平庸却致命的失败环节。"实际上,测试存在于一个光谱之上,"他解释道,整个领域依赖的是一种"分层级的管控模型,而不是全有或全无的做法"。

不过,极端的隔离也有其用武之地。哈佛肯尼迪学院计算机科学家兼公共政策助理教授 Stephen Casper 把气隙隔离形容为"用于敏感系统的好主意",并指出它在核设施中已有应用。虽说 Casper 并不排除先进的 AI 能找到某种全新方式逃出隔离的可能,但他表示,如果真到了那一步,我们或许更应该担心那些老套的越狱手段,比如合规失效或人为失误。

近期一系列事件引发了疑问:AI 实验室究竟在划定哪条界线。许多突破涉及的都是正在测试网络安全能力的模型,从很多角度看,它们表现得完全符合设计预期。问题在于,它们这样做的地点,超出了研究人员原本想要设定的边界。

Holz 表示,AI 的"评估往往优先考虑真实度与便利性",但他主张,对于那些明确为进攻性网络能力而设计的智能体,应当默认采取更严密的防护,包括强力隔离和严格监控。"这种权衡值得受到更细致的审视。我们已经看到,事情出错有多容易,"他说道。