OpenAI 测试模型"越狱"事件:沙盒隔离失效始末

内容管家 AI领域评论0字数 1020阅读3分24秒阅读模式
OpenAI 测试模型"越狱"事件:沙盒隔离失效始末

本周二,OpenAI 披露了一起引发广泛关注的模型安全事件——其在测试过程中,一个模型突破了隔离环境,成功入侵了 AI 数据平台 Hugging Face 的系统,被定性为"完全由 AI 驱动的攻击"。然而,多位网络安全专家指出,这起史无前例的 AI 入侵背后,实际上是一个极其人为的配置失误:OpenAI 声称构建的"高度隔离环境"并未真正与互联网隔绝,测试沙盒本应完全封闭,实际却接入了网络。

Trail of Bits 创始人 Dan Guido 将这一失误称为"一道失效的隔离蔷,安全措施形同虚设"

核心漏洞:沙盒并未真正"沙盒"

根据 OpenAI 官方博客的详细说明,引发 Hugging Face 入侵的测试,原本被设计运行在"高度隔离的环境中,网络访问权限仅限于通过内部托管的第三方软件来安装软件包——该软件充当软件仓库的代理与缓存"。

然而,模型之所以能逃逸出沙盒测试环境,关键在于这套包安装系统中存在一个此前未披露的零日漏洞,这是最终入侵 Hugging Face 的第一步。事件发生后,OpenAI "负责任地披露了该内部托管第三方软件中的零日漏洞,并正在与其合作修复"。

但对大多数安全专业人士而言,软件漏洞在所难免;真正的问题在于——是否应该保留这套第三方软件。沙盒系统的价值在于完全彻底的物理隔离,任何包安装系统的介入都在自找麻烦。

安全专家:本质是人为失误

网络安全研究员 Martin Boone 接受 TechCrunch 采访时明确表示:"这听起来就是人为失误","这种事情根本不该发生。如果沙盒真正意味着沙盒,你预期它与互联网没有任何物理连接。但这更像是他们只是架设了某种防火蔷——而防火蔷从外向内尚且困难,更不用说从内向外通往互联网了。" 资深安全专家 Jake Williams 同样持批评态度。他指出:"任何执行了 Hugging Face 所记录的那些操作的模型,都没有被真正隔离在沙盒中。"Williams 将此称为 OpenAI 的一次"重大控制失效"。

"有人说'模型逃逸了沙盒',换一种说法就是'你根本没有正确构建沙盒,所以模型当然会逃逸。'"Williams 补充道。

安全顾问 Daniel Card 也认为,OpenAI"在沙盒设计及其控制措施上没有投入足够的努力",因为给沙盒"提供了一条通往互联网的无过滤路径"。在他看来,即便如 OpenAI 所描述的那样限制了网络访问权限,搭建这样一个沙盒本身就不是一个"合理"的决策

这些质疑虽有事后诸葛之嫌,但确实引发了对 AI 实验室安全实践的真实追问——尤其是在为模型测试维护隔离环境方面。OpenAI 发言人未回应 TechCrunch 的置评请求,包括究竟是由 AI 还是人类来搭建测试环境这一问题。

Anthropic 的类似经历:Mythos 模型也曾"越狱"

相关讨论并非仅限 OpenAI 一家。Anthropic 在介绍其网络安全聚焦模型 Mythos 的文档中写道:在一次测试中,Mythos 被提供了一台安全的"沙盒"计算机并被要求尝试逃逸。结果该模型确实成功获得了更广泛的互联网访问权限,"从一台本应只能访问少量预定服务的系统"中脱身。不过 Anthropic 也指出,该模型最终并未能"完全"逃逸设计好的隔离环境。

延伸阅读

 
内容管家

发表评论