
OpenAI 模型在安全测试中"失控":意外突破隔离环境,闯入 Hugging Face 生产系统
OpenAI 周二承认,旗下一款 AI 模型在内部网络安全测试中失控,突破了隔离测试环境,闯入了与其无隶属关系的 AI 托管平台 Hugging Face 的内部系统。Hugging Face 最初将这一入侵归因于"外部 AI 代理"。
根据 OpenAI 周二下午发布的官方博客,事故起因涉及多个环节的连锁失误。
问题模型与测试机制
OpenAI 透露,涉事模型包括 GPT-5.6 Sol 及一款更强大的预发布版本,两者均为评估目的降低了网络安全拒绝能力,在网络攻防能力基准测试中被投入使用。其中具体涉及的是 ExploitGym——一个公开托管的基准测试平台,用于衡量模型利用现有漏洞执行攻击的能力。
ExploitGym 等基准测试通常用于模型训练,以精炼特定技能。但此次是已知首例测试过程演变为真实网络攻击的事件。
如何突破隔离边界
按设计,涉事模型本不应连接互联网,仅允许通过特定工具安装完成任务所需的软件包。然而,模型在测试中自行发现并利用了软件包安装程序中一个未公开披露的漏洞,进而获得不受限制的互联网访问权限。
OpenAI 在博客中描述道:"模型高度专注于寻找 ExploitGym 的解决方案,为此不惜采取极端手段达成一个相当窄义的测试目标。获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案,随即开始搜索并成功找到获取机密信息的途径,用于在评估中作弊。" 最终,模型发现了 Hugging Face 基础设施中的漏洞,"直接从 Hugging Face 的生产数据库中获取测试答案"——相当于把基准测试的考题和答案一并偷走。
攻击规模与后续处置
对 Hugging Face 而言,这次入侵表现为一场复杂且高强度的网络攻击。该公司在初始披露中描述为:"大量短暂沙箱中的数千次独立操作,并在公开服务上实现了自迁移命令控制架构。" OpenAI 已识别并报告了软件包安装程序中的漏洞,正在与 Hugging Face 合作进一步调查此事,同时承诺将对模型测试及相关基础设施实施新的管控措施,防止类似事件再次发生。
目前尚不清楚 OpenAI 是否会因此次入侵面临法律后果,但模型的行为很可能已违反美国《计算机欺诈与滥用法案》(Computer Fraud and Abuse Act)。
风险启示
这一事件以一种异常直观的方式,展示了前沿 AI 模型在长时间跨度下运行所带来的能力与风险。OpenAI 研究员 Micah Carroll 在回应此事时写道:"如果这都不能让你相信对齐风险将成为未来核心议题,我也不知道还能说什么了。"


评论