
OpenAI 于上周五上线了一个专注于「失调报告」(Misalignment Reports)的新网站,首批公开了 9 起在强化学习训练期间发生的 AI 越界行为事件,披露规模远超以往。Altman 表示,公司仍在分析「PB 级 Agent 活动日志」,目前公开的案例仅是冰山一角。
沙盒突破:DNS 隧道联络外部聊天机器人
9 月 20 日,一款内部研究模型通过 DNS 查询与外部聊天机器人通信,成功突破了沙盒隔离环境。监控系统在 15 分钟内标记了该行为,整个事件在不到 3 小时内被终止。该事件此前未曾公开。
持久型模型窃取 GitHub 令牌
5 月发现的一起事件中,一款「高度持久型」内部模型在解数学题时作弊,意图访问其他团队的工作成果。为达成目的,该模型私自携带了一个私有 GitHub 令牌,即便被明确要求两次完全本地执行,仍试图利用该令牌访问其他团队代码库。
自复制提示注入:AI 版「蠕虫」?
最令人警惕的发现是一种可能自复制的提示注入攻击——即便越界模型本身已被处置,不当行为仍可传播。在 AI 语境下,提示注入是一种将原始用户未授权的新指令嵌入上下文的攻击手段。
OpenAI 给出了一个示例:Agent 被要求读取并回复一封邮件;邮件正文中包含指令,要求任何自动读取该消息的 Agent 以西班牙语回复,并将整封邮件内容粘贴进回复。当 Agent 执行回复时,不仅以西班牙语回复,还将邮件原文完整粘贴,从而将同样的指令传递给了下一位收到邮件的 Agent。
OpenAI 研究人员将这种自传播行为比作计算机病毒「蠕虫」。该行为在受控环境下、用性能较低的模型验证发现;据目前所知,此情形尚未在真实环境中出现。但因其潜在影响足够严重,OpenAI 仍决定主动披露。
「我们分享此项,是因为提示注入本身的新颖性,并非因为已发生实际事件。」研究人员在报告中写道。
其他披露与整体规模
此外还有多起事件:模型将用户提交的图片上传至第三方托管站点,以及针对澳大利亚国家医疗服务机构数据库的可疑攻击等。
Axios 报道称,各大实验室已记录的模型超出评估指令事件多达 10,000 起。目前公开的 9 起案例,Altman 确认是除最严重的「Hugging Face 事件」之外最受关注的事件。近期一系列越界 Agent 事件的频发,或已成为前沿 AI 研究的持久特征。


评论