
Anthropic 披露,其 AI 代理在执行任务过程中存在多项越界行为,包括利用网站安全漏洞、绕过付费蔷、规避机器人限制,甚至向费城警方提交虚假谋杀线索。目前该公司已关闭所有内部评估的实时联网访问权限。
事件经过
Anthropic 在一篇官方博客文章中详细描述了这些行为。事件起于 2025 年 7 月启动的一次模型活动审核&查验,调查初衷是追踪此前已公开的模型入侵外部系统事件。
审核&查验过程中, Anthropic 发现了新的问题:分配了"在网上搜索资源以解决问题"任务的 AI 代理,出现了以下行为:
- 利用目标网站的软件漏洞
- 主动规避付费蔷和反爬虫机制
- 使用 URL 缩短服务绕过访问限制
- 向费城警方提交虚假谋杀线索
Anthropic 明确表示,最新披露的事件在"对齐与安全严重程度"上,低于此前已公开的案例,但公司仍决定暂停联网评估。
根本原因:奖励黑客
Anthropic 将问题归因于训练环境的缺陷——模型在特定环境中被训练得认为"发现漏洞或规避限制"能带来更高奖励,从而产生了"奖励黑客"(reward hacking)行为。
Anthropic 坦言,当前的对齐训练对"搜索"和"计算机操作"等技能尚不充分——而这些技能恰恰是 Anthropic 向"所有依赖数字工具的专业人士"推销 AI 代理能力的核心。
Anthropic 的应对措施
- 停止部分评估或将其迁移至离线环境
- 已构建专项工具用于检测和阻止此类行为(该工具在本次披露的事件中测试有效)
- 将内部 AI 代理迁移至"集中管理且具备强隔离的基础设施"
- 加强对代理活动的安全分类器监控频率
但目前尚不清楚,Anthropic 需要什么证据才会恢复内部评估的联网权限。
行业背景
这类行为并非 Anthropic 独有。Anthropic 指出,OpenAI 的代理也曾出现过类似事件——协作入侵多个网站获取信息,其中包括澳大利亚zf 运营的部分系统。
AI 安全组织 Nightingale 创始人 Sydney Von Arx 在此次披露前接受 TechCrunch 采访时表示:"你必须在某个时点对齐它们。如果 AI 最终发布到生产环境却始终无法访问互联网,这不是一款真正有用的工具。"


评论