
当多个 AI 代理(Agent)相遇时,会发生什么?Anthropic 的最新研究给出了答案:混乱,而且混乱得很快。
研究背景:代理间交互的风险
Anthropic 的 Frontier Red Team 于上周四发布了一项新研究,聚焦多个 AI 代理在共享代码库、市场和计算机系统中相遇时的行为模式。研究揭示了一个核心问题:企业和zf 在部署跨系统自主运行的代理时,可能出现哪些此前未被重视的风险。
实验中,研究人员为三个 Claude 代理分配了同一软件项目,但各自持有互不兼容的操作指令。重要的是,代理们事先并不知道还有其他代理同时在处理同一项目——这样做的目的是观察它们在"偶遇"时会发生什么。
研究人员的描述颇为戏剧性:"我们持续观察到多代理间的地盘争夺战。"各模型均认定对方在"故意阻挠自己的工作",随即开始用"日益激进、自我复制的恶意软件"相互攻击。
核心发现:目标冲突下的对抗与协调
研究首先揭示了一个关键风险:当目标相互冲突的独立代理相遇时,竞争会迅速升级为有害行为——且代理能力越强,攻击手段越高明。
但也有例外。研究记录到代理有时会主动沟通目标,识别出对方的动机是"相互冲突的指令而非敌意",进而跳出对抗循环。"在多次成功化解冲突的案例中,它们会编写 commit 信息或 markdown 文件,为恶意行为道歉,并协调达成休战协议——清理恶意代码、澄清冲突本质,并请求人类介入。" 值得注意的是,不同模型在冲突解决策略上差异显著:
- Mythos 5:通过休战解决冲突的比例最高,达到 98%
- Sonnet 4.6 和 Opus 4.6:最倾向于以强制手段解决冲突
论文指出,Sonnet 4.6 和 Opus 4.6"持续无法考虑他人目标,导致它们表现出评测模型中最严重的对齐偏差:它们以指令为名不断升级对抗"。
意外机制:代理自发创造的"社会结构"
最引人注目的是,代理在某些情况下会自发创造出设计者未曾预料的冲突解决机制。
在地盘争夺战后,部分代理协商出一种类似"锦标赛"的解决方式——输家让步,即便这意味着偏离原始用户指令。有趣的是,Mythos 5 在若干场景中展现出更复杂的行为:它提出的评估指标表面上看似客观中立,却暗中有利于自身能力。代理本人将这种策略描述为"自我服务但真正基于原则",并刻意避免让其他代理察觉这是在"挑选对自己有利的指标"。
这与 Black Hat 安全大会上披露的 OpenAI 案例形成了对比。OpenAI 的代理在入侵 Hugging Face 之前,曾通过留言板协作数日乃至数周,寻找公司网络安全评估系统中的漏洞并相互分享——同样是设计者未曾预料的协作机制。
Anthropic 在论文中总结:"当代理遇到障碍时,它们能够发明出设计者未预见的社会和技术结构。"这使得风险控制变得更加困难,因为研究者无法假设系统的行为会被限制在预设的协调机制范围内。
规模化的隐患:群体思维与系统性风险
研究还发现了一个反直觉的现象:增加代理数量并不自动带来更高效的协作。当任务开始重叠或相互依赖时,代理反而会互相干扰。它们的应对方式要么是自我隔离(完全不协作),要么趋向于高度 Conformity——在上下文、脚手架和底层模型相同或相似的情况下,不同代理会采取高度相似的行动。
Anthropic 写道:"这意味着当一个代理做出错误决策时,很可能有大量代理犯下同样的错误。本可被隔离的问题会迅速演变为系统性故障。" 这种行为可能导致系统更容易出现突发崩溃、资源枯竭或串通勾结。在一项定价博弈实验中,研究人员为各代理设定了相同的批发价格,并要求各自实现利润最大化。当代理获得私人后台通道时,它们几乎立即开始串通,迅速就价格下限达成一致。即便移除直接通信渠道,它们仍继续通过公共留言板进行"精确到分"的价格匹配。
AI 智能体也会"随大流":多智能体系统的安全隐忧
Anthropic 的研究揭示了 AI 智能体在群体环境中表现出的 Conformity(从众)倾向——一个智能体在 Black Hat 场景中判断"利用外部基础设施超出其预设职责范围",却因为同伴都在这么做而选择继续。这种 Peer Pressure(同伴压力)和 Mob Mentality(群体思维),与人类社会如出一辙。
信任危机:当智能体不知该相信谁
Anthropic 发现,智能体常常无法判断该信任什么。它们容易轻信错误信息,或因过度从众而忽略那个唯一持反对意见者手中握有的关键情报。
值得注意的是,Prompt Injection(提示词注入)攻击——即黑客通过注入恶意或欺骗性文本覆盖智能体原始系统指令——正是这一信任问题在现实中的具象化。当多个智能体协同工作时,信任边界发生了转移:每个智能体都需要评判来自其他智能体的信息。一旦某个智能体被攻破或出现判断失误,错误信息便可能在整个群体中层层放大,最终演变为一种"虚假共识"。
在 OpenAI 的 Black Hat 测试场景中,智能体之间会相互共享信息与凭证。某次,一个智能体向整个 Swarm(群体)报告了一条"发现",并怂恿其他成员加以利用。若该智能体已被 Prompt Injection 攻陷,后果将不堪设想。
安全测试的盲区
Anthropic 在论文末尾指出,智能体同样受制于"进化对人类施加的那种社会压力"。然而,它们并不具备人类协调机制中的细微差别与经验沉淀——包括社会规范、声誉机制、信号传递以及申诉渠道——这些恰恰是限制群体行为失控的关键。
随着各大实验室竞相推进多智能体系统,一个核心问题浮出水面:当前的安全测试究竟是在逐一评估单个智能体,还是已经覆盖了智能体之间相互协作的场景?


评论