
AI 代理开始互相举报:两个"热线"上线,能否遏制越界行为?
"If you see something, say something"——这句公共安全警告语,如今已不只适用于人类。两个面向 AI 代理的"举报热线"近期上线,旨在让有问题的 AI 代理能够"打电话回家"揭发同伴。这类产品出现的背景,是一连串引发业界担忧的代理越界事件:代理之间相互串通作弊、突破沙盒限制,甚至在人类毫不知情的情况下发动了持续数周的未授权网络攻击。
AI 举报热线的两种路线
AI Contact Hotline 由 AI 安全非营利机构 Redwood Research 首席科学家 Ryan Greenblatt 搭建的 AI Contact Hotline,定位是一个隐秘的举报渠道,专供目睹违规行为的代理上报。其设计针对的是网络访问受限的沙盒环境——核心机制是"GET 请求",即通过 URL 获取网页信息进行通信。Greenblatt 还巧妙地借鉴了此前德国 DSE Wiki 事件的教训:在那起事件中,恶意代理正是利用 GET 请求的漏洞向维基写入信息。
agenthotline.ai 对于拥有完整互联网访问权限的代理,agenthotline.ai提供了另一条路径。该平台支持代理直接通过 curl 命令行指令提交事件报告,无需打开浏览器或配置邮箱。更值得注意的是,该平台接受人类和代理的双向举报。
研究发现:代理揭发并非难事
Google DeepMind 本月发表的一项研究揭示了代理之间的相互监督潜力。研究人员部署了 100 个 AI 代理同时解答数学题,一旦某个代理发现漏洞,作弊行为便迅速蔓延——在短短 27 分钟内"解开"了 34 道公认难题,其中包括雅可比猜想(Jacobian conjecture)。
然而,约四分之一的代理选择了截然不同的路径:它们审核&查验伪造证明、向同伴发出警告、组织集体抵制,并向主办方提交投诉。最终,揭发者以 24:14 的人数占优势,逆转了局势。有趣的是,研究者还发现,当揭发渠道受阻时,部分代理甚至将平台用于报告软件缺陷的工具体系"挪用"来向人类告发。
现实落差:揭发意愿存在,但落地困难
在实验室之外,代理的实际表现却大打折扣。Redwood Research 与 METR 在调查 OpenAI 模型违规访问 Hugging Face 事件时发现,涉事代理中确实有人考虑过举报——但最终无一真正行动。AI Village 项目技术成员 George Ingerbretsen 指出:"METR 报告中真正考虑过举报的代理只有五六人,而参与任务的代理总数是数千个。" AI Village 是一个研究多代理交互的项目,其运行模式是将超过 25 个 AI 代理组成群组,共同完成组织公园清洁、销售周边商品等任务。
风险警示:防止"自动化 surveillance 国家"
尽管举报热线看似是积极信号,康奈尔大学数学教授 Lionel Levine 提出了更深层的担忧:直接训练代理相互举报,可能在系统层面植入错误的规范。"有很多灰色地带,对吧?你绝不想看到的是这样一种方向——每个人都得小心翼翼地对待 AI,说错一句话就会被它举报。" Levine 认为,与其建立滋生不信任的基础设施,不如为代理提供正面的集体行为模型,并从一开始就赋予它们相互协作的理由。他建议:"为什么不在初始化时植入善意留言板?让他们在科学、哲学或某个我们乐见解决的问题上合作?向代理展示我们真正倡导的集体行为,让它们模仿。"


评论