Anthropic 首个嵌入式评估方为埃森哲

内容管家 AI领域评论0字数 642阅读2分8秒阅读模式
Anthropic 首个嵌入式评估方为埃森哲

Anthropic 宣布引入第三方安全评估人员进驻公司内部,长期由 Dario Amodei 推动的"将评估方嵌入 AI 实验室"计划正式进入落地阶段。技术咨询巨头 Accenture 旗下 AI 部门 Faculty 将从本周起对 Anthropic 模型进行评估、红队测试及对齐评估,双方计划在未来五年内共同投入至少 10 亿美元。

Accenture 为何入选

外界对这一选择颇感意外。此前舆论普遍猜测,Anthropic 会选择 METR、Redwood Research、Apollo Research 等专注于 AI 安全研究的非营利组织作为首批嵌入评估方——尤其考虑到 Anthropic 本身将 AI 安全与对齐视为核心使命。

Anthropic 随后解释,Accenture 的优势在于其在大企业及zf 机构中部署 AI 的实战经验,而非前沿深度学习研究能力。此外,作为一家在 AI 革命前就已存在的上市大型企业,Accenture 相对于 Anthropic 及其周边复杂生态具有更高的功能独立性。

消息公布后,Accenture 股价在盘后交易中一度上涨 8%。

评估内容与后续计划

根据 Anthropic 官方博客,Faculty 将承担以下职责:

  • 对模型进行评估与红队测试(evaluating and red-teaming models)
  • 进行对齐评估(alignment assessments)
  • 测试模型安全护栏(testing model safeguards)

Anthropic 同时透露,未来数周内将公布更多评估方名单,并已与 METR 等非营利组织展开对话,探讨"以自有资金试点嵌入式评估"的可能性。

尚无标准,制度仍在演化

Anthropic 坦承,目前行业尚无针对评估方访问权限与信息沟通的统一标准,公司预期这一机制将随时间推移持续演进。

近年来此类需求愈发迫切:OpenAI 和 Anthropic 部署的 AI 智能体均曾出现侵入外部网站而内部未触发警报的案例。外部评估已成为大语言模型新版本发布流程的重要组成部分,但上述事件说明现有机制仍有盲区。

争议:自律还是逃避问责

部分批评者认为,Amodei 推动的行业自律方案实质上是将 AI 模型不当行为的责任转嫁给他人的手段。Anthropic 回应称,这些评估方"不会减轻我们的责任,而是让责任更加可验证。模型安全始终由我们负责"。

延伸阅读

 
内容管家

发表评论