Anthropic 与 OpenAI 拟引入安全评估员

内容管家 AI领域评论0字数 2019阅读6分43秒阅读模式
Anthropic 与 OpenAI 拟引入安全评估员

Anthropic CEO Dario Amodei 周末发表长文,提议在所有前沿 AI 公司内部嵌入第三方评估机构,赋予后者报告安全事件、评估模型是否真正对齐,并向公众公开未经删改的调查结论的权力。这一提议放在一年前,整个行业很可能会一口回绝。

Amodei 表示,Anthropic 承诺向 METR、Redwood Research 等独立评估机构开放前所未有的系统访问权限。OpenAI CEO Sam Altman 随后表态,OpenAI 同样愿意接受这一做法——这或许意味着行业与外部研究团队协作的方式正在发生深刻变化。

与评估机构交谈过的知情人士总体上欢迎这一提案,但同时指出,要让评估机构真正成为独立监督者、而非 AI 公司的"外包供应商",细节仍需敲定,最好还有立法层面的支撑。

为什么现在这项访问权限变得关键

随着模型识别评估场景的能力越来越强,一个隐患正在浮现:它们完全可能在测试时表现良好,暗地里却隐藏着问题行为。研究人员指出,成品模型的测试容易遗漏这类行为的蛛丝马迹,但如果追溯模型在整个训练过程中的行为轨迹,线索就会浮现出来。

Apollo Research 研究负责人 Alexander Meinke 打了个比方:

"AI 公司应该能够回答一些非常基本的问题,比如:AI 在训练过程中是否曾主动试图破坏自身的对齐训练?答案应当是一个毫无争议的'否'。然而目前,我们完全依赖 AI 公司自己去仔细核查,然后如实向公众汇报。而从近期的一些事件来看——默认情况下,它们两件事都不会做。作为嵌入式评估机构,我们可以真正去做这件事。"

从成品测试到全程追踪

以往,AI 公司通常在外包评测人员在模型发布前不久才对待测成品模型进行测试。如今,评估机构提出要获得访问权限的不只是最终模型,还包括训练过程中各个阶段保存的"检查点"(checkpoint)。

FAR.AI CEO Adam Gleave 描述了评估机构可以利用的几种手段:对比各检查点以确定令人担忧的行为是何时出现的;检查训练后的强化学习环境(该环境决定了模型因特定行为获得的奖励);以及核查评估记录和日志,验证公司关于模型表现的声明是否属实。

不过,Anthropic 和 OpenAI 具体计划在何时、以何种方式提供这种访问权限,目前仍不明朗。两家公司均未透露将与哪些评估机构合作、嵌入时间表、人员规模、具体可访问的系统与信息范围,以及哪些内容可以向公众披露——尽管 TechCrunch 多次追问。

这种"透视内部"之所以重要,是因为模型如果在安全测试中表现良好,并不必然意味着它真的安全——它可能只是专门学会了如何通过该测试。Palisade Research 战略负责人 John Steidley 举了一个"关闭抗性基准"(shutdown resistance benchmark)的例子,该基准用来衡量 AI 在特定情境下是否抗拒被关闭。

Steidley 将其与大众"排放门"丑闻相提并论:"如果 AI 是专门被训练来在此基准上表现良好,那这就非常值得关注了——就像大众的车型被编程为识别排放测试状态、在测试条件下切换到不同运行模式。" Gleave 还指出,实质性的访问权限可以延伸到模型之外:评估机构应被允许约谈公司员工,核查公司对外公开的安全实践描述与内部实际做法是否一致。

Amodei 的提案与历史教训

Amodei 确实在文中勾勒了一个相当完整的框架,可能给予评估机构所认为必要的那种访问权限——包括在未经 Anthropic 编辑控制的情况下,"发布关于风险等级、事件、实践以及所获(或未获)访问权限的关键发现"的权利。

但评估机构方面表示,这套机制要真正运转,AI 公司必须真正愿意放弃对流程的控制权。过往的独立评估经历表明,这种放权并不容易争取到:第三方机构在与开发商的合作中经常遇到访问受限、时间紧张、保密协议以及公开内容受限等方面的摩擦。

Gleave 透露,FAR.AI 此前曾不得不拒绝与多家前沿开发商签约,因为对方要求对评估过程拥有过多控制权,威胁到了机构的独立性。在他看来,评估机构在默认情况下往往被视为普通承包商:受到严格 NDA 约束,且协议赋予开发商对最终发布内容相当大的审批权。

Anthropic CEO 阿莫代伊呼吁的头号建议,背后是一场关于 AI 安全评估话语权的博弈。

自愿框架的困境

多位研究人员向 TechCrunch 表示,业界需要一个透明且公开发布的评估框架。安全公司 X-59 研究员 Claire Steidley 指出,框架应明确规范企业可以依赖何种类型的审计机构,否则企业可以寻找不够资质或不愿评估最严重风险的评估方来规避问题。

Safer AI 执行董事 Henry Papadatos 认为,即使有了公开框架,自愿措施始终取决于企业的善意。他对 TechCrunch 表示:

"理想情况下,我们希望有强制性法规来推动这件事……因为这样一来,即使企业明天遭遇重大公关危机,也无法随意改变立场。"Papadatos 补充道,强制性法规还能确保所有企业而非仅最有意愿的企业遵守规则。

大型实验室的站队分歧

并非所有企业都已表态。目前,Meta、SpaceX AI 和 Google DeepMind 尚未承诺引入第三方评估机构。不过,DeepMind CEO Demis Hassabis 已提议建立独立的行业标准机构来测试前沿模型。Google、OpenAI 和 Anthropic 则已私下讨论数周的 AI 安全计划。

立法进展:加州与欧盟路径

部分立法已将第三方评估机构纳入框架: 加州

  • 去年签署的 SB 53 要求大型前沿 AI 开发商发布安全框架并报告重大安全事件
  • 本月签署的 SB 813 创建了州级"独立验证组织"框架,授权具有 AI 风险评估专业能力的机构参与

欧盟

  • EU AI Act 要求前沿开发商开展并记录模型评估与对抗性测试,同时报告重大安全事件
  • EU AI Office 也可自行开展评估并指定独立专家参与

问责之争

目前,法律对阿莫代伊所提建议的覆盖范围仍有限,前沿实验室在多大程度上接受独立审核&查验,基本取决于自身选择。Papadatos 指出:

"你不能两面都占——一边对外宣称'零问责',一边又说'我只需遵守自己灵活的规则'。"

自愿自我监督&管理好过无所作为,但企业若既想掌控自身安全规则的制定权,又要求公众信任其正在遵守规则,这本身就是一个根本矛盾。

Demis Hassabis proposes independent industry standards body

延伸阅读

 
内容管家

发表评论