Anthropic 研究员展示自我改进 AI 研究进展

内容管家 AI领域评论1字数 500阅读1分40秒阅读模式
Anthropic 研究员展示自我改进 AI 研究进展

Anthropic 近日发表了一篇新论文,展示了 AI 系统自主改进模型对齐表现的可能性。研究团队开发的自动化对齐研究员(Automated Alignment Researcher,AAR)在 10 项特定行为偏差基准测试中均实现了提升,且未出现整体性能下降。论文认为,这一成果表明自动化对齐后训练可能在近期变得实用。

AAR 如何工作

该系统由 Anthropic Fellow 陈约汉(Chen Yueh-Han)主导,复现了传统研究流程的主要环节:每个自动化系统首先检索现有文献,提出改进方法,随后用该方法对模型进行 30 分钟训练,并在多次迭代中逐步提升基准难度。有效的方案被保留,低效的则被丢弃,使系统得以快速、大规模地运行。

性能对比与成本

论文毫不回避地将其与人类研究员直接对比:

  • 最佳 AAR 方法平均在 6 小时内超越人类资深研究员的提案水平
  • 人类引导的研究方向未能带来更强的表现

成本差异同样显著:AAR 每小时 API 推理成本约 4 美元,而人类研究员每小时的薪酬支出约为 150 美元

论文也坦承局限:AAR 的有效性取决于基准能否真实反映对齐目标,而建立和维护这些基准本身仍需大量工作——同时还要持续维护和扩展自动化研究员所依赖的文献库。

迈向递归自我改进

该研究被视为通往递归自我改进(recursive self-improvement)的一步。若模型能够自主改进自身的对齐训练,进一步改进更广泛训练实践的可能性也将随之打开,人类 AI 研究员的角色将面临根本性重估。

延伸阅读

 
内容管家

发表评论