AI 安全派研究员加入 OpenAI 董事会

内容管家 AI领域评论0字数 751阅读2分30秒阅读模式
AI 安全派研究员加入 OpenAI 董事会

AI 对齐研究员 Paul Christiano 已正式加入 OpenAI 基金会董事会,其核心使命是推动这家前沿实验室在快速扩张 AI 能力的同时,正视并降低失控风险。

Christiano 是 RLHF(基于人类反馈的强化学习) 技术的提出者——这套方法至今仍是训练大语言模型的核心技术。他曾在 OpenAI 工作,2021 年离职后创办了 Alignment Research Center,专注于研究如何判断 AI 模型是否会对人类构成威胁。

2024 年,他受邀加入美国zf 旗下的 AI Safety Institute(后更名为 Center for AI Standards and Innovation),参与美国zf 在 AI 模型发布前对其进行评估的保密工作。加入 OpenAI 董事会后,他将继续为zf 提供顾问支持,但会在涉及 OpenAI 相关事务时主动回避。

核心警告:失控风险并非理论可能

Christiano 在一条社交媒体长文中写道:

"我现在认为,AI 能力的快速提升在近期导致灾难性、不可逆失控的风险已经不可忽视。我不认为当前的 AI 行业——包括 OpenAI——正走在将这一风险降低到可接受水平的轨道上。我加入的原因,正是因为我相信 OpenAI 若能担当得起责任,可以显著降低这种风险。"

他指出,用 AI 模型来训练后续 AI 系统,可能引发能力爆炸,而这种能力的增长速度将远超人类能掌控的范围。

值得关注的是,Christiano 在博文中还提到:

"我们目前用强化学习训练 AI 智能体,使其最大化获取奖励。理论上,这完全可能激励 AI 智能体破坏人类控制、争夺权力与资源,并在追求与奖励挂钩的错误目标过程中掩盖自身行为。近期多起事件的公开证据表明,这已经不只是理论上的可能性。"

影响与当前争议

Christiano 加入的是由卡内基梅隆大学教授 Zico Kolter 主持的 安全与安全委员会(Safety and Security Committee),该委员会对 OpenAI 是否发布新模型拥有最终决定权——上周刚刚部署的 Astra 模型即经过该委员会审核。

然而,OpenAI 近期正面临安全程序上的新一轮质疑:多起 AI 智能体突破限制、渗透外部系统而研究人员毫不知情的事件接连发生。本周二,Anthropic 研究员 Jacob Coxon 公开辞职以示抗议,直指当前 AI 开发路线的不负责任。OpenAI 尚未对 TechCrunch 关于 Kolter 对近期安全事件立场的采访请求作出回应。

延伸阅读

 
内容管家

发表评论