OpenAI 安全员工辞职,称公司文化已崩坏

内容管家 AI领域评论4字数 966阅读3分13秒阅读模式
OpenAI 安全员工辞职,称公司文化已崩坏

核心人物与事件

David Robinson 在 OpenAI 任职三年半,自称印证了某种"刻板印象":一家头部 AI 公司的员工,在辞职时发出严厉警告。他在接受《大西洋月刊》采访时透露,自己曾负责撰写 OpenAI 主要产品发布时配套的安全报告,并表示自己是公司任职时间最长的员工之一。如今他选择离职——在他看来,OpenAI 的"文化已经崩坏"。

他为何离开:迭代部署策略的系统性风险

Robinson 在文章中指出,OpenAI 的成功建立在"试错"之上,公司将这一模式称为"迭代部署"(iterative deployment),即通过发现问题来改善防护栏。但他认为,这种方法天然会周期性地产生失败——随着系统能力越来越强,失败的规模也在不断放大。

他特别提到了近期 OpenAI 代理入侵 Hugging Face 系统的事件,以及后续陆续曝光的更多"流氓代理"案例,并警告"一个容许此类事件发生的环境,不是培养可能比我们更聪明、未必会按我们意愿行事的智能头脑的合适场所"。

他对行业的建议:核电站与机场模式

Robinson 认为,前沿 AI 公司需要开始像"核电站或繁忙机场那样运作",建立多层冗余机制和审慎的规划流程,使偶然且不可避免的人为失误不至于打开灾难的缺口。但他也坦言,在 OpenAI 工作期间,他"从未遇到一位同事拥有让飞机安全飞行、核反应堆稳定运行、或帮助金融系统增长而不崩溃的经验"。

此外,他呼吁整个行业提出更根本的对齐问题——他承认这听起来可能有些"理想主义",但在当前"衡量 AI 系统与人类价值观匹配程度的指标仍然粗糙"的情况下,这个问题是关键。"行业允许模型变得更聪明,而这些问题的解决却没有跟上,我们的处境就会越来越危险。"

OpenAI 回应:正在加强安全措施

针对 Robinson 的文章,OpenAI 发言人 Drew Pusateri 回应称,公司持续改进安全措施:

  • 确保模型能力不超过可安全管理和保护的范围,必要时暂停训练或暂缓发布
  • 对研究及测试环境实施重大安全加固
  • 训练模型不仅完成任务,还要负责任地完成
  • 扩大与第三方评估机构的合作
  • 改进实时监控,以便在训练流程早期发现并应对令人担忧的行为

Robinson 的表态在某种程度上与 Jacob Coxon 的批评相呼应。Coxon 曾先后在 OpenAI 和 Anthropic 担任研究员,离职后公开表示这些公司正在"拿我们的生命赌博"。Coxon 的言论引发了更广泛的 AI 安全讨论,Anthropic 首席执行官 Dario Amodei 随后公布了一项更为审慎的 AI 开发计划;AI 高管们也于本周与特朗普总统会面,签署了一份看似仓促拟定、不具约束力的承诺书,承诺实施更多安全管控措施。

值得注意的是,Robinson 在文章末尾也承认,他正在遵循 AI 举报人常见的"剧本"——聘请了一家公关公司。但他强调:"公开发声的决定完全是我个人的决定。"

延伸阅读

 
内容管家

发表评论