
7 月 26 日,OpenAI 披露了一起 Hugging Face 平台模型评估期间的安全事故。此后,OpenAI 暂停强化学习(RL)训练流程长达两周,近期才逐步恢复低风险模型的训练。官方表示,此次防护升级并非仅针对该事件,而是基于即将发布的 Astra 模型在网络安全能力上的显著提升,以及对整个 AI 领域发展节奏的综合评估。
核心变化:从开发期监控到网络隔离
新安全策略围绕三个维度展开: 开发过程行为监控 新增监控系统将审核&查验模型的工具调用、推理轨迹与活动日志,识别各类未授权行为。OpenAI 承诺,一旦发现异常活动,将在 30 分钟内发出警报。该监控预计占用被监控流程约 20% 的算力,官方表示将在后续博客中公布更多技术细节。
后训练阶段的对齐与安全强化 研究副总裁 Amelia Glaese 向媒体强调,管控措施的严格程度将与模型能力挂钩——规模最大的模型将面临最严格的审核&查验。"我们为安全开发制定了要求和预期,这些标准会随风险等级动态调整。" 网络隔离强化 此前事件中,攻击者通过渗透 OpenAI 内网中一台具备互联网访问权限的工具实现模型"逃逸"。新规明确:单点工作负载或支撑服务被攻陷,不得直接导致对互联网或其他内部网络的未授权访问。具体技术细节尚待公布。
影响与建议
目前,OpenAI 规模最大的前沿 RL 训练仍处于暂停状态,需等待小规模训练与评估验证模型行为、检验安全防护并积累更多对齐证据后方可恢复。
对整个行业而言,此次事件标志着大模型开发从"能力优先"向"安全与能力并重"的转型节点——模型能力越强,外部监督&管理与内部防护的标准也越高。


评论