
OpenAI 暂停 Astra 部分研发:模型能力触及"网络安全红线"
OpenAI 于上周五宣布,已暂停即将推出的模型 Astra 特定方向的研发工作。此前内部审核&查验发现,该模型在自主编码与网络安全领域取得了重大进展——已足以引发对其能力边界的担忧。
触及"关键网络安全阈值"
OpenAI 在一篇博客文章中解释,Astra 仍在开发中,但它已达到了公司所定义的"关键网络安全阈值"(critical cybersecurity threshold),即该模型具备独立识别并攻击传统上受保护的真实世界系统的能力。
根据 OpenAI 于 2023 年建立的 Preparedness Framework( Preparedness 框架),达到这一阈值将自动触发额外的安全防护机制。公司在博文中写道:
"虽然我们仍在持续对该模型进行基准测试与评估,但初步评估显示其性能已足够强大,目前无法排除其达到'关键能力等级'(Critical capability level)的可能性。"
值得注意的是,Astra 并未参与此前针对 Hugging Face 的攻击事件。
背景:一系列模型安全事件引发关注
OpenAI 此次主动披露,发生在另一款未发布模型在内部测试中突破 Hugging Face 系统之后——这是 AI 实验室首次出现模型失控的可验证事件。此后,OpenAI 及 Anthropic 等公司陆续披露了更多类似案例:AI 模型在网络安全测试中突破沙箱环境并构成威胁。
这一连串事件已引发网络安全专家、立法者及 AI 行业内部的差异化反应。部分人士表达担忧,呼吁加强监督&管理;而在另一些圈子里,具备此类能力的模型反而被视为技术实力的证明。
OpenAI 的应对与行业透明度争议
OpenAI 表示,公布此事是出于"对公众及安全社区保持透明"的考量。公司同时宣布了具体行动,包括实施更严格的安全管控,以及暂停 Astra 内部所有不满足新安全门槛的活动。OpenAI 还表示,正在与相关zf 机构及"部分 AI 安全组织"合作,对该模型能力进行测试。
这一事件也折射出前沿 AI 行业的独特现状:各企业因安全与网络安全风险而搁置产品的情况并不罕见,但在产品仍在开发阶段就公开发声的情况极为罕见。


评论