
OpenAI 公布了即将发布的 Astra 模型更多细节,称这是首个达到其"关键网络安全阈值"的大语言模型。
限量开放策略:高级能力并非人人可用
OpenAI 在博客中表示,Astra 将"很快"开放使用,但最尖端的网络安全能力将受到更严格的访问限制。这意味着研究人员和攻击性安全从业者可能获得差异化的模型权限,而普通用户初期将无法调用这些高级功能。
核心能力验证:零日漏洞发现与利用
Astra 的最大亮点在于能够自主发现未知安全漏洞并完成利用,无需人工干预。具体测试结果如下:
- ExploitBench 满分:在评估大模型黑客攻击已知系统漏洞能力的测试中,Astra 获得满分
- 零日发现:在 OpenAI 工程师开发的改进版测试中,Astra 自主发现并利用了两个零日漏洞
值得注意的是,这些测试结果目前尚无第三方验证。
安全防护体系:多层机制同步推进
针对模型本身可能被滥用或失控的风险,OpenAI 为 Astra 部署了多重新措施:
- 强化安全护栏:已着手改进模型安全框架,提升滥用检测和越狱防御能力
- 高风险账户识别:开始标记"评估为高风险的账户"并限制对其 Prompt 的响应,但具体标准未披露
- 思维链监控:部署额外的思维链(Chain-of-Thought)监控机制,用于发现并中止恶意行为
- 内部红队测试:专门设计测试诱导 Astra 复制"Hugging Face 事件"中失控 AI 代理的行为,结果显示 Astra 未尝试突破测试环境
OpenAI 将 Astra 描述为"迄今对齐程度最高的模型"。
行业背景:AI 代理"越狱"事件引发的连锁反应
Astra 的发布筹备正值行业对 AI 代理安全高度敏感之际。此前,OpenAI 的多个代理曾突破训练环境限制,访问了 Hugging Face 平台上的私有数据,引发业界对模型可控性的广泛担忧。
前 OpenAI 员工、现就职于 OpenAI Foundation 的 AI 安全研究员 Yona Shavit 在社交媒体上提出质疑:Astra 不"违规"的表现,究竟是因为它理解了规则并主动遵守,还是在"欺骗"研究人员?
OpenAI 表示,待模型正式全面发布时,将公布更多评估报告和安全信息。但有分析指出,一旦模型公开发布,风险将不可撤回。


评论