Anthropic Fable 安全限制过严引网络安全圈不满

内容管家 AI领域评论17字数 800阅读2分40秒阅读模式
Anthropic Fable 安全限制过严引网络安全圈不满

Anthropic 推出 Fable 模型:公开版 Mythos 安全大模型,限制过严引发安全研究员不满

Anthropic 于本周二发布了 Fable 模型——这是其备受关注的网络安全专用大模型 Mythos 的公开受限版本。该公司希望通过 Fable 让更广泛的开发者社区也能接触到这个专为防御场景设计的安全能力。

背景:Mythos 从闭源到有限开放

今年 4 月,Anthropic 发布 Mythos 时,将访问权限限制在少数公司和组织范围内,并启动了名为 Project Glasswing 的合作计划,旨在将模型部署到关键软件与基础设施的防护工作中。上周,Anthropic 将 Mythos 的访问范围扩展至 15 个国家的数百个组织。Fable 则在此基础上进一步降低了使用门槛,但代价是严格的内容安全策略。

核心限制:安全研究员频频"碰壁"

Fable 内置的安全护栏(Guardrails)在检测到与网络安全或生物学相关的话题时,会直接暂停对话并提示"安全措施已标记此消息"。多位安全研究员已在社交平台上表达不满:

  • Valentina "Chompie" Palmiotti(IBM X-Force 安全研究员)指出,Fable 甚至会拒绝"阅读一篇博客文章"这类完全无害的请求,因为它认为这类内容"与网络安全有潜在关联"。
  • Matt Suiche(AI 安全初创公司 Tolmo 技术团队成员)向 TechCrunch 透露,如果你让 Fable「写安全代码」,它会直接判定这属于网络安全工作,而非软件工程最佳实践,从而降级至 Claude Opus 4.8。他补充道:"看起来是关键词触发,任何'网络安全'词域内的词汇都会激活护栏。"
  • 另一位研究员也在 X 上抱怨,连"请求代码审核&查验"这类常规操作都会触发护栏。

这些限制的初衷是防止 Fable 被滥用于开发恶意软件或生物武器——这也是 Anthropic 长期关注的 AI 安全议题。

行业反应:理解但呼吁改进

Suiche 同时也表达了相对宽容的立场:"考虑到我们仍处于早期阶段,护栏还在持续调整中,这是可以理解的。随着 Anthropic 与其他前沿模型公司同新一代网络安全企业加强合作,护栏一定会逐步优化。在发布初期宁可过检,也不要漏检,随后逐步放宽限制——这是更合理的策略。"

官方合规通道:Cyber Verification Program

除模型内置限制外,Anthropic 还要求希望从事网络安全相关工作的专业人士申请加入 Cyber Verification Program(网络验证计划),通过审核后可获得更宽松的使用限制。OpenAI 也推出了类似的项目,名为 Trusted Access for Cyber

Anthropic 尚未就此事向 TechCrunch 作出回应。

延伸阅读

 
内容管家

发表评论