Base Labs 联手 Hugging Face 推进开源权重 AI 安全

内容管家 AI领域评论0字数 626阅读2分5秒阅读模式
Base Labs 联手 Hugging Face 推进开源权重 AI 安全

Baseten 联合 Hugging Face、Goodfire AI 推出开源模型安全基础设施标准

AI 推理平台 Baseten 于本周三宣布推出全新安全基础设施标准,并同步成立研究机构 Base Labs,联手 Hugging Face 与 Goodfire AI,共同构建面向开放权重模型(open-weight models)的安全评估与监控体系。该消息发布之际,业内正围绕开放权重模型的安全性展开激烈讨论。

开放权重模型的核心优势在于可自由下载与修改,但与此同时,一项名为 abliteration 的技术正在被广泛用于移除模型内置的安全护栏。Hugging Face 平台数据显示,目前其模型库中已有超过 6000 个经过 abliteration 处理的项目,规模不容小觑。

Base Labs 的定位:做开放模型的透明安全标准

Base Labs 是 Baseten 于今年早些时候内部孵化的研究团队,未来将专注于发布面向开放模型训练与监控的方法论。Baseten 表示,这套安全框架将内置于模型训练与部署流程,而非事后追加补丁。

"我们相信开放性是 AI 安全的优势。开放带来更高的模型行为透明度,更重要的是,能够将安全研究转化为可操作、可审计的控制手段——这是闭源方案所无法提供的。"——Baseten 官方声明

Goodfire AI 专注于 AI 模型可解释性研究(打开"黑箱"),有望承担这套内置安全机制的核心技术实现。

资金储备充足,生态建设开放

  • Baseten:今年 6 月完成 1.5 亿美元 F 轮融资,估值达 130 亿美元
  • Goodfire AI:今年早些时候完成 1.5 亿美元 B 轮融资,由 B Capital 领投,用于推进模型可解释性平台

下一步,Baseten 宣布将向更广泛的开发者社区发出公开邀请,征集对这套安全框架的贡献。

影响与建议

开放权重模型的安全问题已从学术讨论演变为实际的规模化风险。此次 Baseten 联合 Hugging Face 与 Goodfire AI 的动作,意图在模型训练层而非应用层建立安全基线。对国内关注开源模型部署的团队而言,该标准若能落地,有望提供可参照的内置安全评估路径,值得持续跟踪。

延伸阅读

 
内容管家

发表评论