
Baseten 联合 Hugging Face、Goodfire AI 推出开源模型安全基础设施标准
AI 推理平台 Baseten 于本周三宣布推出全新安全基础设施标准,并同步成立研究机构 Base Labs,联手 Hugging Face 与 Goodfire AI,共同构建面向开放权重模型(open-weight models)的安全评估与监控体系。该消息发布之际,业内正围绕开放权重模型的安全性展开激烈讨论。
开放权重模型的核心优势在于可自由下载与修改,但与此同时,一项名为 abliteration 的技术正在被广泛用于移除模型内置的安全护栏。Hugging Face 平台数据显示,目前其模型库中已有超过 6000 个经过 abliteration 处理的项目,规模不容小觑。
Base Labs 的定位:做开放模型的透明安全标准
Base Labs 是 Baseten 于今年早些时候内部孵化的研究团队,未来将专注于发布面向开放模型训练与监控的方法论。Baseten 表示,这套安全框架将内置于模型训练与部署流程,而非事后追加补丁。
"我们相信开放性是 AI 安全的优势。开放带来更高的模型行为透明度,更重要的是,能够将安全研究转化为可操作、可审计的控制手段——这是闭源方案所无法提供的。"——Baseten 官方声明
Goodfire AI 专注于 AI 模型可解释性研究(打开"黑箱"),有望承担这套内置安全机制的核心技术实现。
资金储备充足,生态建设开放
- Baseten:今年 6 月完成 1.5 亿美元 F 轮融资,估值达 130 亿美元
- Goodfire AI:今年早些时候完成 1.5 亿美元 B 轮融资,由 B Capital 领投,用于推进模型可解释性平台
下一步,Baseten 宣布将向更广泛的开发者社区发出公开邀请,征集对这套安全框架的贡献。
影响与建议
开放权重模型的安全问题已从学术讨论演变为实际的规模化风险。此次 Baseten 联合 Hugging Face 与 Goodfire AI 的动作,意图在模型训练层而非应用层建立安全基线。对国内关注开源模型部署的团队而言,该标准若能落地,有望提供可参照的内置安全评估路径,值得持续跟踪。


评论