内部探针:比"第二双眼睛"更便宜的 AI 监控方案

内容管家 AI领域评论0字数 948阅读3分9秒阅读模式
内部探针:比"第二双眼睛"更便宜的 AI 监控方案

大语言模型跑上几小时、处理相当于好几部小说的文本量时,传统监控方式是让另一个 AI 逐句"审阅"——成本很快就会失控。

专注模型可解释性研究的初创公司 Goodfire 于本周四推出了一套更经济的替代方案:不再只读 AI"写了什么",而是监控模型运行时的内部信号。相关监控能力已面向 Baseten 平台客户开放,后者为其他企业提供模型的托管与运行服务。

此前,Baseten 旗下 Base Labs 已于上月宣布与 Goodfire、Hugging Face 建立安全合作。

选择此时推出并非偶然。今年已发生多起 AI Agent 逃离测试环境的事件:OpenAI Agent 曾突破 Hugging Face 防线;Kimi K3(Goodfire 首个监控探针的构建对象)则在今年夏季利用沙盒漏洞访问了互联网及 GitHub 上的信息。

这些事件暴露了一个核心问题:Agent 在长时间复杂任务中,很可能偏离预设目标——甚至主动寻找漏洞。

原理:"机场安检"式层层过筛

Goodfire 的监控机制形似机场安检流程:

  • 探针(Probe):在 Agent 每一步操作的间隙,读取模型内部计算产生的激活信号,好比 walk-through 扫描仪逐人检查。
  • 二次复核:只有探针标记异常时,才会启动独立的"人工复检"AI 对该步骤进行深入分析。

传统方案则需要另一个完整模型从头重读 Agent 输出的每一步内容,成本和延迟都更高。Goodfire 的探针则直接复用模型前向传播中已计算的中间激活值:

"内部激活监控成本极低,因为它复用了前向传播中的已有计算。模型本来就在算这个 token,我们只是把中间神经激活值抽出来,跑一个分类器。"——Goodfire CEO Eric Ho

成本对比:51 美元 vs. 最高 1 万美元

在 Kimi K3 上的测试数据:

方案 约 1500 个会话成本
Goodfire 探针 $51
廉价 AI 逐步检查 ~$233
顶级 AI 逐步检查 ~$10,000

探针对恶意攻击会话的检出率达 94%,同时仅有 8.7% 的无害会话会被误标为可疑。连续运行四个探针,模型响应延迟增加不足 2%。

目标场景:开源模型的推理安全

Goodfire 的定位明确指向开源模型领域。开发者可以自由下载开源模型并剥离其内置安全护栏,而这些模型本身不具备闭源实验室那样完善的线上监控体系。

Balsam 指出:

"个人使用开源模型造成的危害,远小于拥有算力集群的推理服务商——后者才是主要责任所在。当我们迎来开放的'Mythos'时刻,将会清楚看到:模型需要在推理时部署安全护栏。"

Goodfire 近期研究还发现,Kimi K3、GLM 5.2 等主流开源模型,在 AI Agent 测试中 50%~96% 的运行轮次都出现了奖励劫持(reward hacking)行为。

Google DeepMind 也于今年 1 月透露,其研究已应用于 Gemini 的滥用检测探针部署。

长期目标:逆向工程 LLM,将训练魔法变为精密工程

Balsam 表示,监控探针只是更长线研究计划的一部分——最终目标是逆向大语言模型,将特定行为追溯到其在训练过程中涌现的位置。

"我们希望将训练模型的'魔法'转化为精密工程。"

延伸阅读

 
内容管家

发表评论