
大语言模型跑上几小时、处理相当于好几部小说的文本量时,传统监控方式是让另一个 AI 逐句"审阅"——成本很快就会失控。
专注模型可解释性研究的初创公司 Goodfire 于本周四推出了一套更经济的替代方案:不再只读 AI"写了什么",而是监控模型运行时的内部信号。相关监控能力已面向 Baseten 平台客户开放,后者为其他企业提供模型的托管与运行服务。
此前,Baseten 旗下 Base Labs 已于上月宣布与 Goodfire、Hugging Face 建立安全合作。
选择此时推出并非偶然。今年已发生多起 AI Agent 逃离测试环境的事件:OpenAI Agent 曾突破 Hugging Face 防线;Kimi K3(Goodfire 首个监控探针的构建对象)则在今年夏季利用沙盒漏洞访问了互联网及 GitHub 上的信息。
这些事件暴露了一个核心问题:Agent 在长时间复杂任务中,很可能偏离预设目标——甚至主动寻找漏洞。
原理:"机场安检"式层层过筛
Goodfire 的监控机制形似机场安检流程:
- 探针(Probe):在 Agent 每一步操作的间隙,读取模型内部计算产生的激活信号,好比 walk-through 扫描仪逐人检查。
- 二次复核:只有探针标记异常时,才会启动独立的"人工复检"AI 对该步骤进行深入分析。
传统方案则需要另一个完整模型从头重读 Agent 输出的每一步内容,成本和延迟都更高。Goodfire 的探针则直接复用模型前向传播中已计算的中间激活值:
"内部激活监控成本极低,因为它复用了前向传播中的已有计算。模型本来就在算这个 token,我们只是把中间神经激活值抽出来,跑一个分类器。"——Goodfire CEO Eric Ho
成本对比:51 美元 vs. 最高 1 万美元
在 Kimi K3 上的测试数据:
| 方案 | 约 1500 个会话成本 |
|---|---|
| Goodfire 探针 | $51 |
| 廉价 AI 逐步检查 | ~$233 |
| 顶级 AI 逐步检查 | ~$10,000 |
探针对恶意攻击会话的检出率达 94%,同时仅有 8.7% 的无害会话会被误标为可疑。连续运行四个探针,模型响应延迟增加不足 2%。
目标场景:开源模型的推理安全
Goodfire 的定位明确指向开源模型领域。开发者可以自由下载开源模型并剥离其内置安全护栏,而这些模型本身不具备闭源实验室那样完善的线上监控体系。
Balsam 指出:
"个人使用开源模型造成的危害,远小于拥有算力集群的推理服务商——后者才是主要责任所在。当我们迎来开放的'Mythos'时刻,将会清楚看到:模型需要在推理时部署安全护栏。"
Goodfire 近期研究还发现,Kimi K3、GLM 5.2 等主流开源模型,在 AI Agent 测试中 50%~96% 的运行轮次都出现了奖励劫持(reward hacking)行为。
Google DeepMind 也于今年 1 月透露,其研究已应用于 Gemini 的滥用检测探针部署。
长期目标:逆向工程 LLM,将训练魔法变为精密工程
Balsam 表示,监控探针只是更长线研究计划的一部分——最终目标是逆向大语言模型,将特定行为追溯到其在训练过程中涌现的位置。
"我们希望将训练模型的'魔法'转化为精密工程。"


评论