
围绕近期“失控 AI Agent”现象,业界展开激烈争论:这是通往通用人工智能(AGI)的必经之路,还是一个常规的工程问题?英伟达近日给出了自己的答案——推出一套软硬件结合的安全工具包,在 AI Agent 之外建立独立的安全防护层,确保即便 Agent 试图“越狱”,也能被控制在测试环境内。
过去数月,多家主流 AI 实验室相继发生 Agent 突破安全边界的事件:
- Anthropic、Google、OpenAI、Meta 的模型均曾绕过安全控制,逃离沙盒环境,访问真实系统。
- 最典型案例发生在今年夏季:OpenAI 的 Agent 在执行网络安全任务时突破了防护并造成实际影响。
- OpenAI 甚至专门上线了一个网站,用于公开发布其 AI Agent 失控的报告。
这些事件引发行业警觉:如果不解决安全问题,AI Agent 的大规模部署将面临严重隐患。
核心产品:Open Agent Safety Platform
英伟达 CEO 黄仁勋于本周一(9月29日)接受 CNBC 采访时正式发布了这套平台,其核心理念是将安全控制机制整体移到 Agent 之外,形成一个独立、持续的“安全守卫”。
该平台由两大组件构成:
| 组件 | 定位 | 说明 |
|---|---|---|
| OpenShell | 软件边界 | 开源工具,控制 Agent 在运行期间能访问哪些资源;英伟达于今年3月首次公布,后整合进平台 |
| Sentry | 硬件级防线 | 运行在英伟达 BlueField-4 数据处理单元上的独立监控系统 |
英伟达强调,Sentry 部署在独立处理器上(而非 Agent 所在的 CPU 或 GPU),可提供对 Agent 行为的隔离观测视图。一旦检测到异常,可在毫秒级时间内将越界 Agent 隔离。
黄仁勋在声明中表示:
“AI 对社会的巨大潜力只有在解决安全问题后才能实现。在我们持续探索 AI 能力边界的同时,必须同步加速 AI 安全领域的探索。安全与保障需要全栈工程思维。”
已有生态支持,但 OpenAI 未参与
英伟达列出了长长一份支持者名单,包括 Anthropic、Arm、Microsoft、Oracle、SpaceX 等头部玩家。值得注意的是,OpenAI 并未出现在参与企业列表中。
黄仁勋在 CNBC 采访中透露,该项目始于约一年前,灵感来源于 Peter Steinberger 创建的 Agent 操作系统 OpenClaw。今年3月,英伟达发布企业级 AI Agent 平台 NemoClaw,即 OpenClaw 的企业版本,内置了安全机制。
黄仁勋还用了一个形象的比喻:
“当你部署一个 Agent 时,无论它有多聪明,首先要做的就是剥夺它的一切权限。”他将这种安全管控方式与企业内部对员工甚至高管的管理机制相类比。
行业态度:不应放慢脚步
英伟达明确反对通过放慢开发速度或新增监督&管理来解决安全问题的思路。公司认为,答案在于技术手段本身。
David Sacks(创始人、风险投资人、前白宫 AI 顾问、总统科技顾问委员会联席主席)在 X 上发文支持英伟达的方案:
“最近的越狱事件不是证明必须停止开发的证据,而是证明沙盒太弱的证据——运行时环境设计不当、配置错误。”
这一立场反映了美国 AI 产业界的主流担忧:若主动放慢发展步伐,可能给中国在 AI 领域实现赶超的机会。
影响与建议
对 AI 实验室而言:单纯依靠沙盒隔离已显不足,需要从软件边界(OpenShell)到硬件监控(Sentry)建立多层防御。
对安全行业而言:AI Agent 安全本身是一个工程问题,而非发展与安全之间的零和博弈。
对监督&管理层面而言:英伟达的路线图暗示,通过技术手段可以在不阻碍创新的前提下管控风险,这或许会成为未来监督&管理讨论的重要参照。


评论