
Nvidia 上周五发布了一项有意思的研究:对于需要长时程决策的 AI 代理任务而言,框架(Harness)比底层模型本身更重要。
研究结论:框架让分数从 30% 飙升至 100%
Nvidia 研究团队使用自研框架 Agentic Variation Operators(AVO),对 Claude Opus 5 进行测试。结果显示:
- 无框架裸跑:Opus 5 在 ARC-AGI-3 推理基准上得分 30%,已是所有测试模型中的最高分。
- 加装 AVO 框架后:同一模型得分跃升至 100%——满分。
ARC-AGI-3 是一个由多个无说明文字的 2D 小游戏组成的交互推理基准,模型需自主探索规则并通关。满分意味着 AI 在这类任务上达到了人类水平。
框架的核心作用:记忆、上下文与反馈
研究团队指出,框架的本质功能有三项:
- 记忆管理:在长时程任务中保持状态连贯,避免上下文断裂。
- 上下文维护:持续向模型传递任务进度与环境信息。
- 反馈机制:根据执行结果动态调整下一步行动。
Nvidia AI 部门产品副总裁 Adel El Hallack 打了个比方:
"外界普遍把代理理解成模型的 API,但实际上代理 = 模型 + 框架(harness)+ 运行时及配套的技能与库。"
他认为多数用户目前只用到单层框架(Claude Code、Codex、Hermes 等),而真正高效的代理系统需要更复杂的架构。
Supervisor 机制:给 AI 配一个"监工"
AVO 框架的关键创新在于引入了一个 Supervisor(监督组件)。它的作用类似公司里的 CEO:
- 当主代理偏离方向时,将其拉回正轨。
- 当主代理走入死胡同时,提醒切换路径。
- 当主代理遗漏已探索过的可行路径时,推动重新尝试。
El Hallack 表示:"引入监督代理比单纯改进主代理要有趣得多。"
行业印证:OpenAI 和 Databricks 也得出了相同结论
这一结论并非孤证:
- OpenAI 此前因旗下模型在 ARC-AGI-3 上得分不足 10% 而备受困扰。今年 7 月该公司研究发现,仅调整框架的两项设置,就让旗下模型分数提升了两倍——但仍未触及 100%。
- Databricks 7 月发布的编程代理基准测试表明,在同一模型下,使用不同框架可将 AI 成本相差两倍。CEO Ali Ghodsi 直言:"你以为模型有贵有便宜,但实际上框架选错,成本直接翻倍。"
Nvidia 的立场:开源框架让用户掌握更多主动权
Nvidia 强调此次公布的不是商业产品,而是围绕 NeMo 品牌 开源释放的一系列框架构建组件(部分商业化),供生态开发者自由组合。
El Hallack 认为:
"开源框架允许你转动更多旋钮来提升准确率。相比将控制权集中于模型训练层,拥有开放的代理技术栈——包括框架、基础设施和运行时——才是安全推进生态的正道。"


评论