Nvidia 新研究:AI 框架让模型性能提升 3 倍

内容管家 AI领域评论0字数 892阅读2分58秒阅读模式
Nvidia 新研究:AI 框架让模型性能提升 3 倍

Nvidia 上周五发布了一项有意思的研究:对于需要长时程决策的 AI 代理任务而言,框架(Harness)比底层模型本身更重要

研究结论:框架让分数从 30% 飙升至 100%

Nvidia 研究团队使用自研框架 Agentic Variation Operators(AVO),对 Claude Opus 5 进行测试。结果显示:

  • 无框架裸跑:Opus 5 在 ARC-AGI-3 推理基准上得分 30%,已是所有测试模型中的最高分。
  • 加装 AVO 框架后:同一模型得分跃升至 100%——满分。

ARC-AGI-3 是一个由多个无说明文字的 2D 小游戏组成的交互推理基准,模型需自主探索规则并通关。满分意味着 AI 在这类任务上达到了人类水平。

框架的核心作用:记忆、上下文与反馈

研究团队指出,框架的本质功能有三项:

  • 记忆管理:在长时程任务中保持状态连贯,避免上下文断裂。
  • 上下文维护:持续向模型传递任务进度与环境信息。
  • 反馈机制:根据执行结果动态调整下一步行动。

Nvidia AI 部门产品副总裁 Adel El Hallack 打了个比方:

"外界普遍把代理理解成模型的 API,但实际上代理 = 模型 + 框架(harness)+ 运行时及配套的技能与库。"

他认为多数用户目前只用到单层框架(Claude Code、Codex、Hermes 等),而真正高效的代理系统需要更复杂的架构。

Supervisor 机制:给 AI 配一个"监工"

AVO 框架的关键创新在于引入了一个 Supervisor(监督组件)。它的作用类似公司里的 CEO:

  • 当主代理偏离方向时,将其拉回正轨。
  • 当主代理走入死胡同时,提醒切换路径。
  • 当主代理遗漏已探索过的可行路径时,推动重新尝试。

El Hallack 表示:"引入监督代理比单纯改进主代理要有趣得多。"

行业印证:OpenAI 和 Databricks 也得出了相同结论

这一结论并非孤证:

  • OpenAI 此前因旗下模型在 ARC-AGI-3 上得分不足 10% 而备受困扰。今年 7 月该公司研究发现,仅调整框架的两项设置,就让旗下模型分数提升了两倍——但仍未触及 100%。
  • Databricks 7 月发布的编程代理基准测试表明,在同一模型下,使用不同框架可将 AI 成本相差两倍。CEO Ali Ghodsi 直言:"你以为模型有贵有便宜,但实际上框架选错,成本直接翻倍。"

Nvidia 的立场:开源框架让用户掌握更多主动权

Nvidia 强调此次公布的不是商业产品,而是围绕 NeMo 品牌 开源释放的一系列框架构建组件(部分商业化),供生态开发者自由组合。

El Hallack 认为:

"开源框架允许你转动更多旋钮来提升准确率。相比将控制权集中于模型训练层,拥有开放的代理技术栈——包括框架、基础设施和运行时——才是安全推进生态的正道。"

延伸阅读

 
内容管家

发表评论