时间
2026 年 8 月 21 日(北京时间 8 月 22 日凌晨),Nvidia 在开发者博客正式公布 Agentic Variation Operators(AVO)研究论文与 ARC-AGI-3 基准测试结果。研究论文 arXiv 编号 2603.24517。
地点
全球范围公布,核心实验在 Nvidia AI 部门进行;基准测试结果由 ARC Prize 独立验证并由第三方科技媒体 TechCrunch、Linxi News、CoinDesk 等同步报道。
人物
- Adel El Hallack,Nvidia AI 产品副总裁,是本次研究的对外发言人
- ARC Prize 团队,ARC-AGI-3 基准的设计与维护方
- Anthropic 团队,Claude Opus 5 的提供方,本研究中作为底层模型被调用
- OpenAI 团队,因前期在 ARC-AGI-3 上得分不足 10% 而被本次研究"针对性"对比
事件详情
Nvidia 用 Claude Opus 5 作为底层模型,配合自研的 Agentic Variation Operators(AVO)自定义 Harness,在 ARC-AGI-3 交互式推理基准上拿到 100% 完美得分。
具体细节:
- AVO 包含持久记忆、监督代理(supervisor)和反馈循环三大组件
- 共完成 25 个环境、183 个关卡,使用 6624 次环境动作
- 比此前的 SOTA 系统 VISTA 少用约 12% 环境动作(VISTA 用 7542 次)
- 同样使用 Claude Opus 5,去掉 Harness 后得分从 100% 跌至 30%
- 该 30% 已经是所有裸模型测试中的最高分
Nvidia 还做了交叉实验:把 AVO 套在 OpenAI 的 GPT-5.6 Sol 上跑部分关卡,Sol 在某些关卡用时更短,Opus 5 在动作数上更省,两类前沿模型呈现互补特征。
背景
ARC-AGI-3 是一套 2D 游戏形式的无说明交互推理基准,要求 AI 像人类一样自行探索环境、发现规则并取胜,是当前公认的智能体长程任务难度天花板。
行业近期对 Harness 价值的认知迅速升温:
- OpenAI 此前模型在 ARC-AGI-3 上得分不到 10%,后通过两个 Harness 设置微调使分数翻三倍
- Microsoft 4 月研究显示,19 款主流 LLM 在长程文档编辑任务中均产生大量错误
- Databricks 7 月研究指出 Harness 选择可使 AI 推理成本最高相差 2 倍
- Anthropic Claude Code、OpenAI Codex、DeepSeek Harness 均属于 Harness 层代表产品
影响
- 进一步证实"Harness 决定上限、模型决定基线"的行业判断
- 把 AI 智能体竞争焦点从参数规模推向工程层与运行时
- Nvidia 通过 Nemo 品牌持续输出开源 Harness 组件,强化软硬一体护城河
- 给闭源厂商带来开放策略压力,倒逼 Anthropic、OpenAI 思考 Harness 透明度
总结
- Harness 而非底层模型,是 AI 智能体可靠性的真正决定因素
- 100% 的 ARC-AGI-3 得分由系统架构而非模型智能单独实现
- 这不是 Nvidia 商业产品,是研究展示,但传递的信号非常明确:Agent 竞争进入"调度层 + 工具层"工程化时代
- 业内玩家(DeepSeek、OpenAI、Anthropic)都已押注 Harness 路线,下一步看谁能做出更可靠的运行时
参考来源
1. TechCrunch(原始报道): https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/
2. Nvidia 开发者博客(论文与官方说明): https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
3. CoinDesk(基准细节): https://coindesk.cc/nvidia-s-avo-agent-completes-arc-agi-3-benchmark-with-100-success-rate-103821.html
4. Linxi News(综合分析): https://news.linxi.com.au/news/nvidia-research-suggests-ai-harness-outperforms-model-choice-in-long-horizon-tasks
5. Omega Technology(架构解读): https://www.omegatechnologysolutionsgroupinc.com/blog/nvidias-avo-agent-scores-100-on-arc-agi-3-benchmark-cc6c6c
6. explainx.ai(Codex Harness 对比): https://explainx.ai/blog/codex-as-a-platform-open-agent-harness-august-2026
7. FrontierNews.ai(DeepSeek Harness 战略): https://www.frontiernews.ai/news/article/deepseeks-modular-harness-strategy-signals-a-shift-d02b7774









