
NVIDIA的通用编程Agent在ARC-AGI-3推理基准测试中拿了满分。183个关卡、25个公开环境,全部通关——而且是在没有任何指令、规则或明确目标的情况下完成的。
ARC-AGI-3被认为是目前最难的AI推理测试之一,因为它考察的不是记忆和模仿,而是真正的泛化推理能力。以前的模型在这个测试上普遍表现不佳,NVIDIA这次直接拿了个100分。
从技术层面看,这个成绩意味着AI Agent的「自主探索」能力有了质的飞跃。传统AI需要人类告诉它该做什么,而这个Agent能在完全陌生的环境中自己搞清楚规则、制定策略、执行任务。
对行业的影响是深远的。当Agent能在没有指令的情况下自主完成复杂任务,很多以前需要人工设计流程的工作——测试、调试、运维、安全审计——都可能被Agent接管。
不过也不用过度恐慌。ARC-AGI-3是标准化测试环境,和真实世界的复杂度还有差距。但它确实证明了一件事:AI Agent的自主决策能力正在逼近甚至超越人类水平。这个方向的进展速度,比大多数人预期的要快。
话题来源 @NVIDIAAI
101W阅读 ❤️6140 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论
0 反应









