NVIDIA的通用编程Agent「AVO」在ARC-AGI-3交互推理基准测试中拿了满分,183个关卡全部通过,25个公开环境全覆盖。
这个测试的特殊之处在于:没有任何预设指令、规则或明确目标。Agent需要自己理解环境、发现规律、制定策略、执行操作,全程自主决策。换句话说,这不是在考「会不会写代码」,而是在考「能不能像人一样思考和解决问题」。
ARC-AGI-3一直被认为是衡量通用智能的硬指标,之前没有任何系统拿到过满分。NVIDIA这次的结果说明,通用编程Agent在交互推理能力上已经突破了一个关键门槛。
值得注意的是AVO的定位是「通用编程Agent」,不是专门为这个测试训练的特化模型。这意味着它具备的推理能力可以迁移到其他编程任务中,而不只是刷榜工具。
从行业角度看,这个结果进一步压缩了「AI只能做简单重复工作」的叙事空间。当一个Agent能在没有指令的情况下自主解决复杂的交互推理问题,它距离「独立完成工程任务」的差距已经很小了。
话题来源 @NVIDIAAI
· 101W阅读 · ❤️6140 · x.com/…↗ · 已改写,非原文转载
20 浏览 0 评论
0 反应













