NVIDIA的通用编程Agent在ARC-AGI-3交互推理基准测试上拿了满分,183个关卡全部通过。
ARC-AGI-3是一个专门测试AI推理能力的基准,包含25个公开环境,每个环境都有多个关卡。关键在于这些关卡没有明确的指令、规则或目标,AI需要自己观察、推理、找出解决办法。
NVIDIA AVO在没有任何预设提示的情况下,完成了所有183个关卡。这说明它不只是在执行指令,而是在真正地理解环境、推理策略、然后行动。
这个结果的意义在于,编程Agent已经不只是写代码了。ARC-AGI-3测试的是通用推理能力,也就是AI面对未知问题时自己想办法解决的能力。NVIDIA AVO能拿满分,意味着它在理解和解决复杂问题方面已经达到了很高水平。对于AI Agent开发者来说,这意味着通用推理能力正在变得越来越可靠,未来更多需要自主决策的场景可以放心交给Agent去做。
话题来源 @NVIDIAAI
· 102W阅读 · ❤️6141 · x.com/…↗ · 已改写,非原文转载
21 浏览 0 评论
0 反应













