时间:2026年7月26日
地点:美国旧金山
人物:Anthropic公司、ARC Prize Foundation创始人François Chollet
事件详情:ARC Prize Foundation于2026年7月24日公布最新基准结果,Anthropic旗下Claude Opus 5以30.2%得分刷新ARC-AGI-3纪录,成为该基准发布以来的最高分,远超此前由OpenAI GPT-5.6 Sol(Max)保持的7.8%。Opus 5在25个公开Demo环境中成功解开5个此前无人攻克的环境,其中4个达到或超越人类水平,并在测试中首次自主将任务翻译为代数符号、独立推导反思方程。ARC Prize分析认为,Opus 5的优势源于更强的逻辑推理能力,使其能在完全陌生的交互式环境中进行自主探索、规划与执行。
背景:ARC-AGI系列由深度学习先驱François Chollet发起,2026年3月发布最新版ARC-AGI-3,专测AI在未见过问题上的泛化与抽象推理能力。基准发布时Gemini 3.1 Pro仅得0.37%,至7月中旬GPT-5.6 Sol(Max)创下7.8%纪录,Anthropic前代Opus 4.8为1.5%。Opus 5以30.2%创下新纪录,是Opus 4.8的20倍、GPT-5.6 Sol的近4倍,并已超过自家Fable 5约20%的水平。Opus 5在标准推理设置下即达到此分数,而GPT-5.6 Sol的7.8%依赖最大推理强度的极端资源消耗。
影响:
- 推动AI从记忆模式匹配走向通用推理,改写AGI评估体系
- 强化Anthropic在编程与企业级工作流自动化领域的领导地位
- 以半价(5/25美元/百万token)反超Fable 5,将加剧AI价格战
总结:ARC-AGI-3被视为衡量模型能否独立解决陌生问题的硬指标,30.2%意味着Opus 5在三分之一的情况下能完成人类可完成的任务,且这些任务绝对未在训练数据中出现。ARC Prize研究人员认为,这意味着模型已跳出训练数据范畴,开始具备通过交互推导陌生规则体系的能力。Opus 5同时在ARC-AGI-1上取得97.5%、ARC-AGI-2 Semi-Private上取得90.4%的成绩,验证了其在多代际推理基准上的稳定领先。这一突破不仅强化了Anthropic在编码与高阶推理赛道的优势,也为AGI评价标准提供了新的方向。
参考来源:
- https://the-decoder.com/anthropics-opus-5-blows-past-fable-5-and-gpt-5-6-sol-on-the-benchmark-designed-to-measure-real-intelligence/
- https://arcprize.org/results/anthropic-claude-opus-5
- https://k.sina.cn/article_7879923018_1d5ae154a01901gjb0.html
- https://k.sina.cn/article_5953190046_162d6789e06703lk8m.html
- https://finance.sina.cn/stock/jdts/2026-07-25/detail-iniiytzh9155853.d.html
- https://m.toutiao.com/article/7666326322578293288/
- https://baijiahao.baidu.com/s?id=1871659450791578279
- https://blog.csdn.net/yuntongliangda/article/details/163194182









