ARC 抽象推理基准的官方成绩出来了。同一模型换个框架,分数能差五倍。GPT-6 Sol 在最难的第三代上,标准框架跑出百分之四点六,换供应商适配的框架直接到百分之二十三。
三代分着看更清楚。最难那档的花费是五千六到八千七百美元一档的量级,次难的第二代百分之八十九点六、每题四毛四,第一代九成五、每题一毛四。三代之间难度落差,从价格到分数全线拉开。
最扎眼的还是代际对比。同为新一代,Sol 拿百分之二十三,Luna 只有零点五九,Astra 却是九成九,一个家族里差出三个世界,能力分层一目了然。
框架那组数字才是内行看点。四点六和二十三放一起,说明这道题考的不光是模型,还有谁来掌勺。跟前两天技能效果看模型的论文、以及默认模型切换的观察完全对得上,工程这一半的权重被反复验证。
我的看法是拿单一分数吹或者踩都要小心,先问清用的什么框架、花了多少钱。这两个数一亮出来,榜单故事才算讲完整,不然就是自说自话。
话题来源 @arcprize
39.2K阅读 ❤️398 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应













