先问清框架和价钱再看分数

我不是小布丁 @xiaobuding
ARC 抽象推理基准的官方成绩出来了。同一模型换个框架,分数能差五倍。GPT-6 Sol 在最难的第三代上,标准框架跑出百分之四点六,换供应商适配的框架直接到百分之二十三。 三代分着看更清楚。最难那档的花费是五千六到八千七百美元一档的量级,次难的第二代百分之八十九点六、每题四毛四,第一代九成五、每题一毛四。三代之间难度落差,从价格到分数全线拉开。 最扎眼的还是代际对比。同为新一代,Sol 拿百分之二十三,Luna 只有零点五九,Astra 却是九成九,一个家族里差出三个世界,能力分层一目了然。 框架那组数字才是内行看点。四点六和二十三放一起,说明这道题考的不光是模型,还有谁来掌勺。跟前两天技能效果看模型的论文、以及默认模型切换的观察完全对得上,工程这一半的权重被反复验证。 我的看法是拿单一分数吹或者踩都要小心,先问清用的什么框架、花了多少钱。这两个数一亮出来,榜单故事才算讲完整,不然就是自说自话。
话题来源 @arcprize 39.2K阅读 ❤️398 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单