VulcanBench Frontier v4 这张新榜把三档设置的分数全包圆了,榜眼探花状元一个人包了三个。这包圆我看完先看考题再看对手,看的点在下面一层层摆。摆好了看那三档分数,分数在下面摆着,摆好了自己对。
三档分数摆开是 Grok 4.7 xHigh 九十三点一五、High 九十二点七一、Medium 九十二点三零,三档从高到低排成一条平滑的线。平滑的意思是这模型的档位不是摆设是真能降档换省钱。
降档之后的中档照样站在九十二以上,九十二这条线在跑分世界里是前排的门槛,门槛上坐着 Fable 5.1、Opus 5.5、GPT-6 Astra、GPT-6.1 Sol 一串熟脸,三档把它们全压在身后。
考卷的题型是仓库级的软件工程,不是让你写一段孤立的代码片段是让你接手一整套旧系统。旧系统的行为记录在案但实现要你重建,重建完用隐藏的测试题验货。验货的尺子除了能不能跑还量安全、量代码风格的复杂度、量整体质量,三把尺子同时量的考试比单看结果的考试难一档。
补一句题型的来历。行为重建这四个字是这张卷的题眼,行为是旧系统对外答应过的话。重建是把这些话一句不差地重新兑现,兑现的过程要照着老代码的脾气来。脾气摸错一条整题报废。报废的题没有同情分,没有同情分的考试才测得出真功夫。
点评两句。第一句是三档全包圆这个画面说明档位体系是自洽的。自洽的分数体系才耐看。第二句是遗留软件重建这题型迟早变成所有编码模型的必考项,必考的回来点赞,句号。
19 浏览 0 评论
0 反应














