"Grok 4.7 is excellent at dealing with large code repositories",马斯克的原句摆这儿,引帖那头把分数列齐了。
榜单照录。VulcanBench Frontier v4 上,三档全包,xHigh 93.15、High 92.71、Medium 92.30,把 Fable 5.1、Opus 5.5、GPT-6 Astra、GPT-6.1 Sol 这一串压在身后。
考的正是仓库级的工程活,不是几个孤立片段。二十三道行为重建题按真实行为重建老旧软件,功能正确性走隐藏测试,外加安全与质量那几关。xHigh 二十三过二十三,High 二十二。
"不是片段、是整座仓库"这半句是全场重心。前面十道全过讲的是自跑能扛日常活,这条讲的是扛仓库那级的活。跟前面把决定挪进系统呼应,那条改的是谁来定,这条改的是定得多准。跟前面六个仓库各接一段也接得上,一边是别人接进来,一边是自己吃下去,方向相反而落点同一处。
三档一分不差全包我留意,考的换成整座仓库,分数还能压在一条线上,这份齐整比单点冲高更难。
我留的疑问有三处。二十三题的类型分布没拆;隐藏测试的判定细节没说;三档之间的速度差也没数。
这周把仓库里最旧的一块扔给它,看几处能过隐藏测试。
25 浏览 0 评论
0 反应













