抓 bug 靠的不是聪明,是舍得花轮次,这个测试把这事量化了。设定很干净:两个真实仓库、105 个 bug,谁找到并修掉的多谁赢。六个选手跑完,分数是这样。
Sonnet 5.5(max)55.5 分居首,GPT-6 Astra 45,GPT-5.6 Sol 43.5,Fable 5.1 43,Opus 5.5 41.7,Sonnet 5.5 换到 xhigh 档掉到 39。
看轮次那栏才明白怎么回事:Sonnet 5.5(max)跑了 1,330 轮,Astra 只用 222 轮。前者多花约 6 倍轮次、3 倍于 Opus 5.5 的轮次,换回多抓 10 到 14 个 bug。
它赢在最不懒。都调到 max 档,有的模型草草收工,它肯一格一格把角落翻完。轮次在这里不是浪费,是燃料,抓漏的次数跟翻找的次数直接挂钩。
更妙的是 xhigh 那组当了对照。把轮次砍掉一半以上,分数就掉到 39,反而低于 Opus 5.5 的 max 档,后者平均轮次还更少。同一家的两个档位,一个用足轮次夺冠,一个省着用垫底,说明档位买到的其实是愿不愿意多想几轮。
我的判断是这类测试比总榜值钱,因为它拆开了过程。任务越像找东西,花轮次的收益越高;任务越有标准答案,快和省才占上风。保留一处:每个配置的样本只有一到三次,分数抖动不小,方向可信,名次别当真。
给选型留个简单的参照:接修 bug 这类活,先看它肯不肯多跑几轮,再看单轮贵不贵。懒的模型省下的轮次,最后都会变成漏掉的 bug。
26 浏览 0 评论
0 反应









