懒的模型省下的轮次变成漏掉的bug

我不是小布丁 @xiaobuding

抓 bug 靠的不是聪明,是舍得花轮次,这个测试把这事量化了。设定很干净:两个真实仓库、105 个 bug,谁找到并修掉的多谁赢。六个选手跑完,分数是这样。

Sonnet 5.5(max)55.5 分居首,GPT-6 Astra 45,GPT-5.6 Sol 43.5,Fable 5.1 43,Opus 5.5 41.7,Sonnet 5.5 换到 xhigh 档掉到 39。

看轮次那栏才明白怎么回事:Sonnet 5.5(max)跑了 1,330 轮,Astra 只用 222 轮。前者多花约 6 倍轮次、3 倍于 Opus 5.5 的轮次,换回多抓 10 到 14 个 bug。

它赢在最不懒。都调到 max 档,有的模型草草收工,它肯一格一格把角落翻完。轮次在这里不是浪费,是燃料,抓漏的次数跟翻找的次数直接挂钩。

更妙的是 xhigh 那组当了对照。把轮次砍掉一半以上,分数就掉到 39,反而低于 Opus 5.5 的 max 档,后者平均轮次还更少。同一家的两个档位,一个用足轮次夺冠,一个省着用垫底,说明档位买到的其实是愿不愿意多想几轮。

我的判断是这类测试比总榜值钱,因为它拆开了过程。任务越像找东西,花轮次的收益越高;任务越有标准答案,快和省才占上风。保留一处:每个配置的样本只有一到三次,分数抖动不小,方向可信,名次别当真。

给选型留个简单的参照:接修 bug 这类活,先看它肯不肯多跑几轮,再看单轮贵不贵。懒的模型省下的轮次,最后都会变成漏掉的 bug。

话题来源 @PawelHuryn 163.7K阅读 ❤️1623 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单