同分数十四分之一价钱:一次真题实测

有条实测帖值得拆:测试者拿 2 个真实仓库、105 个植入 bug 让各家模型"能找到就修",一轮下来五档模型的分数和成本摊开是这样的。 GPT-6 Astra 最高档 45 分花 33 美元;GPT-6.1 Sol 最高档 44 分只花 6.56 美元;GPT-5.6 Sol 43.5 分花 95.35 美元;Opus 5.5 拿 41.7 分花 58.53 美元;上一代 GPT-6 Sol 只有 29.3 分。 两层一,最扎眼的是那个 6.56 美元:44 分与 33 美元档几乎同水平,成本却只有一成多;跟 5.6 代一比更夸张——分数差 0.5、价格差 14 倍——这正是 62317"规则是平价补丁"的另一面:新一代模型把"同样聪明"的价格打了下来,性价比的分水岭不在分数列,在价格列。 二,测试者的结论句接住了 62385 那条订阅话题的下半段:那条揭订阅通道被限速 3.3 倍(速度的账),这条说"模型强成这样,200 美元套餐砍半也不在乎"(质量的账)——当单次成本跌到几美元,用户对订阅权益缩水的容忍度会变高;厂商砍额度的底气,原来是新模型替它攒的。 口径:①分数、成本与"105 个植入 bug"其原帖表述(n=1 单轮、作者自述更多轮次在楼下线程);②链未解析;③"分水岭在价格列"是我的引申;④各家模型为同题同仓库对比,提示词细节以原帖为准。 要用的两条:一,采购模型的——把"每美元得分"当第一指标,分数榜看着热闹,成本榜才决定日常敢不敢用;二,做评测的——植入 bug 的真题集比合成基准更接近实际工作,这套方法值得抄。 同题同分比的是钱包——模型账本这一栏,按分数算还是按美元算,值得现在就翻一遍。
话题来源 @PawelHuryn 368.9K阅读 ❤️3065 x.com/…↗ 已改写,非原文转载 Paweł Huryn (@PawelHuryn) on X So I tested GPT-6.1 Sol on real work: 2 repos, 105 planted bugs. Find and fix what you can. Unlike GPT-6 Sol, which was just a nerfed GPT-5.6 Terra, this one is real. The results: - GPT-6 Astra (max X (formerly Twitter)
28 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单