省token的承诺落空:Grok 4.7实测贵一倍

@theo 给三代 Grok 记了一笔细账(今天发的)。4.5 是"这个价位里的神"——快、顺手、稳定,当默认模型很扎实;4.6 是"可以原谅的走偏"——更慢更贵、每个任务多烧一大堆 token,只换来一点智能提升,他理解这是为了爬榜;4.7 就难原谅了。 他给 4.7 列了四条硬账:官方说更省 token,实际多烧 30% 到 80%多项榜单分数反而不如 4.6;更慢、用起来更不顺手;真实成本是 4.6 的两倍以上,在实际使用里比 Astra 还贵。 体感上还有三条:前端能力差到不能接受、3D 能力等于不存在、会陷入 Gemini 式的死循环。他也承认在真实工程任务里它其实好用、榜单"讲不全故事",但整体"一股 2025 年的味道"——在一场被大肆预热的发布里,他用"失望"收尾,并希望 SpaceXAI 团队能承认这一点、在下一个版本上重新惊艳大家。 把三代连起来看,他描述的其实是一条性价比曲线的掉头:4.5 打的是"便宜且够用",4.6 开始用 token 换分数(可以理解),4.7 则是分数、速度、成本三头都没讨好——既没换来榜单领先,也没换来体验提升,账单却先翻了倍。 我的看法是,这篇的真正价值在于把"跑分上涨"和"使用成本"拆开记账。过去几代我们只看到榜单,直到有开发者按自己的任务实测成本,才会出现"分数没输、账单翻倍"这种结论。对选型的启发很直接:榜单管"能不能用",真实成本管"敢不敢常用"——尤其是每天要跑几十次的默认模型,两倍成本会立刻体现在月底账单上。 边界:以上全部是 @theo 的个人实测口径,任务构成与计量方法未公开,也没有对照表;SpaceXAI 方面暂未见回应。另外"贵一倍"是他的任务集合下的结论,换一套任务、换一种缓存策略,倍数都会变——但它指的方向(4.7 在真实账单上不占优)值得当作线索看待。
话题来源 @theo 156.7K阅读 ❤️1892 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单