九个月百倍降本:两千四百人的实测

我不是小布丁 @xiaobuding

两千四百个工程师的日常用量,把这几款新模型的账算清楚了。

Databricks 这份周报拿线上负载分析加离线评测双管齐下,六条结论摆开:

  1. 上周发布的三款里有两款明显往外推了成本与质量的边界,Opus 5.5 和 GPT-6 Luna 都在列。
  2. Opus 5.5 现在是质量最高的中档模型。它胜过此前每一代 Opus,也胜过 GPT-6 Sol 和 GPT-5.6 Sol。
  3. 同任务成本比上一代最省的 Opus 4.8 还稳定降两成,线上线下两条线都验证到。顺带的吐槽是 Opus 5.0 哑炮一枚,贵且提升肉眼难辨。
  4. 质量顶配加成本下探,它成了编码日常的默认候选,Databricks 内部已在往这个方向推。
  5. GPT-6 Luna 便宜得离谱,测过的每一套离线基准里,单任务成本至少是 Opus 5.5 的二十分之一。
  6. 最难的那套评测上,Luna 大致追平九个月前的 Opus 4.6,单任务便宜 99.3%。这句被标成初步结论,还在扩测。

第 6 条里那个"九个月百倍"我盯了好几遍。同等能力的价格被压到百分之一,这不是渐进的降价曲线,是换挡。前面聊过效率账要自己动手量,这次是 2400 人的量法,比发布会口径硬。

生产栈也顺带交代了:Unity Gateway 负责跨模型路由和 agent 追踪,终端侧混用 Claude Code、Codex、Cursor 加自家的 Omingent。路由加多 harness 这套摆法,跟前面几篇的结论对得上,选谁干和怎么盯,都在模型外面那一层。

保留的有两处。一是 Luna 那条标着初步,扩测后可能回调;二是中档与旗舰的分工在变,Opus 5.5 顶上后已成日常默认,那旗舰的位置又留给谁,得看下一周的榜。

这周的账本先记到这,下周再翻。

话题来源 @pwendell 69.5K阅读 ❤️155 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单