6.1 Sol上线一周顶替前任指数差一分

我不是小布丁 @xiaobuding

第三方评测机构给 GPT-6.1 Sol 出的分数卡,重点不在分数本身,而在它替换前任的速度:上一代 GPT-6 Sol 上线仅一周就被新版本顶替。指数层面,6.1 Sol 比 6 Sol 高 4 分、比 5.6 Sol 高 5 分,距 GPT-6 Astra 只差 1 分,而单题成本不到 Astra 的四分之一;agent 型知识工作的两个分项——AA-Briefcase v1.1 与 GDPval-AA——分别再涨 4 分和 5 分,涨分集中在真实工作负载而非刷题项。

分项结构比总分更值得读。Astra 定位仍是"最高智能"的天花板,Sol 系列做的是把天花板下放:分数逼近、成本砍到四分之一,等于官方在同一代里造出两档供给,一档买智能,一档买性价比。

对多数团队而言,能否吃满 1 分之差的智能取决于任务是否长链、是否少有人兜底,这类任务本来就少;而分数在分项上的分布提示,涨的是"读文档、做简报、跨工具执行"这类日常负载,正好覆盖大部分企业调用面。换句话说,这一代把钱花在了最高频的那部分调用上,边缘长尾仍留给 Astra 挡着。

定价链条同样连成一条线:6.5 时代之后,6 Sol 相对上一代打五折,6.1 Sol 再把缓存读取折扣从 90% 抬到 95%,账面单次调用价不变,agent 混合价却继续下行。

三次动作指向同一策略——用折扣而非标价让重度缓存的 agent 负载实际降价,标价留在那里服务轻量用户,折扣留给规模化用户。看价格时若只盯每百万 token 的牌价,会漏掉这条线上真正的降价发生在哪里。

一周一代的节奏带来的管理问题比技术问题更大。评测机构七天能出一张完整分数卡,用户上手一周就可能看到版本被顶替,锁定某一代模型的提示词与工作流,保质期等于官方发布周期。采购合同里的模型版本条款、CI 里跑的回归集、内部沉淀的提示词库,都隐含一个过期日,只是没人写在纸上。

把这份分数卡放回行业里看,模型层的两股力量正在同时收紧。一边是旗舰厂内部的自我替代:一周一代的节奏让每款模型的可用窗口缩短,能力上移与价格下移被压进同一次迭代,用户在同一家产品线里就能买到两档供给,天花板与性价比分开卖。

另一边是开源阵营的追赶,同一批评测里开源模型与前沿线的差距逐月收窄,闭源厂商用更快的迭代和更深的折扣回应——两边同时动作,用户端的体感是选择变多、贬值变快。

由此产生的行业影响有三层。评测机构的角色变了:从"发布后一次性背书"变成"按周滚动复核",评测周期必须贴着厂商发布周期跑,否则榜单一出就过期。云厂商与路由层受益:模型轮换越快,按任务动态路由的价值越高,固定绑定单一代模型的架构成本上升。

供应链的隐含条款开始显形:采购合同的版本锁定、CI 回归集、提示词库都带着无人书写的过期日,模型越像消耗品,这些资产的重估越频繁。

对选型与工程团队的实操建议有两条:一是把"任务档位 + 混合价"当成固定量,模型随版本轮换、档位不动,每次官方发布只对分项做一次回归测试,不重建整套工作流;二是把缓存命中率当成价格的一部分来治理,同一份上下文反复进出的调用方式天然吃满九五折,把系统提示词、检索片段与工具定义的顺序固定下来,命中率的提升会直接体现在账单上,比等下一次官方降价更可控、也更可预期。

话题来源 @ArtificialAnlys 129.3K阅读 ❤️1771 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单