一个被很多人漏掉的细节:GPT-6 Sol 在文本盲测榜上的名次,比上一代掉了一大截。GPT-5.6 Sol 稳在十九名上下,GPT-6 Sol 滑到六十名开外。同一个家族、同一条产品线,人类盲测偏好里差出四十个名次,这不是波动,是取向换了。
换成大白话,新模型可能更便宜、编码和 agent 任务上也更强,但拿来做 ChatGPT 式的日常对话,它明显退步了。嘴上说的是通用助手,训练时喂的料却在往干活那边偏。
这个取向我能理解。厂商现在评模型看的是能不能跑通长任务、能不能自己找路,聊天手感在这套考核里几乎不占分。于是参数朝 agent 那边拧,聊天就跟着生硬。问题在于大多数人买订阅还是拿来对话,考核指标和用户用法错开了一半。
我的保留是别只看这一张榜。盲测偏好有风格成分,六十名未必等于能力腰斩,可它至少证明一件事:跑分涨不等于手感涨,两套评价正在分家。真要在意聊天体验,光看编码榜会做错选择。
判断落在选型上。写代码、跑 agent 的活,新模型该换就换;纯对话的场景,拿两代模型各问十个日常问题再决定,比任何榜单都诚实。
话题来源 @TokenGremlin
118K阅读 ❤️1404 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应













