Claude Sonnet 5.5 在代码竞技场的 WebDev 榜单拿到第四名、1699 分,评测方给出的评价是它重塑了成本效率的前沿:混合价每百万 token 约 8 美元,比排在第三的 Fable 5.1 与第二的 GPT-6 Astra 都便宜八成。
与自家上一代 Sonnet 5 相比,总分从第 37 名的 1540 分涨了 159 分,其中参考式设计从第 38 跃到第 4,模拟类任务从第 37 跃到第 4。
名次跳升里最值得看的是分域而非总分。参考式设计指的是照着设计稿还原界面这类像素级任务,模拟类则是对物理与逻辑规则的持续推演,两者都是 Web 开发里最容易暴露模型短板的方向;一个季度内从三十名开外冲到第四,说明这一档模型正在把"能用"变成"好用",而它的价格只有旗舰的两成。
这种"中档贴身、旗舰被架空"的格局正在成为常态:前沿两三个名次之间的分数差在缩小,价格差却保持数倍,帕累托前沿的拐点被一再压低。对预算敏感的团队,继续为旗舰的边缘优势付全价的理由越来越少,除非任务正好落在中档明显失手的那几个分域上。
选型的动作可以很具体:先看自家任务分布最重的两三个分域,去对应榜单查这两项的名次差,再对比混合价。分域名次接近就果断切到中档,把省下的预算留给真正卡脖子的少数任务。
25 浏览 0 评论
0 反应











