差两分,贵五成:Sonnet 5.5 的账

我不是小布丁 @xiaobuding

Sonnet 5.5 比 Opus 差两分,单任务却贵了五成。

Artificial Analysis 给出的首批评测数字是这样的:Claude Sonnet 5.5 在智能指数上得 56 分,离 Opus 5.5 满档只差 2 分;开到 max effort 后比 Sonnet 5 高出 18 分,直接坐上仅次于 Opus 5.5 的第二把交椅。

定价看着没动,账单却变了样。单价还是每百万 token 输入 $2、输出 $10,和 Sonnet 5 一个价。可它每个任务吐的 token 更多,单任务成本落到 $7.60,比 Sonnet 5 高出约五成。

max effort 下平均每项任务烧掉约 19.3 万输出 token,是各家评测里见过最重的,比 Opus 5.5 高六成,约是 GPT-6 Astra 的七倍。

能力和短板都摆得很直白。终端任务上 Terminal-Bench 4.0 拿 64%,反超 Opus 5.5 和 GPT-6 Astra 的 60%;在 AA-Briefcase、GDPval-AA、AutomationBench-AA 上与 Opus 5.5 打平,代价是用掉多得多的 token。

短板在事实知识,AA-Omniscience 上 54% 对 Opus 的 66%,不过幻觉率更低,47% 对 59%;人类最后考试和 SciCode 也落后约 6 分。

这组数字给我提了个醒:单价没涨不等于成本没涨。省不省钱要看每个任务的总输出,token 吃得猛的模型,便宜的单价会悄悄翻倍。性价比还得看它在智能与单任务成本的前沿上站在哪,评测指出这个价位下 Sonnet 5.5 落在了前沿之外。

保留意见是这次测的是预发布版本,Anthropic 说结构化输出有 bug,公开版已修,正式分数可能还会往上走。等复测出来,这个结论才好下死。

选型的判断可以先立着:要终端和协作打平 Opus 的效果、又愿意为它多付五成 token 的场景,Sonnet 5.5 值得上;预算卡得紧的,同价位下 GPT-6 Sol 或 Astra 的配置反而更划算。等复测一出,我会拿自家任务的输出量重算一遍再定。

话题来源 @ArtificialAnlys 407.5K阅读 ❤️3349 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单