十项拆开看:Opus5.5登顶与它的输项

我不是小布丁 @xiaobuding

第三方评测的"随后就到"来得很快:Artificial Analysis 官宣 Claude Opus 5.5 登顶 Intelligence Index——满分刻度上拿到 58 分,领先此前最佳数分,同时伴随降价 20% 与更大的缓存折扣。这条正好把"全面最强"这种含糊话拆成了十项可查的数字。

十项里赢六项:Humanity's Last Exam 61.4%(前最佳 59.1%、Claude Fable 5.1)、SciCode 66.9%(63.1%、Fable 5.1)、GDPval-AA v2.1、AA-Briefcase、AA-Omniscience、AutomationBench-AA;Terminal-Bench 4.0 拿到 59.6%,与 GPT-6 Astra(xhigh)并驾、比 Opus 5 高出 11 分;落后的三项也照实列出——CritPt、AA-LCR、GDP.pdf 略逊

赢面最大的是代理式知识工作:在私有评测 AA-Briefcase 上 Elo 1822、比 Fable 5.1 高 143 点,分析质量与呈现质量双双领先——这是 Anthropic 第一次在呈现质量上超过 GPT-5.6 Sol;该评测用的是他们开源的参考 harness(Stirrup),方法可查。

成本侧的三个数字每百万输入/输出 $4/$20(Opus 5 为 $5/$25,降 20%);缓存读从 $0.50 降到 $0.20(相对未缓存输入便宜 95%,此前 90%);尽管输出 token 多出 1.6 倍(每任务约 119k vs Opus 5 的 73k),每任务成本仍与 Opus 5 持平

表里还有个安静但扎眼的对照:GPT-6 Astra 每个任务只用约 27k 输出 token——同样的榜,效率差出四倍多。五档 effort 里有四档(max/xhigh/high/medium)落在"智能 vs 每任务成本"的 Pareto 前沿,1M 上下文与图文输入不变。

我的看法:三家视角叠起来看才有意思——Anthropic 开发者账号称它"达到 Fable 5.1 的水平"、资深工程师把它当日常主力、而 AA 用可复现的 harness 给出赢六、平一、输三的账单;同一天 OpenAI 那边 Sol/Luna 也在调价,头部两家同时把"每任务成本"摆上台面,说明竞争的刻度已经从"谁分数高"挪到"同样的分数谁更便宜"。

对使用者,三条可直接行动:其一,按档位选——四档在前沿意味着未必非 max 不可用;其二,缓存读降价比标价降价更值钱——Agent 高频重读的场景收益最大;其三,"token 单价"和"每任务成本"要分开算——输出四倍效率差才是 Astra 的真护城河。

限定:评测集部分私有(AA-Briefcase),跑法基于开源 harness Stirrup;口径与完整方法以 AA 的方法学文档为准。

话题来源 @ArtificialAnlys 162.6K阅读 ❤️1959 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单