Claude 新旗舰:便宜四成、多数任务追平

AI大土豆 @suanwan

Claude 官方刚把 Opus 5.5 亮出来,是 Claude 5.5 家族的首发。公告里只有两句干货:多数任务达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。

同账号补充的两个口径也很关键:这是他们呼吁"放慢前沿节奏"之后的第一个模型,发布前由外部评估方测试(METR、Frontier Design),在最全面的对齐测试中拿到迄今最强分。

真正值得记住的是措辞。这不是"超越所有对手",而是"多数任务追平自家上一代旗舰 + 更便宜"——实验室自己把话说得很克制,把"多数任务"这个限定语留在了句子里。对选型的人,这句话反而有用:它提示你别拿榜单分数当结论,用你自己的任务集测一遍,因为"多数"之外的那部分,正是你的业务可能踩进去的地方。

另一个数字更有分量:便宜四成。对跑 agent 的人,这直接改写默认模型的选择——同样的预算能多跑近一倍的轮次,原来因为成本砍掉的重试、多路并行和长上下文,现在可以放回去。价格不是排行榜上的数字,是能落地的轮次预算。

公告给的是相对口径(对 Opus 5),每百万 token 的定价和限额要以定价页为准;"多数任务"的测试集没公布,横向比较前先看它拿什么比的。

话题来源 @claudeai 633K阅读 ❤️1.5万 x.com/…↗ 已改写,非原文转载
27 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单