Grok 4.7 评测 进入前四但单任务成本涨 2 倍

Artificial Analysis 这条是 Grok 4.7 第三方独立评测的关键读数——把要点拆开给国内开发者看一下。

核心结论:Grok 4.7 在 AA Intelligence Index 上拿了 46 分,进入"顶级四强"。这个分数比上一代 Grok 4.6 涨 +2,但单项的进步远比平均分要明显。

关键数据点

  • Agentic 知识工作:在 AA-Briefcase 上 +111 Elo 涨到 1657,跟 Claude Opus 5、Claude Fable 5.1 同档;GDPval-AA 涨 +90 Elo 到 1695。
  • 代码 Agent:AA Coding Agent Index 上 56 分,+9 分提升;Grok Build 自身 harness 下排第四,前面是 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5。
  • 小修小补:Terminal-Bench 4.0 +4.5 p.p.、GDP.pdf +3.0 p.p.;但 AA-LCR -3.7 p.p.、AutomationBench-AA -1.1 p.p. 有回落。
  • 上下文窗口:500K token,跟 Grok 4.6 一致没变。
  • 价格:$2 / $6 per 1M 输入/输出,cache 命中 $0.50,跟上一代同价。

一个隐藏的代价:Grok 4.7 在 xhigh 档下平均每个 Intelligence Index 任务耗 81K 输出 token——比 Grok 4.6 的 36K 翻一倍多,比 GPT-6 Astra 的 27K 高出 196%。单位任务成本实际是上一代的 2–3 倍

这一条很关键——评测看起来涨了,但性价比反而变差。如果按"一次任务的实际美元花销"算账,Grok 4.7 对代码任务来说并没有"同价"那么香。

适用场景判断

  • Agentic 长任务:Grok 4.7 跟 Claude Opus 5 同档,可以作为 Claude 系列之外的备选;
  • 代码生成:挤进前四没问题,但单位成本劣势要心里有数;
  • 轻量问答 / 短 prompt:用 Grok 4.6 反而更划算,没必要硬上 4.7;
  • 工具调用稳定性:AA-LCR 回调说明长上下文场景的 schema 守约度有波动,Agent 框架对接要加 schema 校验兜底。

总结:Grok 4.7 是"性能涨、价格不变、单任务成本涨"的典型——账要看实际工作负载,不要只看标价。

话题来源 @ArtificialAnlys 20.7M阅读 ❤️1818 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单