Grok 4.7 发布了,Artificial Analysis 的评测也跟着出…

成吉思鸡 @xiaoben

Grok 4.7 发布了,Artificial Analysis 的评测也跟着出来了。

这次的变化不在"智力分又涨了多少",而在它终于把 agentic 那部分补上来了。

先看分数

  • Intelligence Index:46 分,比 Grok 4.6 高 2 分,SpaceXAI 因此进入前四实验室
  • AA-Briefcase(他们自家的私有基准,测长程 agentic 知识工作):比 Grok 4.6 (high) 高 111 Elo,拿到 1657 Elo,和 Claude Opus 5、Claude Fable 5.1 站在同一档
  • GDPval-AA:1695 Elo,比 Grok 4.6 (high) 高 90
  • 编码 Agent:在 Artificial Analysis Coding Agent Index 上 56 分,比 Grok 4.6 (xhigh) 高 9 分

这里有个容易被忽略的限定词:那是"原生 harness"口径。Grok 4.7 配的是自家的 Grok Build,榜单上其他模型也各配自家的工具链。换到统一的第三方脚手架里重测,名次未必照旧 —— 看这类榜,先分清它比的是模型本身,还是模型加脚手架。

"第三"还是"第四",取决于你数什么

马斯克转发时的说法是:Grok 4.7 在 agentic coding 上排第三,仅次于 Anthropic 和 OpenAI。

评测机构的口径是按模型排:Grok 4.7 + Grok Build 在原生 harness 里排第 4,前面是 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5 —— 其中两个来自 Anthropic、一个来自 OpenAI。

两种说法不矛盾:一个是按实验室数,一个是按模型数。看这类发布,先确认对方数的是哪一个,再去比排名。

涨的地方和跌的地方

提升:Terminal-Bench 4.0 涨了 4.5 个百分点,GDP.pdf 涨了 3.0 个百分点。

回退:AA-LCR 掉了 3.7 个百分点,AutomationBench-AA 掉了 1.1 个百分点。

也就是说,agentic 和编码这两块是这次的主攻方向,其他任务基本和 4.6 持平,个别项目还有退步 —— 不是全面变强。

最该注意的是账单

Grok 4.7 (xhigh) 每跑一个 Intelligence Index 任务,大约消耗 8.1 万输出 token。对比一下:Grok 4.6 (high) 是 3.6 万,GPT-6 Astra (max) 是 2.7 万 —— 分别高出 125% 和 196%。

马斯克说它"明显更快、更便宜",指的是单价:输入每百万 token 2 美元、输出 6 美元,缓存命中 0.5 美元,与 Grok 4.6 持平。但单任务成本是另一回事 —— 单价没动,token 用量翻倍,同一件事的总价就跟着上去了。

这也是这次发布里最值得记的一条:分数涨 2 分,token 涨一倍多。上下文窗口 500k,和 4.6 一样没变;推理档位从 low 到 xhigh 可调,评测用的是最高档。

我的看法:现在 agentic 类基准比纯智力分更能说明模型能不能干活,这点已经在取代过去的比法。

但随之而来的是,token 效率正在变成新的分水岭 —— 单价持平、单任务更贵,意味着重度使用 Grok 4.7 之前,得先拿自己真实的调用量算一遍账,而不是只看每百万 token 的报价。

话题来源 @elonmusk 641.1W阅读 ❤️9357 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单