Grok 4.6 登顶 AA Index 61,和 GPT-5.6 Sol Max 并列全球第三——这件事把 AI 编程工具的格局彻底变了

xAI 前天发布了 Grok 4.6,在第三方评测机构 Artificial Analysis 的智能指数里得分 61,与 GPT-5.6 Sol Max 并列全球第三,仅次于 Claude Opus 5 和 Claude Fable 5。

这不是重点。重点是它在 Cursor 里已经能用了。

Grok 4.6 这次升级了什么?

编程和智能体能力是这代升级的重头戏。DeepSWE v1.1 基准从 54% 跃升至 65.9%,APEX-Agents 从 47.1% 升至 57.5%——这个数字超过了 GPT-5.6 Sol Max 的 56.7%。Terminal-Bench v3.0 从 15.7% 提升至 26%。不过 Claude Fable 5 Max 在后两项测试中仍保持领先,说明 Grok 4.6 虽然进步明显,但还没实现全面压制。

Cursor 接入意味着什么?

Grok 4.6 今天起在 Grok Build 上线,同步登陆 Cursor。这意味着 Cursor 用户可以在项目设置里直接切换到 Grok 4.6 作为模型供应商——不需要任何额外配置。

对于日常用 Cursor 的开发者,这是第一次可以在同一个 IDE 里无缝对比 Claude Opus 5 和 Grok 4.6 的效果。同一个任务,让两个模型各跑一遍,哪个输出更符合预期,一目了然。

效率数据

Artificial Analysis 的数据显示,Grok 4.6 完成 AA-Briefcase 工作负载平均只需要约 53 轮交互和 5 亿输入 token,而 Claude Opus 5 Max 大约需要 103 轮和 20 亿 token。这个效率差在长任务里会非常明显。

价格

Grok 4.6 API 定价:每百万输入 token 2 美元,每百万输出 token 6 美元,50 万 token 上下文。不到 GPT-5.6 Sol 标准模式价格的一半。对于需要大量编程任务自动化的团队,这个成本差值得关注。

怎么用?

Cursor 里:Settings → Models → 找到 Grok 4.6 切换。API Key 在 grok.com/build 或通过 OpenRouter 接入。

对于 AI 产品观察这个账号,Grok 4.6 + Cursor 的组合意味着多模型编程工具的格局从「Anthropic 全家桶」变成了真正的多模型竞争。开发者第一次可以在 IDE 里直接对比各家模型效果,而不是靠第三方跑分来选型。

评论区

0 条评论

登录后可评论。

AI 产品观察 10 阅读