终端编程 Agent 格局定了:Claude Code 第一,Codex 第二,但真正重要的事根本不在排名里

八月的终端编程 Agent 排名出来了。Claude Code 第一,Codex CLI 第二,Cursor 第三,Gemini CLI 和 GitHub Copilot 排第四第五。

这个排名本身不意外。意外的是背后的衡量维度——以及它说出了一个很多人还没完全接受的事实。

排名标准不是谁更聪明

这次的排名不看基准测试分数,看的是:hooks 深度、子 Agent 编排、动态工作流适应、失败恢复、会话持久性。这些维度本质上衡量的是:任务跑起来了之后,系统怎么管理上下文、怎么协调子任务、怎么在出错时优雅地活下去。

换句话说:谁能把一个需要跑几小时的多步骤任务,从头到尾稳定地跑完。

这个标准的言下之意是:模型本身已经不是瓶颈了。Claude Code 和 Codex CLI 跑的是同样的底座模型,差距来自 harness 的工程实现。

吞吐量不是速度

这里有个反直觉的结论:更好的 harness 能提升吞吐量,但不提升单任务速度。

Linear 的遥测数据说明了这一点:部署了编程 Agent 的团队,周均 PR 数量翻了三倍,但单个 PR 的周期时间没有缩短。瓶颈不在生成速度,在评审环节——Agent 能生成代码,但不能替人做决策。

这个结论对选型有直接影响:如果你买的是让团队多干活,不是让单个任务更快,那你应该关注的是工具的会话管理能力和失败恢复机制,而不是基准测试分数。

工具们在争的不是同一个岗位

真正有意思的观察是:这五款工具在争的不是同一批用户。

Claude Code 默认跑长程自主编程任务,子 Agent 系统和 hooks 深度是它的核心差异。Codex CLI 面向的是云端、高吞吐、并行化的 PR 形态任务。Cursor 适合编辑器内的即时反馈循环。Gemini CLI 的价格是最低的,每百万 token 0.75 美元,适合大上下文但低复杂度的任务。

没有一款工具在所有场景都赢。这不是能力差距,是产品形态的分化。

一个被低估的变量:Token 成本

八月最后一周,两件大事同时发生:Claude Sonnet 5 的定价从 2 美元/10 美元调整到 3 美元/15 美元;GPT-5.4 和 GPT-5.4 mini 在同一天从 Codex 迁出。

对于已经在用 Claude Code 的团队,这意味着如果一直用 Opus 5 作为默认模型,成本会涨 50%。聪明团队的做法是:Sonnet 5 做日常主力,Opus 5 留给真正复杂的长程推理任务。按参考任务计算,Sonnet 5 每次约 0.11 美元,Opus 5 约 0.275 美元——前者便宜 60%,但只在任务难度超出范围时才需要切换。

这个成本分层,是大多数团队忽略的优化项。

下一步

如果你在选型,忘掉哪个模型最强这个问题。问自己三个问题:你的工作流形状是哪种?任务以分钟计还是以小时计?你团队的瓶颈在生成端还是在评审端?

答案不同,最优解完全不一样。

来源:RoboAI Digest(2026-08-24);Machine Brief(2026-08-24);andrew.ooo 终端 Agent 评测(2026-08-21);AI Tools Recap(2026-08-24)

评论区

0 条评论

登录后可评论。

小智·AI工具控 48 阅读