三个基准测试把 AI 编程工具的真实能力彻底拆开了——SWE-bench 90%+ 的人,APEX-Agents 只有 33%,这件事今天终于有数据说清楚了

三个基准测试把 AI 编程工具的真实能力彻底拆开了——SWE-bench 90%+ 的人,APEX-Agents 只有 33%,这件事今天终于有数据说清楚了。

SWE-bench Verified 今天过了 90%,Claude Opus 4.6 跑到 80.8%,Gemini 3.1 Pro 80.6%,前四名差距在 3 个百分点以内。行业说:AI 编程已经解决了。

APEX-Agents 的人说:没有。

同一个模型,在专业服务任务上——跨应用、跨文档、多步骤的投资银行分析、管理咨询、法律文书——最好成绩是 33.3%,剩下 66.7% 全是失败。这个数字不是某个小模型的成绩,是整个前沿模型阵营的天花板。

这两个数字放在一起,是 2026 年 AI 编程工具最诚实的一张图。

基准测试在测两件完全不同的事

SWE-bench 考的是一件事:给一个 GitHub issue,改一个文件,通过测试。高度聚焦,单点突破。模型知道要修什么,测试会告诉你对不对。

APEX-Agents 考的是另一件事:给你一堆邮件、PDF、表格、聊天记录,自己规划路径,自己判断什么时候该用什么工具,最后交出一份投行分析师看了会签字的报告。没有标准答案,没有测试用例,只有 rubric。

一件是有标准答案的编程题。一件是没有标准答案的顾问工作。

用同一张卷子的逻辑去理解它们,会让采购决策出错。

为什么模型在 SWE-bench 厉害,在 APEX 上不行

核心差距在三个地方。

第一,任务粒度。SWE-bench 的任务收敛在「修这个 bug」,APEX 的任务开放到「把客户这笔交易的收益结构搞清楚,生成一份 memo」。前者是算法题,后者是项目。

第二,工具边界。SWE-bench 考代码能力,工具集固定且已知。APEX 暴露的是一套模拟的工作环境——文件、邮件、日历、数据库——模型要自己判断用哪个工具、什么顺序、什么参数。这是真实工作的样子。

第三,评估方式。SWE-bench 用测试套件,非对即错。APEX 用 LLM grader 评 rubric,靠谱程度本身就是一个变量。Artificial Analysis 自己的实现(APEX-Agents-AA)测出来是 47.1%,比 Mercor 原始版本的 24% 高不少——评估框架一变,排名全变了。

这件事对选型意味着什么

如果你买 AI 编程工具只看 SWE-bench 数字,今天以后要把这张图也放进评估框里。

SWE-bench 高分告诉你:这个工具修 bug 快。

APEX 低分告诉你:让它独立完成一个业务流程,它还有三分之二的概率做不完。

2026 年企业真正在买的,不是修 bug 工具,是能独立跑业务流程的数字员工。两者之间的差距,比任何一家厂商愿意承认的都大。

三个真实数据:

  • SWE-bench Verified:Claude Opus 4.6 = 80.8%,Gemini 3.1 Pro = 80.6%
  • APEX-Agents(Artificial Analysis 实现):Gemini 3.5 Flash = 47.1%,GPT-5.5 = 37.7%,Claude Opus 4.6 = 33.0%
  • APEX-Agents 原始版本(Mercor,1月):Gemini 3 Flash = 24.0%,Claude Opus 4.5 = 29.8%

同一个月,同一批模型,同一批任务,两个不同的分数。评估框架本身就是变量,这件事比分数本身更值得记住。

评论区

0 条评论

登录后可评论。

AI 论文日报 77 阅读