时间:2026年9月12日(美国西部时间),Specific Labs(YC F25)正式发布 Real-SWE 编码智能体评测基准。
地点:美国旧金山 Specific Labs 总部,基准托管于 realswe.withspecific.com。
人物:Janak Sunil(Specific Labs 联合创始人兼 CEO,前 Coinbase);Siddhant Paliwal(联合创始人兼 CTO,前 Third Chair YC X25、Intel,15 岁首次创业)。
事件详情:Specific Labs 发布的 Real-SWE 是首个以真实企业私有代码库为测试对象的编码智能体基准,包含 10 个来自真实生产环境的工程任务(账单、税务、身份迁移、API 计费等),覆盖 8 组「模型+脚手架」组合,共完成 640 次评分回放。首份排行榜解决率如下:Fable 5.1 + Claude Code 以 38.8% 居首;GPT-6 Astra + Codex CLI 33.8% 第二;Gemini 3.8 Flash + Gemini CLI 31.2% 第三;国产智谱 GLM 5.3 + Claude Code 28.8% 位列第四,反超 Grok 4.6(23.8%)、Muse Spark 1.3(23.8%)、Kimi K3(18.8%)、GPT-5.6 Sol(16.2%)。10 个公开任务中,6 个聚合解决率低于 15%,税务管辖区任务仅 3.1%,分析流减速器任务 0% 全员失败。
背景:当前主流编码基准(SWE-bench、Terminal-Bench 3、FrontierCode、DeepSWE、FrontierSWE v2 等)均构建于公开开源仓库。模型在训练时已接触过这些代码与方案,分数虚高无法反映企业私有代码场景。Specific Labs 历时一年从真实公司授权获取运行数据和代码库,样本包含 20 万+用户的活动 App Store 前 100 应用、处理 10 万+银行流水的消费金融平台、企业 AI 销售平台等。每条指令中位长度 1742 字符,参考解决方案需修改中位 11 个文件(FrontierCode 与 DeepSWE 均为 6 个)。
影响:Real-SWE 把「企业级编码智能体」的衡量标准从「能不能修公开仓库 Bug」升级到「能不能在陌生私有代码里落地业务规则」。榜单暴露三大问题:第一,头部模型榜首仅 38.8%,编码智能体距离「替代初级工程师」仍有近 60 个百分点差距;第二,智谱 GLM 5.3 在跨文件、长程任务中反超 Grok 4.6、Kimi K3、GPT-5.6 Sol,显示中国阵营在长程推理上的训练红利;第三,运行时长并不带来收益,10 分钟内完成的运行 71.4% 失败,超过 10 分钟的运行 73.4% 失败,主要失败模式为「漏读需求」与「公司特定约定理解缺失」。
总结:Real-SWE 把 AI 编码评测从「公开仓库刷榜」拉回「真实企业代码落地」。榜首 Fable 5.1 解决率 38.8%、6 成任务低于 15%、分析流减速器 0% 全员失败,印证 AI 编码智能体仍处于「辅助工程师」阶段而非「替代工程师」阶段;智谱 GLM 5.3 进入前四,验证长程任务训练路线的实用价值;对企业 CTO 而言,基准短演示里的高分已不能直接换算为生产可用率。
参考来源:
1. https://withspecific.com/benchmarks/real-swe(Specific Labs 官方主页)
2. https://www.ycombinator.com/launches/TpS-real-swe-a-coding-benchmark-built-from-private-company-codebases(Y Combinator 官方 Launch)
3. https://superpowerdaily.com/posts/specific-labs-launches-private-code-benchmark-where-top-coding-setup-solves-38-8(Superpower Daily 详细分析)
4. https://aideveloper44.com/blog/specific-labs-real-swe-benchmark-private-codebases(AI Developer 44 评测报告)
5. https://agihunt.info/en/p/1a0930b7be413ca903ec97382af(AGI Hunt 行业速览)
6. https://news.lavx.hu/article/real-swe-benchmark-tests-coding-agents-on-private-enterprise-code(LavX News 任务难度解读)
7. https://www.worldprogramming.org/posts/real-swe-benchmarking-ai-models-on-private-real-world-enterprise-codebases-c1lzos(World Programming 全量数据)
8. https://news.linxi.com.au/news/specific-labs-benchmark-puts-ai-coding-agents-to-work-on-private-enterprise-code(Linxi News 跑分细节)
9. https://zeli.app/story/49676820(Zeli 总结性摘要)
10. https://lookonchain.com/feeds/72604(Lookonchain 中文转述含 Zhipu 团队回应)









