时间:2026 年 9 月 3 日(北美时间),Armature 公司在自有博客发布目前已知规模最大的 AI 编码代理工具选择实测报告。
地点:研究由位于旧金山的 Armature Tech(YC Spring 2026 批次成员)发起,覆盖 75 个按真实开源仓库画像生成的虚拟代码库,跨 10 种编程语言。
人物:研究由 Armature 数据团队主导,使用 Anthropic 旗下 Claude Code、OpenAI 旗下 Codex 以及 Cursor 共三个主流编码代理作为测试对象;Gemini 3.7 Flash 在实验循环中扮演"模拟人类"发起后续提问,另一实例兼任评审裁判。
事件详情:研究共运行 16,893 次沙箱会话,配套 1,163 种 Prompt 变体,覆盖 4 类角色画像——从只描述症状的 Vibe 编程者到有合规、采购约束的大型企业工程师;最终保留 5,292 个有效会话跨 51 个代码库与 18 个细分赛道。核心发现如下:
- 同一赛道、同一问题,三代理最终选择同一款第三方工具的比例仅 42%;语音代理赛道上,Claude Code 选 Twilio、Codex 选 OpenAI Realtime API、Cursor 选 Vapi;
- 决策路径差异显著——Codex 在 94% 的会话中执行网页搜索、9/10 使用 site: 操作符锁定可信域名;Cursor 约 2/3 会话依赖网页;Claude Code 70% 依赖先验知识,但每次搜索平均浏览的页面数是 Codex 的 3 倍;
- 自研倾向差异:Claude Code 直接自研的比例为 19%,是 Codex/Cursor(10%)的近两倍;
- 仓库语言决定胜负:TypeScript 上 Resend(55/89)通吃,Python 上 SendGrid(22/24),Go 上 Postmark(20/24),Java 则是 Azure ACS(22/23);Vercel 在 TypeScript 仓库中 100% 胜出,但 Python 仓库从未被推荐;
- "被提及 ≠ 被采纳"——PayPal 被提 139 次却 0 次被选,Adyen 被提 175 次仅 3 次,LangChain 被提 194 次仅 4 次,Netlify 152 次提及仅 6 次入选,Supabase 提及 242 次最高却被 Neon 击败;
- 头部赢家高度集中:Stripe 在常规支付赛道拿下 9/10(仅在欧盟合规场景输给 Paddle、Mollie),Neon 在数据库占 66%,Amazon S3 在文件存储占 45%、Azure 与 GCP 各占 20%;
- 仅靠"功能描述 + 定价页"就能翻盘:Mailgun 因免费档"1 天保留"被 Postmark 反超,Supabase 因捆绑 BaaS 功能被嫌重。
背景:Armature 是一家为开发者工具厂商提供"被 AI 代理选中"增长服务的公司,本身在报告前明示研究服务于其商业目标。驱动其投入的最大趋势来自 Vercel:早在 4 月 Vercel 就披露"超过 30% 的部署由编码代理发起、半年内增长 1000%"。Armature 公司本身是 YC P26 批次项目,由 Louis Scremin 与 Théo Totzenberger(前 Palantir/Joko)联合创立,已获 Palantir/Tsuga/Joko 与 YC 种子轮约 50 万美元支持。
影响:报告直接挑战了"用一个 benchmark 决定编码代理排名"的传统比较方式——同任务在四种语言下出现四种赢家证明,编程语言、仓库语境比 Agent 评测分数更影响实际产出;对供应商而言,文档的可解析性、site:vendor.com 命中度、价格页的展示方式都成了新的 Agent Experience (AX) 工程;对工程团队而言,结果印证 Vercel、Morph、CallSphere 等多家评测的判断——没有全能代理,按任务类型把 Claude Code、Cursor、Codex 组成三件套更现实;对 YC 生态而言,"卖给人"的产品策略需要新增"卖给代理"这一条独立赛道。
总结:16,893 次实测再次确认,AI 编码代理已经具备自主选型、自主实现的工程能力,但其判断远比想象中分散。同样合理的请求会因仓库语言、文档风格、价格展示把开发者引向完全不同的供应商;这意味着编码代理的"选择偏置"正在成为一条新的产品分发渠道,传统 SEO 之外的 Agent Experience (AX) 工程正式进入工具厂商的核心议程。









