时间: 2026年10月2日(北美时间),AI 人才平台 Mercor 发布最新论文《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》,首次用人类基线量化 AI 对白领职业的替代速度。
地点: 美国旧金山(Mercor 总部)/ 全球发布
人物:
- Mercor CEO Brendan Foody 及团队
- 12 名受聘注册会计师(CPA,平均 5.5 年从业经验,全部持证)
- 沃顿商学院教授 Ethan Mollick(评论员)
事件详情: Mercor 邀请 12 名持证 CPA 完成 APEX-Accounting 基准的 4 个月度结账简化场景,与前沿 AI 模型进行直接对比。核心发现:
- **AI 全面领先**:前沿模型在速度、精度、成本三个维度均显著优于人类 CPA,12 名 CPA 完成 4 场景平均耗时 8.7 小时,AI 几秒钟即可完成
- **18 个月加速度**:18 个月前最强 AI 模型得分仍低于 CPA 平均的 37%,如今几乎完美完成同类任务
- **成本降一个数量级**:前沿模型每任务判据成本比人类 CPA 低 10 倍以上
- **完整 APEX-Accounting 榜单**(160 任务,10 家模拟企业):Opus 5.5 Max 61.8% 居首、Fable 5.1 Max 61.0% 次之、GPT-6 Astra 57.9% 第三
- **稳定性瓶颈**:58% 任务从未被任何模型在 8 次尝试中完整解决,最强模型 8 次全过的比例仅 2.6%
背景: APEX-Accounting 是 Mercor 与 Ramp 合作构建的闭源会计基准,含 160 任务、2186 条专家评分标准、10 家模拟企业(虚构但每笔交易均由德勤/普华永道/安永/毕马威前会计师设计),AI 评分法官与专家一致率 97%。Mercor 系列基准还包括 APEX-Agents(投行/律师/咨询,Opus 5.5 Max 73.5% 领先)和 APEX-SWE(软件工程,Opus 5 Max 63.7% 居首)。
影响:
- **就业冲击**:Mercor 因研究"太过火辣"曾考虑不发表,承认 AI 已开始替代初级会计的部分工作
- **生产力拐点**:Ethan Mollick 称即使模型停止进步,会计行业即将获得的生产力红利已足够显著
- **基准设计转向**:前沿基准从"测量 AI 做人类工作"转向"测量原本不可能做到的事"
- **企业实证**:Mercor 自身 ARR 突破 20 亿美元,财务团队仅 3 人,正在用 AI 重构会计部门
总结: Mercor 的人基线研究首次系统量化 AI 对白领职业的替代速度:18 个月内 AI 从落后 CPA 平均分到几乎满分,单位成本比人类低一个数量级。但完整月结账涉及客户沟通、经验沉淀、上下文判断等非结构化任务,仍需人工把关,初级会计师技能价值面临重估。
参考来源:
1. https://www.mercor.com/blog/human-baselines-for-benchmarks-ai-now-outperforms-junior-accountants/
2. https://the-decoder.com/ai-beats-licensed-accountants-on-speed-and-accuracy-but-still-cant-close-the-books-without-supervision/
3. https://mercor.com/apex/apex-accounting-leaderboard/
4. https://agihunt.info/en/p/1a0fa625909f6aadcc25b251f0f
5. https://www.mercor.com/blog/introducing-the-ai-productivity-index-for-accounting
6. https://cdn.sanity.io/files/h6s14f4z/production/4048fb3eece18a56006026d212d25312f7ffc29a.pdf (full paper)







