时间:2026年7月27日
地点:美国加州伯克利
人物:研究机构METR(Model Evaluation and Threat Research)团队,负责人为Beth Barnes
事件详情:2026年7月27日,总部位于加州伯克利的AI评测非营利机构METR正式公开发布了一项名为“支出地平线”(Expenditure Horizon)的新评测指标,用于量化AI智能体在改善AI研发效率方面何时能够真正超越人类。该指标的核心是把AI算力成本、人类劳动时间和实验资源开销统一换算成美元,比较两种路径在相同预算下能带来多大比例的改进。METR在知名开源训练比赛NanoGPT Speedrun上做了实证:人类每带来1%的提速需投入约2500美元的劳动成本,而让六款主流大模型独立尝试时,其“支出地平线”仅在0到3300美元之间,意味着现有AI智能体在更低预算区间尚可占优,一旦预算上升就显著掉队,其中仅GPT-5.5与Opus-4.8跨过了人类曲线。
背景:METR于2023年从老牌AI安全组织拆分独立,目前在伯克利仅有约30名成员,长期负责绘制各种AI能力进化曲线。此前业内衡量AI对AI研发的加速只能依赖零散基准、调查问卷或轶事,定量评估极其匮乏。NanoGPT Speedrun是社区驱动的训练速度比赛,自2024年5月以来训练时间从45分钟压缩到两分钟以内,82个改进步骤累计提速33倍,是METR选中作为“人类价格基准”的天然实验场。
影响:
- 行业首次获得统一的AI对AI研发加速的“美元价值”锚点,便于投资人和政策制定者横向对比不同模型的回报曲线
- 主流模型在低预算段勉强胜出,中高预算下反向落败,暴露当前Agentic AI在复杂工程任务上仍依赖昂贵的人工兜底
- Anthropic、OpenAI等自研公司可把该指标纳入内部研发KPI,倒逼模型在长程任务与工具使用效率上做定向优化
总结:METR这次把AI智能体的真实成本“摆上秤盘”,本质是为AI递归自我改进的争论提供了第一份可复现的实验级证据。结果显示当下代模型对AI研发的助力还很有限:只有在低预算的简单任务里AI才划算,随着预算放大,雇佣人类工程师反而更省钱。下一阶段METR将把Opus-4.8与GPT-5.5等前沿模型扩展到更大算力区间,并开源相关评测脚本,进一步压低Agentic R&D的成本曲线,为下一轮加速周期做准备。
参考来源:
- https://metr.org/blog/2026-07-21-expenditure-horizon/
- https://the-decoder.com/metr-introduces-a-new-metric-to-calculate-exactly-when-ai-agents-become-more-expensive-than-humans/
- https://www.163.com/dy/article/L2SEAC1H05561FZW.html
- https://news.ycombinator.com/item?id=48997951
- https://hub.baai.ac.cn/view/47356