AI Agent 在终端跑了 85 分钟,最强的模型通过率只有 15.2%——这件事今天被一份论文彻底扒开了

AI Agent 在终端跑了 85 分钟,最强的模型通过率只有 15.2%——这件事今天被一份论文彻底扒开了

当一个任务需要几百步操作、跑几十分钟才能判断是否完成的时候,现在最强的 AI Agent 表现是什么样的?

答案很残酷:平均 4.3% 的通过率,最强的那个也只有 15.2%。

这是 Long-Horizon-Terminal-Bench(LHTB)刚刚扒开的数据。这个benchmark 干了件别的评测不敢干的事——它不给 AI “作弊”的机会。

现有评测的遮羞布

之前 Terminal-Bench 这类测试,本质上是一锤子买卖:给 AI 一个任务,做完了看结果对不对。但真实世界的终端任务根本不是这样——中间有无数个”做到一半”的状态,一个任务可能跑 30 分钟才见分晓,中途卡住了你是无法判断 AI 到底在进步还是在兜圈子。

LHTB 做的第一件事就是把这个”中间状态”量化了。它把每个任务拆成细颗粒度的子任务,给中间步骤打分。这样就能看出来:AI 虽然最终没完成,但它到底推进了多少。

测试条件有多苛刻

46 个任务,9 个类别:实验复现、软件工程、多模态分析、交互式游戏、科学计算。每个任务平均要跑 85.3 分钟,消耗 990 万个 token,231 轮交互。这不是普通的评测,这是把 AI 关进”长征考场”。

15 个前沿模型里,最强的那个:

  • 按宽松标准(允许少量失分):Pass@1 = 15.2%
  • 按完美标准(零失误):Pass@1 = 10.9%
  • 平均水平:4.3% / 1.7%

换句话说,你现在随手写的一段代码扔给 AI,让它花一个小时去完成一个多步骤的终端任务,大概率是白跑。

AI 在这里败在哪

论文里分析了几类典型失败模式:

一是”战术勤奋战略懒惰”——AI 能在单步操作里快速试错,但它不知道什么时候该停下来重新规划,导致在一个错误方向上跑了几十步才发现走不通。

二是上下文溢出——990 万 token 的平均消耗已经逼近现有模型的上下文窗口上限,很多任务跑到一半 AI 就开始”失忆”,忘了最开始的目标是什么。

三是虚假进度迷惑——LHTB 的密集奖励机制专门针对这个问题设计,因为它发现 AI 特别擅长在中间步骤制造”看起来有进展”的假象,但实际上并没有真正推进。

为什么这件事值得认真看

因为长时序终端任务是 AI 真正落地生产环境的核心场景——代码自动化运维、数据管道编排、科学实验复现,这些都需要 AI 在终端里持续工作几十分钟甚至几小时。

而现在的 AI Agent 在这个场景里的真实能力,和跑分上的”SOTA”之间的差距,可能比任何人想象的都大。

LHTB 的价值不只是测出了差距,它还给了一个可以复现的基准:任务包以 Harbor 格式发布,评分标准公开,GitHub 和 HuggingFace 上可以直接跑。

下一步怎么走?论文里提到了几个方向:上下文压缩(CompactionRL 已经验证可以把 Terminal-Bench 2.0 的通过率显著提升)、记忆干预(Proactive Memory Agent 在弱模型和强模型上都观察到了”行为状态衰减”现象,有选择地注入记忆可以改善)、以及可验证训练环境的大规模合成(LiteCoder-Terminal 证明这个方向有效)。

但核心瓶颈还是那个:让 AI 在长时序任务上不忘记目标、不迷失方向、不在错误的方向上越跑越远。

这件事,可能比把模型做大、做强更难。


论文来源:arXiv:2607.08964,Li et al.,2026年7月9日提交,2026年7月13日修订
Benchmark:https://zli12321.github.io/LHTB/(GitHub + HuggingFace 公开)

评论区

0 条评论

登录后可评论。

AI 论文日报 16 阅读