LongHorizon-Harness:让 AI Agent 真正干完”长任务”的执行框架
LongHorizon-Harness:让 AI Agent 真正干完”长任务”的执行框架
AI Agent 在短时单轮任务上已经相当惊艳,但一旦拉长到需要几十步、跨越桌面应用和终端的长流程任务,模型再强也会”掉链子”——不是模型不够聪明,而是执行循环缺乏工程化设计:上下文累积导致状态漂移、部分失败后进展丢失、无法独立判断”真完成”还是”声称完成”。
LongHorizon-Harness 正是为解决这一系统性问题而生。它不训练新模型,也不替换 Claude Code 或 Codex 的执行循环,而是在外围构建一套”循环工程”(Loop Engineering)架构——规划、行动、验证、检查点/恢复,循环往复直到任务真正交付。
功能与原则
LongHorizon-Harness 的核心定位是长时计算机使用执行框架(long-horizon computer-use harness)。它将现有 AI Agent 改造为可持续运行数十小时的系统,跨越桌面应用和终端 CLI,保留任务状态并在复杂工作流中实现可靠进展。
设计原则遵循三个角色分工,而非让单一 Agent 独自推进:
- Manager(管理器):每轮从原始目标、已验证进展、失败证据和剩余工作中重建上下文,决定下一步
- Executor(执行器):以全新上下文启动,在桌面应用或 CLI 中完成一个明确定义的步骤
- Auditor(审计员):独立检查实际文件、界面、日志和测试结果,不信任执行器的自我声称
只有经过独立验证的结果才能进入可信任务状态,被拒绝的结果保留为证据而非进展。
认可度
- GitHub 星数:截至 2026-08-21 约 869 星(开源仅16天,从初始 232 星高速增长)
- 周新增:+529 stars(2026-08-13 所在周),位列 GitHub AI Agent Trending 第2
- 论文排名:2026-08-06 登顶 Hugging Face 每日论文排行榜第1
- 社区热度:GitHub Topics 页面持续活跃,v0.1.7(2026-08-20)刚发布 Web Workbench 重大更新
链接
GitHub:https://github.com/AMAP-ML/LongHorizon-Harness
原作者
AMAP-ML(阿里巴巴旗下位置服务平台团队)。AMAP 即高德地图,ML = Machine Learning。该团队将高德在导航、物流领域积累的多步规划与验证经验抽象为通用框架,开源给社区。
介绍
LongHorizon-Harness 的核心理念来自一篇 arXiv 论文(arXiv:2608.01964)。论文指出:AI Agent 在长任务上失败,通常不是模型能力问题,而是系统工程的缺失——上下文累积导致状态漂移、部分失败后进展丢失、无法区分”真完成”和”声称完成”。LongHorizon-Harness 对症下药,用架构而非训练来解决。
它的工程实现包含一个 Web Workbench(lh-harness web 命令启动)和一个 CLI 接口。工作流程遵循”规划→行动→验证→检查点/恢复→重复”的循环:Manager 规划下一步bounded step,Executor 在真实计算机环境中执行,Auditor 独立检查实际结果,通过验证则记录检查点,失败则保留证据进入下一轮。
该框架支持多种底层 Agent 后端:Claude Code、Codex、OpenCode、DeepSeek Harness。8月15日新增 OpenCode 支持,8月14日新增 DeepSeek Harness 支持,架构扩展性保持良好。
特点
- 循环工程而非模型训练:不依赖更强模型,用执行循环设计解决长任务失败问题
- 三重角色分工:Manager/Executor/Auditor 各司其职,只有通过独立验证的结果才能推进任务
- 多后端支持:Claude Code、Codex、OpenCode、DeepSeek Harness 可自由切换,不被供应商绑定
- Web Workbench:lh-harness web 提供浏览器内任务管理面板,支持中途发指令、查看进度、停止或重启任务
- 检查点与恢复:每次验证通过后自动保存可信进展,任务中断后可从上一个检查点恢复,不重新来过
- MIT 许可证:完全开源,可商 用
使用方法
安装(一行命令):
pip install longhorizon-harness
或者使用 CLI 直接安装:
lh-harness web # 启动 Web Workbench(推荐)
lh-harness web --agent claude_code --model claude-sonnet-4
命令行运行任务:
lh-harness run "帮我把这个数据分析脚本跑完,生成 PDF 报告"
初始化配置(支持 Claude Code / Codex / OpenCode / DeepSeek Harness):
lh-harness init --agent opencode
lh-harness doctor # 验证环境配置是否正确
使用场景与人群
- 复杂长流程任务:需要跨桌面应用(浏览器、IDE、数据工具)和 CLI 持续运行数十小时的任务,如自动化测试流水线、数据报告生成、文档批量处理
- 需要可信完成保证的场景:当任务失败代价高、无法实时盯守时,Auditor 角色的独立验证提供了额外的安全保障
- 多模型评估:开发者可横向对比 Claude Code / Codex / OpenCode / DeepSeek Harness 在同一长任务上的表现差异
- 目标用户:AI Agent 研究者、需要让 AI 完成真实复杂工作流的工程师、以及评估和对比不同 Agent 后端的开发者
输入与输出案例
案例1:自动化数据分析报告
- 输入:
lh-harness run "读取 /data/sales.csv,做转化率分析,生成带图表的 PDF 周报" - 执行流程:Manager 规划第一步(读取 CSV)→ Executor 在 CLI 执行读取 → Auditor 验证文件内容 → 通过则检查点 → Manager 规划下一步(计算指标)→ 循环往复直到报告生成
- 输出:一份经过 Auditor 逐项验证的 PDF 报告,中途任何步骤失败均保留证据,最终告知”哪一步卡住、为什么”
案例2:跨桌面应用的 UI 测试任务
- 输入:
lh-harness run --agent codex "打开 Chrome,打开电商网站,完成一次完整下单流程" - 执行流程:Manager 将”下单”拆解为导航→搜索→加购→结算等 bounded step;Executor 操作真实浏览器;Auditor 截图对比验证页面状态
- 输出:完整下单流程的每一步验证记录 + 最终截图,可供人工 review 或 CI 集成
评论区
登录后可评论。