FrontierHarness Eval – AI 编码工具基准评测框架

LLM大模型 部分免费

技能简介

FrontierHarness Eval 是一套针对 AI 编码 Agent(harness)的标准化评测框架,在相同的 30 个软件工程任务上用同一模型(Kimi K3)测试 9 种主流 coding agent harness 的 pass rate、成本和速度差异。评测结果证明:在模型和任务固定的前提下,更换 harness 可以让通过率从 50% 提升至 66.7%,成本差距达 17.5 倍($1.05~$18.34/次)。项目公开完整的评测数据、任务定义和结果集,供开发者和研究人员验证和参考。

核心能力

  • 标准化基准:30 个软件工程任务(21 个 Terminal-Bench + 9 个 DeepSWE),统一的 verifier-based 评分
  • 9 种主流 Harness 对比:Codex、Claude Code、DSH(Standard/Creator/PTC/Minimal)、Pi、Oh My Pi、Kimi Code、Exo Harness、OpenCode、Hermes
  • 12 种配置方案:每个 harness 提供一种 canonical 配置,加上部分 harness 的额外配置变体
  • 360 次完整评测:每对 task x harness 均完成一次评测,覆盖率 100%
  • 成本精细分析:计算中位成本 per pass、缓存命中率、速度,首次将 cache 读数统一计入成本
  • 公开可验证:评测数据、任务定义和结果集完全公开,附完整的方法论文档

安装配置

获取评测数据:

git clone https://github.com/frontier-harness-eval/eval.git cd eval jq .harnesses[] results/eval-data.json

复现评测需准备对应版本 harness 和 Runta agent runtime。

使用步骤

第一步:了解基准结构,读取 benchmark.json 第二步:用 jq 查询评测结果或访问 https://frontierharness.org 查看交互式报告 第三步:根据质量/成本/速度需求选择适合的 harness 第四步:参考 tasks/ 目录添加自定义评测任务

适用场景

  • Harness 选型:为团队或项目选择成本效益比最优的 coding agent harness
  • 成本优化:识别高价 harness 的替代方案
  • Benchmark 开发:学习构建 coding agent 评测基准
  • Harness 对比研究:对比不同 harness 在 cache 策略和错误恢复上的设计差异

适用人群

  • AI 编码平台开发者,需要选择或优化 coding agent harness
  • 技术团队负责人,评估 AI 辅助编程工具的实际成本效益
  • AI 研究者,研究 coding agent 的 harness 设计对性能的影响
  • 评测基准开发者,学习构建透明可验证的 agent 评测框架

工作原理

FrontierHarness Eval 在隔离 runtime 环境中为每个 task 准备 golden checkpoint,保证每次评测从相同初始状态出发。每个 harness 在相同输入下运行相同任务,由 verifier 判断 pass/fail,汇总为 pass rate、成本和速度三维度结果。评测排除私有基础设施和凭证,只保留公开可复现部分。

官方链接

评测报告:https://frontierharness.org GitHub:https://github.com/frontier-harness-eval/eval 评测解读:https://runta.com/blog/introducing-frontierharness-eval/

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论