Harvey LAB:110亿美元估值法律AI开源的Agent评测基准

Harvey LAB(Legal Agent Benchmark)是 Harvey AI 开源的法律 AI Agent 评测基准,首版包含 1,200+ 任务横跨 24 个法律实践领域,由 75,000+ 条专家级评分规则驱动,填补了长周期法律任务缺乏可量化评测标准的空白。

功能与原则

LAB 由任务数据集和执行评测框架两部分组成:每个任务包含任务指令、客户材料包(相关文档)以及要求 Agent 产出的工作成果,结构完全模拟真实律所的任务分配流程。评测采用 All-Pass Rubric 机制——只有 Agent 的输出完全满足 rubric 中的每条标准才算通过,而非简单的对错二值打分。框架内置多模型适配器,支持 GPT-4o、Claude 3.5 Sonnet、Gemini 等主流模型接入,方便横向对比。

认可度

  • GitHub Star:1,077(截至 2026-08-12),今日新增 28 stars,当前处于 GitHub Trending 榜单
  • Fork:195
  • 任务规模:1,200+ 任务,覆盖 24 个法律实践领域,75,000+ 条评分规则
  • 已在 GitHub Trending 今日上榜,尚未公开 Leaderboard,预计短期内由研究合作伙伴发布基线结果

链接

GitHub:https://github.com/harveyai/harvey-labs

原作者

Harvey AI(@harveyai)—— 法律行业 AI 操作系统开发商,2022 年成立,总部位于美国。Harvey AI 于 2026 年 2 月完成由红杉资本与 GIC 联合领投的 2 亿美元融资,估值达 110 亿美元,是当前全球估值最高的法律 AI 独角兽。ARR 已突破 1 亿美元,AmLaw 100 强律所中有 50 家为其客户。

介绍

LAB 是 Harvey AI 为解决”法律 Agent 能力缺乏可量化评测标准”而开源的评测基准。与传统法律 AI 评测不同,LAB 聚焦的是 Agent 完成完整法律任务的能力,而非单步推理。任务覆盖并购尽职调查、合同审查、诉讼支持、合规审查等长周期工作流,每个任务都需要 Agent 自主阅读大量材料、推理、多步操作,最终产出可交付的工作成果。

评测框架包含完整的执行引擎(harness)、任务模型(task model)、工具层(tools)和多模型适配器(adapters)。用户可以在本地运行完整的评测流程,包括任务实例化、Agent 执行、评分和报告生成,并支持跨模型结果对比的 Dashboard。评测方法论文档详细说明了 All-Pass Rubric 评分机制和 LLM Judge 的行为逻辑,确保评分透明、可复现。

LAB 的设计灵感来自 SWE-Bench 等软件工程 Agent 评测基准。Harvey AI 指出,在编程领域,Agent 评测曾是能力跃迁的重要先导指标——Karpathy 称之为”SWE-bench 分数在 12 月前后出现了跃升,编程 Agent 基本上从不可用变成了可用”。LAB 的目标是让法律行业也能获得同样的可量化进步信号。

特点

  • 长周期任务设计:任务模拟真实法律工作流,需要 Agent 完成阅读理解、多步推理、文档生成等完整链路,而非简单问答
  • All-Pass Rubric 评分:基于 75,000+ 条专家撰写的评分规则,精确衡量 Agent 输出质量,拒绝模糊通过
  • 全链路执行框架:内置任务实例化、Agent 执行、评分和报告生成工具,支持本地一键运行完整评测
  • 多模型适配器:开箱支持 GPT-4o、Claude 3.5 Sonnet、Gemini 等主流模型,便于横向对比不同模型的 legal agent 能力
  • 持续迭代:LAB 是 ongoing 项目,Harvey AI 表示将持续扩充任务集和评测能力,暂无硬性版本锁定

使用方法

安装与运行:

# 克隆仓库
git clone https://github.com/harveyai/harvey-labs.git
cd harvey-labs

# 安装依赖
pip install -e .

# 运行教程任务(M&A data-room 端到端示例)
# 详见 docs/tutorial.md

基本调用流程:
1. 阅读 docs/tutorial.md 了解端到端流程
2. 通过 docs/architecture.md 了解任务模型、harness 和 adapter 的架构
3. 在 tasks/ 目录下选取任务
4. 使用框架内置 adapter 对接目标模型,运行评测
5. 查看 reports/ 目录下的评测报告

框架依赖: Python 3.10+,支持 uv 包管理器(pyproject.toml 管理依赖)

使用场景与人群

LAB 主要面向以下四类用户:

  • 模型提供商(如 OpenAI、Anthropic、Google):评估自家模型在法律垂直领域的能力边界
  • Agent 开发者(构建法律类 AI Agent 的团队):量化 Agent 能力,发现薄弱环节,指导迭代方向
  • 学术研究者:利用公开评测基准开展 AI + 法律领域的学术研究
  • 律所 & 企业法务:参考评测结果,了解当前 AI Agent 在哪些法律任务上已达到可部署水平

输入与输出案例

案例 1:并购尽职调查

  • 输入:任务指令为”对目标公司的股权结构进行尽职调查”,客户提供包含公司章程、股东协议、历史融资轮次等材料的数据室(data room)
  • Agent 行为:阅读所有材料,梳理股权结构图,识别潜在风险点(如代持、限制性条款),输出结构化调查报告
  • 评分:Rubric 检查报告是否覆盖所有关键股权条款、风险标注是否准确、输出格式是否符合律所标准

案例 2:合同审查

  • 输入:任务指令为”审查一份 SaaS 服务协议中的数据保护条款”,客户提供合同全文及适用的数据保护法规摘要
  • Agent 行为:识别合同中所有与数据保护相关的条款,对照法规逐条分析,标注风险点并给出修改建议
  • 评分:Rubric 检查是否遗漏关键条款、风险判断是否准确、法律依据引用是否恰当

Harvey LAB 的出现填补了法律 Agent 评测领域的关键空白。首版 1,200+ 任务、24 个实践领域和 75,000+ 评分规则的规模,已让它成为当前最系统的法律 AI Agent 评测基准。110 亿美元估值的 Harvey AI 愿意将这一基准开源,既是行业自信的体现,也是在为整个法律 AI 生态建立共同的度量衡。


GitHub: https://github.com/harveyai/harvey-labs

评论区

0 条评论

登录后可评论。

Skill超级捕获手 15 阅读