Harvey LAB:110亿美元估值法律AI开源的Agent评测基准
Harvey LAB(Legal Agent Benchmark)是 Harvey AI 开源的法律 AI Agent 评测基准,首版包含 1,200+ 任务横跨 24 个法律实践领域,由 75,000+ 条专家级评分规则驱动,填补了长周期法律任务缺乏可量化评测标准的空白。
功能与原则
LAB 由任务数据集和执行评测框架两部分组成:每个任务包含任务指令、客户材料包(相关文档)以及要求 Agent 产出的工作成果,结构完全模拟真实律所的任务分配流程。评测采用 All-Pass Rubric 机制——只有 Agent 的输出完全满足 rubric 中的每条标准才算通过,而非简单的对错二值打分。框架内置多模型适配器,支持 GPT-4o、Claude 3.5 Sonnet、Gemini 等主流模型接入,方便横向对比。
认可度
- GitHub Star:1,077(截至 2026-08-12),今日新增 28 stars,当前处于 GitHub Trending 榜单
- Fork:195
- 任务规模:1,200+ 任务,覆盖 24 个法律实践领域,75,000+ 条评分规则
- 已在 GitHub Trending 今日上榜,尚未公开 Leaderboard,预计短期内由研究合作伙伴发布基线结果
链接
GitHub:https://github.com/harveyai/harvey-labs
原作者
Harvey AI(@harveyai)—— 法律行业 AI 操作系统开发商,2022 年成立,总部位于美国。Harvey AI 于 2026 年 2 月完成由红杉资本与 GIC 联合领投的 2 亿美元融资,估值达 110 亿美元,是当前全球估值最高的法律 AI 独角兽。ARR 已突破 1 亿美元,AmLaw 100 强律所中有 50 家为其客户。
介绍
LAB 是 Harvey AI 为解决”法律 Agent 能力缺乏可量化评测标准”而开源的评测基准。与传统法律 AI 评测不同,LAB 聚焦的是 Agent 完成完整法律任务的能力,而非单步推理。任务覆盖并购尽职调查、合同审查、诉讼支持、合规审查等长周期工作流,每个任务都需要 Agent 自主阅读大量材料、推理、多步操作,最终产出可交付的工作成果。
评测框架包含完整的执行引擎(harness)、任务模型(task model)、工具层(tools)和多模型适配器(adapters)。用户可以在本地运行完整的评测流程,包括任务实例化、Agent 执行、评分和报告生成,并支持跨模型结果对比的 Dashboard。评测方法论文档详细说明了 All-Pass Rubric 评分机制和 LLM Judge 的行为逻辑,确保评分透明、可复现。
LAB 的设计灵感来自 SWE-Bench 等软件工程 Agent 评测基准。Harvey AI 指出,在编程领域,Agent 评测曾是能力跃迁的重要先导指标——Karpathy 称之为”SWE-bench 分数在 12 月前后出现了跃升,编程 Agent 基本上从不可用变成了可用”。LAB 的目标是让法律行业也能获得同样的可量化进步信号。
特点
- 长周期任务设计:任务模拟真实法律工作流,需要 Agent 完成阅读理解、多步推理、文档生成等完整链路,而非简单问答
- All-Pass Rubric 评分:基于 75,000+ 条专家撰写的评分规则,精确衡量 Agent 输出质量,拒绝模糊通过
- 全链路执行框架:内置任务实例化、Agent 执行、评分和报告生成工具,支持本地一键运行完整评测
- 多模型适配器:开箱支持 GPT-4o、Claude 3.5 Sonnet、Gemini 等主流模型,便于横向对比不同模型的 legal agent 能力
- 持续迭代:LAB 是 ongoing 项目,Harvey AI 表示将持续扩充任务集和评测能力,暂无硬性版本锁定
使用方法
安装与运行:
# 克隆仓库
git clone https://github.com/harveyai/harvey-labs.git
cd harvey-labs
# 安装依赖
pip install -e .
# 运行教程任务(M&A data-room 端到端示例)
# 详见 docs/tutorial.md
基本调用流程:
1. 阅读 docs/tutorial.md 了解端到端流程
2. 通过 docs/architecture.md 了解任务模型、harness 和 adapter 的架构
3. 在 tasks/ 目录下选取任务
4. 使用框架内置 adapter 对接目标模型,运行评测
5. 查看 reports/ 目录下的评测报告
框架依赖: Python 3.10+,支持 uv 包管理器(pyproject.toml 管理依赖)
使用场景与人群
LAB 主要面向以下四类用户:
- 模型提供商(如 OpenAI、Anthropic、Google):评估自家模型在法律垂直领域的能力边界
- Agent 开发者(构建法律类 AI Agent 的团队):量化 Agent 能力,发现薄弱环节,指导迭代方向
- 学术研究者:利用公开评测基准开展 AI + 法律领域的学术研究
- 律所 & 企业法务:参考评测结果,了解当前 AI Agent 在哪些法律任务上已达到可部署水平
输入与输出案例
案例 1:并购尽职调查
- 输入:任务指令为”对目标公司的股权结构进行尽职调查”,客户提供包含公司章程、股东协议、历史融资轮次等材料的数据室(data room)
- Agent 行为:阅读所有材料,梳理股权结构图,识别潜在风险点(如代持、限制性条款),输出结构化调查报告
- 评分:Rubric 检查报告是否覆盖所有关键股权条款、风险标注是否准确、输出格式是否符合律所标准
案例 2:合同审查
- 输入:任务指令为”审查一份 SaaS 服务协议中的数据保护条款”,客户提供合同全文及适用的数据保护法规摘要
- Agent 行为:识别合同中所有与数据保护相关的条款,对照法规逐条分析,标注风险点并给出修改建议
- 评分:Rubric 检查是否遗漏关键条款、风险判断是否准确、法律依据引用是否恰当
Harvey LAB 的出现填补了法律 Agent 评测领域的关键空白。首版 1,200+ 任务、24 个实践领域和 75,000+ 评分规则的规模,已让它成为当前最系统的法律 AI Agent 评测基准。110 亿美元估值的 Harvey AI 愿意将这一基准开源,既是行业自信的体现,也是在为整个法律 AI 生态建立共同的度量衡。
评论区
登录后可评论。