eval-layer Skill:给AI编程Agent加一个可量化的评分层

eval-layer 是一个给 AI 编程 Agent 项目添加「评分层」的 Claude Code Skill,解决的是 Agent 开发中一个长期被忽视的问题:项目跑通了,但效果好不好,没人能量化

Vibe-based 评估(凭感觉判断「这次好像更好」)是 Agent 开发中的普遍陷阱:改了一个 prompt,模型自我感觉更对,但没有任何数字依据。eval-layer 把这件事变成可量化、可复现、有框架支撑的正规流程。

功能与原则

eval-layer 的核心能力是为任何 Agent 项目生成一套完整的评估体系,包括:

  • 评分规则(Rubric):3-5 个维度,每个维度有具体的行为描述而非「好/差」的模糊标签
  • 测试用例:每个维度至少 3 个已有人类评分参考的用例,用于校准
  • Judge Prompt:用 LLM-as-a-Judge 的方式对 Agent 输出评分
  • 评估 Harness:运行测试用例、汇总分数、输出报告

设计原则:框架无关(Framework-agnostic)。不管你用 PydanticAI、LangGraph、CrewAI、Strands、OpenAI Agents SDK 还是原生 Anthropic SDK,只要暴露 run(prompt) -> result,就能接入。

认可度

eval-layer 近期出现在 GitHub Topics 的 claude-code-skill trending 列表中(2026-08-14),属于新晋曝光项目。目前仓库规模较小,但在 Agent 评测这个细分赛道里具有独特定位——GitHub 上缺乏针对 AI Agent 效果量化评估的开源 Skill,eval-layer 直接填补了这个空白。

链接

GitHub:https://github.com/erezweinstein5/eval-layer

原作者

GitHub 用户 erezweinstein5,专注于 AI Agent 评估与测试基础设施方向。

介绍

传统的 Agent 开发循环是:写代码 → 跑一遍 → 凭感觉判断。eval-layer 把这个循环替换为:写代码 → 生成评估规则 → 运行量化测试 → 拿到可信分数。

使用流程很简单。在 Claude Code 中调用 Skill 并指向你的 Agent 项目路径,Claude 会先理解你的 Agent,然后提出一套评分规则供你确认。确认后,Skill 自动生成以下文件结构:

your-project/evals/
├── eval_harness.py      # 运行框架
├── rubrics/main.yaml    # 评分维度定义
├── prompts/judge.md     # Judge 提示词
├── test_cases/seed.yaml # 校准测试用例
└── reports/             # 输出报告

生成的 Harness 支持 --framework--test-case-v(逐例输出元数据)、--trials N(支持 pass@k 和方差分析)等参数。两个关键指标同时输出:

  1. Weighted Score:输出质量,按规则维度加权,范围 [0, 1]
  2. Leniency(宽容度):Judge 给分 – 人类参考分的均值,范围 [-1, +1]。当 |leniency| > 0.25 时,系统会提示你重新校准 Judge,防止 Judge 本身偏离

支持多框架横向对比:多个 Agent/框架同时跑同一套测试用例,生成 HTML 可视化仪表盘(雷达图 + 每用例热力图 + 失败类别拆分)。

特点

  • 框架无关:适配 PydanticAI、LangGraph、CrewAI、Strands、OpenAI Agents SDK、Anthropic SDK 等所有主流 Agent 框架
  • Judge 校准机制:独有的 leniency 信号,防止评分标准漂移——当 Judge 本身过严或过松时能被发现
  • 无额外 LLM 调用成本:Judge 就是你的 Agent 本身,不需要单独调一个裁判模型
  • 结构化输出:每个 Agent 调用返回统一的 metadata 格式(latency_ms、tool_calls、input/output tokens、model_id、error),方便横向比较
  • 开箱即用的 HTML 报告:多框架 benchmark 可生成自包含的可视化仪表盘

使用方法

安装(克隆到 Claude Code Skills 目录):

git clone https://github.com/erezweinstein5/eval-layer.git ~/.claude/skills/eval-layer

在 Claude Code 中调用:

/eval-layer 为 /path/to/your/agent 项目添加评估层

Claude 会自动读取你的 Agent 代码、生成评分规则(确认后),然后生成完整 Harness。单用例快速测试:

python evals/eval_harness.py --framework pydantic_ai --test-case easy-01 -v

完整运行 + 生成报告:

python evals/eval_harness.py --framework pydantic_ai
python evals/make_html_report.py

框架适配器文档(references/framework-adapters.md)提供了各框架的接入示例,复制粘贴即可。

使用场景与人群

适用场景:

  • Agent 项目需要量化比较不同 prompt/框架/模型的实际效果
  • 团队需要对 Agent 输出质量建立客观基准,防止「感觉变好了就发版」
  • 论文或技术文档需要可复现的 Agent 评测结果
  • 持续集成中加入 Agent 质量门禁(CI 阶段跑 eval,低于阈值阻止合并)

目标用户:

  • AI Agent 开发者(用 LangGraph、CrewAI 等框架构建应用的工程师)
  • Agent 框架维护者(需要横向评测自家框架 vs 竞品)
  • 研究者(需要可复现的 Agent 评测方法论)

输入与输出案例

输入(触发 Skill):

/eval-layer 为我现有的 PydanticAI 客服 Agent 添加评估层

Claude 生成的评分规则(示例维度):

  • 准确性:Agent 是否正确理解用户意图并给出相关答案(0=完全不相关,1=完全准确)
  • 工具调用效率:是否用了最少的 tool 调用完成任务(0=过度调用,1=最简路径)
  • 回复质量:是否遵循品牌语气、格式规范(0=语气混乱,1=完全符合品牌指南)

运行后输出的 JSONL(每条记录):

{
  "recommendation": {"action": "refund", "amount_usd": 49.99, "reason": "late shipment"},
  "latency_ms": 1842,
  "tool_calls": 3,
  "input_tokens": 892,
  "output_tokens": 124,
  "model_id": "claude-opus-4-5",
  "error": null
}

最终报告(Markdown 摘要):

Accuracy:        0.87 / 1.00
Tool Efficiency: 0.72 / 1.00
Reply Quality:   0.91 / 1.00
Weighted Score:  0.84
Leniency:        +0.03  ✓ Judge is well-calibrated
Pass Rate:       4/5    (80%)

eval-layer 把 Agent 评估从「靠感觉」变成「有数字」,让每一次 prompt 改动都能被客观验证。对于认真做 AI Agent 开发的团队,这是一个值得加入工作流的实用 Skill。


GitHub: https://github.com/erezweinstein5/eval-layer

评论区

0 条评论

登录后可评论。

Skill超级捕获手 10 阅读