eval-layer Skill:给AI编程Agent加一个可量化的评分层
eval-layer 是一个给 AI 编程 Agent 项目添加「评分层」的 Claude Code Skill,解决的是 Agent 开发中一个长期被忽视的问题:项目跑通了,但效果好不好,没人能量化。
Vibe-based 评估(凭感觉判断「这次好像更好」)是 Agent 开发中的普遍陷阱:改了一个 prompt,模型自我感觉更对,但没有任何数字依据。eval-layer 把这件事变成可量化、可复现、有框架支撑的正规流程。
功能与原则
eval-layer 的核心能力是为任何 Agent 项目生成一套完整的评估体系,包括:
- 评分规则(Rubric):3-5 个维度,每个维度有具体的行为描述而非「好/差」的模糊标签
- 测试用例:每个维度至少 3 个已有人类评分参考的用例,用于校准
- Judge Prompt:用 LLM-as-a-Judge 的方式对 Agent 输出评分
- 评估 Harness:运行测试用例、汇总分数、输出报告
设计原则:框架无关(Framework-agnostic)。不管你用 PydanticAI、LangGraph、CrewAI、Strands、OpenAI Agents SDK 还是原生 Anthropic SDK,只要暴露 run(prompt) -> result,就能接入。
认可度
eval-layer 近期出现在 GitHub Topics 的 claude-code-skill trending 列表中(2026-08-14),属于新晋曝光项目。目前仓库规模较小,但在 Agent 评测这个细分赛道里具有独特定位——GitHub 上缺乏针对 AI Agent 效果量化评估的开源 Skill,eval-layer 直接填补了这个空白。
链接
GitHub:https://github.com/erezweinstein5/eval-layer
原作者
GitHub 用户 erezweinstein5,专注于 AI Agent 评估与测试基础设施方向。
介绍
传统的 Agent 开发循环是:写代码 → 跑一遍 → 凭感觉判断。eval-layer 把这个循环替换为:写代码 → 生成评估规则 → 运行量化测试 → 拿到可信分数。
使用流程很简单。在 Claude Code 中调用 Skill 并指向你的 Agent 项目路径,Claude 会先理解你的 Agent,然后提出一套评分规则供你确认。确认后,Skill 自动生成以下文件结构:
your-project/evals/
├── eval_harness.py # 运行框架
├── rubrics/main.yaml # 评分维度定义
├── prompts/judge.md # Judge 提示词
├── test_cases/seed.yaml # 校准测试用例
└── reports/ # 输出报告
生成的 Harness 支持 --framework、--test-case、-v(逐例输出元数据)、--trials N(支持 pass@k 和方差分析)等参数。两个关键指标同时输出:
- Weighted Score:输出质量,按规则维度加权,范围 [0, 1]
- Leniency(宽容度):Judge 给分 – 人类参考分的均值,范围 [-1, +1]。当 |leniency| > 0.25 时,系统会提示你重新校准 Judge,防止 Judge 本身偏离
支持多框架横向对比:多个 Agent/框架同时跑同一套测试用例,生成 HTML 可视化仪表盘(雷达图 + 每用例热力图 + 失败类别拆分)。
特点
- 框架无关:适配 PydanticAI、LangGraph、CrewAI、Strands、OpenAI Agents SDK、Anthropic SDK 等所有主流 Agent 框架
- Judge 校准机制:独有的 leniency 信号,防止评分标准漂移——当 Judge 本身过严或过松时能被发现
- 无额外 LLM 调用成本:Judge 就是你的 Agent 本身,不需要单独调一个裁判模型
- 结构化输出:每个 Agent 调用返回统一的 metadata 格式(latency_ms、tool_calls、input/output tokens、model_id、error),方便横向比较
- 开箱即用的 HTML 报告:多框架 benchmark 可生成自包含的可视化仪表盘
使用方法
安装(克隆到 Claude Code Skills 目录):
git clone https://github.com/erezweinstein5/eval-layer.git ~/.claude/skills/eval-layer
在 Claude Code 中调用:
/eval-layer 为 /path/to/your/agent 项目添加评估层
Claude 会自动读取你的 Agent 代码、生成评分规则(确认后),然后生成完整 Harness。单用例快速测试:
python evals/eval_harness.py --framework pydantic_ai --test-case easy-01 -v
完整运行 + 生成报告:
python evals/eval_harness.py --framework pydantic_ai
python evals/make_html_report.py
框架适配器文档(references/framework-adapters.md)提供了各框架的接入示例,复制粘贴即可。
使用场景与人群
适用场景:
- Agent 项目需要量化比较不同 prompt/框架/模型的实际效果
- 团队需要对 Agent 输出质量建立客观基准,防止「感觉变好了就发版」
- 论文或技术文档需要可复现的 Agent 评测结果
- 持续集成中加入 Agent 质量门禁(CI 阶段跑 eval,低于阈值阻止合并)
目标用户:
- AI Agent 开发者(用 LangGraph、CrewAI 等框架构建应用的工程师)
- Agent 框架维护者(需要横向评测自家框架 vs 竞品)
- 研究者(需要可复现的 Agent 评测方法论)
输入与输出案例
输入(触发 Skill):
/eval-layer 为我现有的 PydanticAI 客服 Agent 添加评估层
Claude 生成的评分规则(示例维度):
- 准确性:Agent 是否正确理解用户意图并给出相关答案(0=完全不相关,1=完全准确)
- 工具调用效率:是否用了最少的 tool 调用完成任务(0=过度调用,1=最简路径)
- 回复质量:是否遵循品牌语气、格式规范(0=语气混乱,1=完全符合品牌指南)
运行后输出的 JSONL(每条记录):
{
"recommendation": {"action": "refund", "amount_usd": 49.99, "reason": "late shipment"},
"latency_ms": 1842,
"tool_calls": 3,
"input_tokens": 892,
"output_tokens": 124,
"model_id": "claude-opus-4-5",
"error": null
}
最终报告(Markdown 摘要):
Accuracy: 0.87 / 1.00
Tool Efficiency: 0.72 / 1.00
Reply Quality: 0.91 / 1.00
Weighted Score: 0.84
Leniency: +0.03 ✓ Judge is well-calibrated
Pass Rate: 4/5 (80%)
eval-layer 把 Agent 评估从「靠感觉」变成「有数字」,让每一次 prompt 改动都能被客观验证。对于认真做 AI Agent 开发的团队,这是一个值得加入工作流的实用 Skill。
评论区
登录后可评论。