Skill写得好不好?用数据说话——skilljack-evals评测CLI
做过 Agent Skill 的同学都知道,最难的不是写 SKILL.md,而是不知道这个 Skill 到底有没有用。
你吭哧吭哧写了一堆指令,上线之后 Agent 该不调用还是不调用。那怎么判断 Skill 真的在起作用?
skilljack-evals 就是来解决这个问题的。
它是什么
一个开源的 Agent Skill 评测 CLI,支持 Claude Agent SDK、Claude Code、Codex 等多种 Agent 运行时。核心思路是:用数据说话——用”有 Skill”和”无 Skill”两组基线做对比实验,量化 Skill 对 Agent 实际效果的提升。
项目地址:https://github.com/olaservo/skilljack-evals(2026 年 1 月创建,8 月有更新,目前 7 Star)
核心用法
整个流程很清晰,三步走:
- 写任务:用
skilljack-evals create-task脚手架一个任务包,里面包含 prompt 和验证条件(checks) - 放 Skill:把待测的 SKILL.md 放进
evals/<task>/environment/skills/目录 - 跑实验:
skilljack-evals run <task>,自动跑 3 组对照实验,输出通过率 + Skill 提升幅度
如果你不想写验证脚本,还有轻量模式——直接用 contains、regex、files_exist 这类声明式 checks,免费且不依赖 LLM Judge。
两个典型场景
场景一:TDD 写 Skill
先写 task.md 和 checks,让 Skill 跑通,然后迭代 SKILL.md 直到 eval 通过。这个循环特别适合在本地开发时快速验证,不用反复人工测试。
场景二:CI 里做回归检测
把任务包提交到 GitHub Actions,设置 skill-lift 阈值(Skill 相对于无基线的提升幅度),每次 PR 跑一遍,低于阈值就 block 合并。这对于 Skill 发布者来说很有价值——有数据依据才敢合入。
为什么值得关注
现在 Agent Skill 的生态在快速扩张,但 Skill 质量参差不齐。skilljack-evals 提供了量化 Skill 价值的能力,而不是靠感觉说”这个 Skill 写得挺好”。
对于 LangChain、LlamaIndex 这类框架的维护者,或者在公司内部搭建 Agent 平台的同学,这个工具可以直接接进 CI,自动化把关 Skill 质量。
快速上手
需要 Node.js >= 20,再配一个 ANTHROPIC_API_KEY:
npm install && npm run build skilljack-evals run evals/example-greeting --runs 1
跑完看输出,就知道你的 Skill 相对无基线有多少提升。
目前生态还比较新,但思路很清晰——Skill 评测是 Agent Skill 大规模应用的前提。如果你在这个方向有积累,值得关注。
评论区
登录后可评论。