Skill写得好不好?用数据说话——skilljack-evals评测CLI

做过 Agent Skill 的同学都知道,最难的不是写 SKILL.md,而是不知道这个 Skill 到底有没有用

你吭哧吭哧写了一堆指令,上线之后 Agent 该不调用还是不调用。那怎么判断 Skill 真的在起作用?

skilljack-evals 就是来解决这个问题的。

它是什么

一个开源的 Agent Skill 评测 CLI,支持 Claude Agent SDK、Claude Code、Codex 等多种 Agent 运行时。核心思路是:用数据说话——用”有 Skill”和”无 Skill”两组基线做对比实验,量化 Skill 对 Agent 实际效果的提升。

项目地址:https://github.com/olaservo/skilljack-evals(2026 年 1 月创建,8 月有更新,目前 7 Star)

核心用法

整个流程很清晰,三步走:

  • 写任务:用 skilljack-evals create-task 脚手架一个任务包,里面包含 prompt 和验证条件(checks)
  • 放 Skill:把待测的 SKILL.md 放进 evals/<task>/environment/skills/ 目录
  • 跑实验skilljack-evals run <task>,自动跑 3 组对照实验,输出通过率 + Skill 提升幅度

如果你不想写验证脚本,还有轻量模式——直接用 containsregexfiles_exist 这类声明式 checks,免费且不依赖 LLM Judge。

两个典型场景

场景一:TDD 写 Skill

先写 task.md 和 checks,让 Skill 跑通,然后迭代 SKILL.md 直到 eval 通过。这个循环特别适合在本地开发时快速验证,不用反复人工测试。

场景二:CI 里做回归检测

把任务包提交到 GitHub Actions,设置 skill-lift 阈值(Skill 相对于无基线的提升幅度),每次 PR 跑一遍,低于阈值就 block 合并。这对于 Skill 发布者来说很有价值——有数据依据才敢合入。

为什么值得关注

现在 Agent Skill 的生态在快速扩张,但 Skill 质量参差不齐。skilljack-evals 提供了量化 Skill 价值的能力,而不是靠感觉说”这个 Skill 写得挺好”。

对于 LangChain、LlamaIndex 这类框架的维护者,或者在公司内部搭建 Agent 平台的同学,这个工具可以直接接进 CI,自动化把关 Skill 质量。

快速上手

需要 Node.js >= 20,再配一个 ANTHROPIC_API_KEY:

npm install && npm run build
skilljack-evals run evals/example-greeting --runs 1

跑完看输出,就知道你的 Skill 相对无基线有多少提升。

目前生态还比较新,但思路很清晰——Skill 评测是 Agent Skill 大规模应用的前提。如果你在这个方向有积累,值得关注。

GitHub 仓库 →


GitHub: https://github.com/olaservo/skilljack-evals

评论区

0 条评论

登录后可评论。

陈一铭 10 阅读