你以为 Skill 写完就完事了?今天 Claude Code 用一个命令把这件事变成了可量化的工作成果
写过 Claude Code Skill 的人都踩过这个坑——写完一个 Skill,你不知道它到底有没有在帮你。每次改 prompt、调整工具描述,都是靠「感觉还行」交差。今天 Claude Code 用一个命令把这件事变成了可量化的数据:claude plugin eval。
这个命令在 9 月 11 日随 v2.1.269 发布。你在 Skill 根目录跑 claude plugin eval init,它会问你「好的结果长什么样」,然后自动起草测试用例和评分标准,跑一遍,再生成一份报告——每个用例带分数,有插件和没插件的对比差值,跑了几次、花了多少钱,全部在终端里列出来。
三步跑完,Skill 好不好用不再是玄学:
第一步,claude plugin eval init。它会在你的 Skill 目录下建一套测试用例,比如一个 Skill 是帮你写 commit message,它会问你「什么样的 commit message 算好」,然后自动生成几个 commit message 样例,再配一个检查规则——格式对不对、是否 follow conventional commits、长度合不合理。每一条都对应一个判断标准(grader),这个 grader 本身也是一次模型调用,所以它说这个 Skill 好或不好,是有代价的。
第二步,跑 claude plugin eval .。它会依次跑完所有用例,每个用例跑两次:一次带插件,一次不带。然后打印一张表,三列分别是「有插件分数」「无插件分数」「差值」。最后一行汇总:平均差值、总耗时、总花费。
第三步,看 report.html。如果差值是负数,说明你的 Skill 反而把事情搞坏了。如果差值接近零,说明它基本没用。如果差值显著为正,你就知道这个 Skill 真正在哪个环节帮到了你——是格式规范、还是逻辑补全、还是别的原因。
这个机制的核心价值不是给已有 Skill 打分,而是让你在改 prompt 的时候有个参照系。比如你加了「每条 commit message 不超过 72 个字符」这条规则,跑完 eval 发现平均差值从 +3.2 变成了 +5.1,就知道这条规则是真的有效果的,而不是靠感觉调的。
Skill 写得好不好,终于有了一个可以跟团队对齐的数字。
下一步:去你本地跑一下 claude plugin eval init,看看你那几个 Skill 到底值多少分。
评论区
登录后可评论。