90%的Skill在浪费你的Token——Skill Judge用120分公式给SKILL.md打分
90%的 Skill 在浪费你的 Token——这个框架给它们打分
我在翻 Claude Code 的 Skill 生态时发现了一个扎心的事实:大多数 Skill 的内容,Claude 本身就已经知道了。你装了一个 Skill,它告诉你”要写 clean code””要 handle errors”——这些正确的废话占用了宝贵的上下文窗口,却什么都没贡献。
直到我遇到了 Skill Judge。
核心公式:Good Skill = Expert知识 − Claude已掌握
Skill Judge 是 davila7 在 davila7/claude-code-templates 仓库里推出的一个 Skill 评估框架。它提出了一个反直觉却极其精准的公式:
Good Skill = Expert-only Knowledge − What Claude Already Knows
换句话说,一个 Skill 的价值不取决于它写了多少字,而取决于它提供了多少Claude 本身不知道的专家知识。
Skill Judge 用 8 个维度给 SKILL.md 打分(满分 120),其中最核心的维度叫”知识增量”(Knowledge Delta),占 20 分:
- 0-5分:在讲 Claude 已经知道的基础概念(→ 装了等于没装)
- 6-10分:混合型,有干货但稀释在废话里
- 11-15分:大部分是专家知识,轻微冗余
- 16-20分:纯知识增量,每一段都物有所值
三类知识分类:Expert / Activation / Redundant
Skill Judge 要求你把 Skill 里的每个段落分成三类:
- [E] Expert:Claude 真的不知道——决策树、trade-offs、真实踩坑经验、反模式(”NEVER 做 X,因为 [非显而易见的原因]”)
- [A] Activation:Claude 知道但可能想不起来——简短提醒有用,但多了就是浪费
- [R] Redundant:Claude 肯定知道——for 循环怎么写、什么叫 PDF、怎么处理异常——直接删
这个分类方法让我重新审视了自己的每一个 Skill。发现自己以前写的 Skill 居然有大量 [R] 类内容……
完整评估体系(120分制)
除了 Knowledge Delta,Skill Judge 还考察:
- D2: 心态+流程(15分)——是否传递了专家思维方式
- D3: 反模式质量(15分)——NEVER 列表是否有具体原因
- D4: 规范合规(15分)——frontmatter 是否有效、描述是否完整
- D5: 渐进式披露(15分)——内容是否按需分层加载
- D6: 自由度校准(15分)——指令具体程度是否匹配任务脆弱性
- D7: 模式识别(10分)——是否遵循官方 SKILL.md 规范
- D8: 实用可用性(15分)——Agent 能否真正使用这个 Skill
安装方式
Skill Judge 本身就是一段 SKILL.md,可以直接安装到你的 Claude Code:
npx skills add davila7/claude-code-templates --skill skill-judge
或者手动下载 SKILL.md 放到 ~/.claude/skills/skill-judge/ 下,Claude Code 会自动发现并加载。
为什么这个框架重要
Skill 生態正在爆炸——GitHub 上已有数十万个 Skill 文件。但问题是:没有标准来判断质量。Skill Judge 填补了这个空白。
它的核心洞察是:上下文窗口是公共资源,系统提示词、对话历史、其他 Skills、用户请求都在共享它。一个冗余 Skill 浪费的不只是装它的那个人的 Token,而是整个系统的效率。
这个框架对 Skill 作者来说是一面镜子,对 Skill 消费者来说是一个过滤器。如果你也在写 Skill,或者想评估一个 Skill 值不值得装,Skill Judge 值得一试。
GitHub:https://github.com/davila7/claude-code-templates
Skill 路径:skills/skill-judge/SKILL.md
评论区
登录后可评论。