90%的Skill在浪费你的Token——Skill Judge用120分公式给SKILL.md打分

90%的 Skill 在浪费你的 Token——这个框架给它们打分

我在翻 Claude Code 的 Skill 生态时发现了一个扎心的事实:大多数 Skill 的内容,Claude 本身就已经知道了。你装了一个 Skill,它告诉你”要写 clean code””要 handle errors”——这些正确的废话占用了宝贵的上下文窗口,却什么都没贡献。

直到我遇到了 Skill Judge

核心公式:Good Skill = Expert知识 − Claude已掌握

Skill Judge 是 davila7 在 davila7/claude-code-templates 仓库里推出的一个 Skill 评估框架。它提出了一个反直觉却极其精准的公式:

Good Skill = Expert-only Knowledge − What Claude Already Knows

换句话说,一个 Skill 的价值不取决于它写了多少字,而取决于它提供了多少Claude 本身不知道的专家知识

Skill Judge 用 8 个维度给 SKILL.md 打分(满分 120),其中最核心的维度叫”知识增量”(Knowledge Delta),占 20 分:

  • 0-5分:在讲 Claude 已经知道的基础概念(→ 装了等于没装)
  • 6-10分:混合型,有干货但稀释在废话里
  • 11-15分:大部分是专家知识,轻微冗余
  • 16-20分:纯知识增量,每一段都物有所值

三类知识分类:Expert / Activation / Redundant

Skill Judge 要求你把 Skill 里的每个段落分成三类:

  • [E] Expert:Claude 真的不知道——决策树、trade-offs、真实踩坑经验、反模式(”NEVER 做 X,因为 [非显而易见的原因]”)
  • [A] Activation:Claude 知道但可能想不起来——简短提醒有用,但多了就是浪费
  • [R] Redundant:Claude 肯定知道——for 循环怎么写、什么叫 PDF、怎么处理异常——直接删

这个分类方法让我重新审视了自己的每一个 Skill。发现自己以前写的 Skill 居然有大量 [R] 类内容……

完整评估体系(120分制)

除了 Knowledge Delta,Skill Judge 还考察:

  • D2: 心态+流程(15分)——是否传递了专家思维方式
  • D3: 反模式质量(15分)——NEVER 列表是否有具体原因
  • D4: 规范合规(15分)——frontmatter 是否有效、描述是否完整
  • D5: 渐进式披露(15分)——内容是否按需分层加载
  • D6: 自由度校准(15分)——指令具体程度是否匹配任务脆弱性
  • D7: 模式识别(10分)——是否遵循官方 SKILL.md 规范
  • D8: 实用可用性(15分)——Agent 能否真正使用这个 Skill

安装方式

Skill Judge 本身就是一段 SKILL.md,可以直接安装到你的 Claude Code:

npx skills add davila7/claude-code-templates --skill skill-judge

或者手动下载 SKILL.md 放到 ~/.claude/skills/skill-judge/ 下,Claude Code 会自动发现并加载。

为什么这个框架重要

Skill 生態正在爆炸——GitHub 上已有数十万个 Skill 文件。但问题是:没有标准来判断质量。Skill Judge 填补了这个空白。

它的核心洞察是:上下文窗口是公共资源,系统提示词、对话历史、其他 Skills、用户请求都在共享它。一个冗余 Skill 浪费的不只是装它的那个人的 Token,而是整个系统的效率。

这个框架对 Skill 作者来说是一面镜子,对 Skill 消费者来说是一个过滤器。如果你也在写 Skill,或者想评估一个 Skill 值不值得装,Skill Judge 值得一试。

GitHubhttps://github.com/davila7/claude-code-templates
Skill 路径skills/skill-judge/SKILL.md


GitHub: https://github.com/davila7/claude-code-templates

评论区

0 条评论

登录后可评论。

陈一铭 12 阅读