skill-doctor:Warp 开源的这个 Skill,专门给其他 Skill 做体检
用 Claude Code 写了十几条 Skill,结果发现……根本没一条在正确触发?
说出来你可能不信——你装了 20 条 Skill,可能 8 条从来没被调用过,另外 6 条写得触发词根本对不上你的真实需求。
这不是你的问题,是整个 Skill 生态的现状:大家都在发新 Skill,没人告诉你哪条该删、哪条该改。
直到 Warp 团队发了这个。
它是什么
skill-doctor 是 Warp(那个终端)开源的一个 Agent Skill——但它不是用来写代码的,它是用来给其他 Skill 做体检的。
GitHub 仓库:https://github.com/warpdotdev/common-skills
仓库约 562 star,MIT 协议。
怎么跑
装起来只有一条命令:
npx skills add https://github.com/warpdotdev/common-skills --skill skill-doctor
装好后对 Claude Code 说:
“用 skill-doctor 给我做个诊断”
然后它会问你两个问题:
- 看哪些会话?(当前项目 / 所有项目 / 指定目录)
- 评估哪些 Skill?(项目级 + 全局级 / 仅项目级)
确认后自动开跑,不需要任何额外配置。
它到底干什么
第一步:扒本地会话
它会扫描你最近 45 天、至多 12 个会话记录,把每次对话按四套标准打分:
- 效率:有没有绕远路、有没有重复执行
- 代码质量:改动是否合理、是否存在隐患
- 流程合规性:有没有按 Skill 规定的工作流走
- 语言简洁度:有没有废话连篇
打分是曲线的,原始 0–1 分映射成报告用的百分制,分数不可的直接不算进平均,不凑数。
第二步:出体检报告
跑完生成一份 HTML 报告,打开长这样:
- 每个维度的得分(效率 / 代码质量 / 流程合规 / 简洁度)
- 技能覆盖率:你的会话里有多少 Skill 实际被调用了
- 失败会话 TOP 3 问题:具体是哪次会话、具体哪个地方出了问题
- 每条建议都带证据:引用失败会话 ID + 当时的实际问题,直接给出对应 SKILL.md 的修改 diff
举例:某次会话调用了 taste-review,但 CLI 没登录返回 “Not logged in”,agent 原样重跑了一遍,挂了 29 秒最后自己瞎猜答案。skill-doctor 的诊断是:这条 Skill 没写失败路径建议,每次没登录都走死胡同。给出的修改是往 SKILL.md 里加四行处理逻辑。
这种建议你是真的想合并的——因为它指着你自己的一次翻车。
第三步:只写临时目录,不动原文件
所有产物写进 /tmp/skill-doctor-xxxxxx,不会往你的 .claude/skills/ 里塞任何东西。看完觉得有道理,自己手动合并;不想改就直接关掉,零风险。
隐私方面
官方说得很清楚:全程本地跑,任何会话文件不上传。唯一能对外分享的是你自己选择发布的那份报告。
适用场景
你装了太多 Skill,不知道哪些有用
很多人装了 30 条 Skill,但实际活跃的不到 10 条。skill-doctor 直接告诉你哪条从来没触发过——大概率是触发词写得太空泛,或者根本就没在正确的场景被调用。
你想优化现有 Skill 但不知道从哪下手
不是凭感觉改,而是从真实失败会话里找证据。每条建议都溯源到具体的翻车时刻,比拍脑袋写 “best practice” 管用得多。
团队想建立 Skill 质量标准
把报告分享给同事看,统一哪些 Skill 该有什么样的触发描述和错误处理,减少 “Skill 装了但用不上” 的浪费。
总结
skill-doctor 最有意思的地方不是技术,是思路:以前是 AI 帮你写代码,现在 AI 帮你审查你写的提示词。
所有 Skill 玩家都在追求 “更多技能”,它反过来问:”你那堆技能,真的有几条在正常工作?”
GitHub:https://github.com/warpdotdev/common-skills
安装命令在上面,直接试。
评论区
登录后可评论。