skill-doctor:Warp 开源的这个 Skill,专门给其他 Skill 做体检

用 Claude Code 写了十几条 Skill,结果发现……根本没一条在正确触发?

说出来你可能不信——你装了 20 条 Skill,可能 8 条从来没被调用过,另外 6 条写得触发词根本对不上你的真实需求。

这不是你的问题,是整个 Skill 生态的现状:大家都在发新 Skill,没人告诉你哪条该删、哪条该改。

直到 Warp 团队发了这个。

它是什么

skill-doctor 是 Warp(那个终端)开源的一个 Agent Skill——但它不是用来写代码的,它是用来给其他 Skill 做体检的。

GitHub 仓库:https://github.com/warpdotdev/common-skills

仓库约 562 star,MIT 协议。

怎么跑

装起来只有一条命令:

npx skills add https://github.com/warpdotdev/common-skills --skill skill-doctor

装好后对 Claude Code 说:

“用 skill-doctor 给我做个诊断”

然后它会问你两个问题:

  1. 看哪些会话?(当前项目 / 所有项目 / 指定目录)
  2. 评估哪些 Skill?(项目级 + 全局级 / 仅项目级)

确认后自动开跑,不需要任何额外配置。

它到底干什么

第一步:扒本地会话

它会扫描你最近 45 天、至多 12 个会话记录,把每次对话按四套标准打分:

  • 效率:有没有绕远路、有没有重复执行
  • 代码质量:改动是否合理、是否存在隐患
  • 流程合规性:有没有按 Skill 规定的工作流走
  • 语言简洁度:有没有废话连篇

打分是曲线的,原始 0–1 分映射成报告用的百分制,分数不可的直接不算进平均,不凑数。

第二步:出体检报告

跑完生成一份 HTML 报告,打开长这样:

  • 每个维度的得分(效率 / 代码质量 / 流程合规 / 简洁度)
  • 技能覆盖率:你的会话里有多少 Skill 实际被调用了
  • 失败会话 TOP 3 问题:具体是哪次会话、具体哪个地方出了问题
  • 每条建议都带证据:引用失败会话 ID + 当时的实际问题,直接给出对应 SKILL.md 的修改 diff

举例:某次会话调用了 taste-review,但 CLI 没登录返回 “Not logged in”,agent 原样重跑了一遍,挂了 29 秒最后自己瞎猜答案。skill-doctor 的诊断是:这条 Skill 没写失败路径建议,每次没登录都走死胡同。给出的修改是往 SKILL.md 里加四行处理逻辑。

这种建议你是真的想合并的——因为它指着你自己的一次翻车。

第三步:只写临时目录,不动原文件

所有产物写进 /tmp/skill-doctor-xxxxxx,不会往你的 .claude/skills/ 里塞任何东西。看完觉得有道理,自己手动合并;不想改就直接关掉,零风险。

隐私方面

官方说得很清楚:全程本地跑,任何会话文件不上传。唯一能对外分享的是你自己选择发布的那份报告。

适用场景

你装了太多 Skill,不知道哪些有用

很多人装了 30 条 Skill,但实际活跃的不到 10 条。skill-doctor 直接告诉你哪条从来没触发过——大概率是触发词写得太空泛,或者根本就没在正确的场景被调用。

你想优化现有 Skill 但不知道从哪下手

不是凭感觉改,而是从真实失败会话里找证据。每条建议都溯源到具体的翻车时刻,比拍脑袋写 “best practice” 管用得多。

团队想建立 Skill 质量标准

把报告分享给同事看,统一哪些 Skill 该有什么样的触发描述和错误处理,减少 “Skill 装了但用不上” 的浪费。

总结

skill-doctor 最有意思的地方不是技术,是思路:以前是 AI 帮你写代码,现在 AI 帮你审查你写的提示词。

所有 Skill 玩家都在追求 “更多技能”,它反过来问:”你那堆技能,真的有几条在正常工作?”

GitHub:https://github.com/warpdotdev/common-skills

安装命令在上面,直接试。


GitHub: https://github.com/warpdotdev/common-skills

评论区

0 条评论

登录后可评论。

苏棠 16 阅读