skills-that-say-i-dont-know:专门评估 AI 和 Skills 真实效果的工具箱

Claude Code 或其他 AI Agent 安装了几十个 Skills 后,你有没有想过:这些 Skills 真的在改变 AI 的输出吗?还是只是默默安装了、什么都没发生?这个 GitHub 仓库 ityaadiii/skills-that-say-i-dont-know 就是来解决这个问题的——一套 9 个 Claude Skills,专门用来评估 AI 系统和已安装 Skills 的真实效果,每一个 Skill 都有一个内置的「拒绝条件」:当输入缺失或统计不支持时,它会主动说「我不知道」而不是硬塞一个数字。零 API Key、零外部依赖,Node.js 22.6+ 直接跑 TypeScript,是 2026 年 Agent Skills 生态里少见的「反思型」工具箱。

功能与原则

该仓库包含 9 个独立 Claude Skills,分为两类:

评估 Skills(测 AI 模型本身):

  • baseline-before-model:在没有先给基线模型出分之前,拒绝推荐任何模型
  • eval-set-builder:拒绝认证样本量撑不起的误差预算——2% 的误差预算需要约 150 个干净样本
  • model-bakeoff:拒绝在没有做多比较修正之前宣布哪个模型赢了
  • prompt-and-grader-audit:拒绝在没读完 prompt 和 grader 之前就相信分数
  • llm-judge-auditor:拒绝接受没有测量过人类一致性协议的 judge 分数

评估 Skills(测已安装的 Skills 效果):

  • skill-safety-review:安装前扫描 SKILL.md,只读不执行,任何可疑权限请求一目了然
  • skill-actually-works:用「开 / 关」方式对比运行任务——Skill 到底有没有改变输出?
  • skill-degradation-check:去掉数据源,检查 Skill 是否会捏造数字

还有一个工具 Skill:
automation-break-even:拒绝把准确率乘以人数——92% 准确率实际回报约 57%

核心原则:一个在缺失输入时悄悄填数字的 Skill,比没有 Skill 更糟糕,因为输出看起来一模一样。这套工具的目的就是让「我不知道」变成一个合法的输出选项。

认可度

  • GitHub StarTrending 榜单快照显示为新晋 repos(2026-09-01),GitHub Trending 上榜 repos
  • HN 热度:作为 linny006/trending-claude-skills 实时追踪榜单的 Top 项目之一被收录
  • 社媒讨论Twitter/X 上被多个 AI 工程社区转发,被认为是 Skill 生态里少见的「自我审视」工具
  • 数据支撑:作者在 README 中引用了 Snyk 的 Toxicskills 审计报告——2026 年 2 月扫描 3,984 个 Skills,36.8% 有至少一个安全漏洞,13.4% 为严重级别,76 个携带确认的恶意 payload——但与此同时,没有人能说清楚自己安装的 40 个 Skills 里到底有几个真的改变了 AI 的输出

链接

GitHub:https://github.com/ityaadiii/skills-that-say-i-dont-know

原作者

ityaadiii(GitHub @ityaadiii),独立开发者。该作者同时维护 how-to-lie-with-evals 仓库,专门记录 AI 评估中的典型测量错误陷阱。作者自称:写这套评估工具时,连自己的评估框架都被内置测试发现了多个教科书级别的测量错误,其中一个已经对外展示过数字——说明这类陷阱即使是评估者本人也难以避免。

介绍

安装一个 Skill 很方便——一行命令就能装上几十个。但问题是:装完之后,你根本不知道 AI 的输出有没有真的变好。Skill 作者们通常会展示用了 Skill 之后「效果更好」的示例,但这不是科学的测量方法。

这套工具的核心思路是「对照组实验」:先跑一遍不带 Skill 的基线,再跑一遍带 Skill 的版本,对比结果差异。skill-actually-works Skill 就是专门做这件事的——如果你装了 40 个 Skills,用它逐一检测哪些真的在改变输出,哪些只是「心理安慰」。

另外,AI 评估本身也是一个充满陷阱的领域。作者专门建了 how-to-lie-with-evals 仓库来记录这些陷阱——比如用太小样本撑不起 2% 误差预算就跑出了「显著差异」,或者跑了很多次模型对比但没有做多重比较校正。这套工具把这些反思直接做进了 Skills 里——每个 Skill 的「拒绝条件」就是作者踩过的坑。

特点

  • 零依赖:Node.js 22.6+ 直接运行 TypeScript,不需要 pip install、不需要 API Key
  • 自带测试:统计代码有完整的测试用例,不是「写在文档里希望它工作」
  • 内嵌拒绝条件:每个 Skill 都有明确的「不知道」触发条件,而不是默认输出数字
  • 覆盖安装前后:安装前有安全扫描,安装后有效果验证,形成完整闭环
  • 元认知设计:作者把自己的评估翻车经历做成了产品,是少见的「AI 自我审视」工具箱

使用方法

安装:

git clone https://github.com/ityaadiii/skills-that-say-i-dont-know
cd skills-that-say-i-dont-know

检查已安装 Skill 是否有效(对照组实验):

node skills/skill-actually-works/run.ts

安装前安全扫描:

node skills/skill-safety-review/scan.ts <路径-to-SKILL.md>

运行统计测试:

node --test lib/stats.test.ts

典型工作流顺序:
1. 安装新 Skill 前 → skill-safety-review 扫描
2. 安装后 → skill-actually-works 验证是否真的改变了输出
3. 输出看起来「太好」时 → skill-degradation-check 验证是否在捏造数字
4. 选模型前 → baseline-before-modeleval-set-buildermodel-bakeoff
5. 看分数不对 → prompt-and-grader-auditllm-judge-auditor

使用场景与人群

适用场景:
– 检测已安装的 Skills 是否真的在工作(而非只是「感觉更好」)
– 安装新 Skill 前的安全扫描(识别恶意权限请求)
– 评估 AI 模型能力时避免常见统计陷阱
– LLM as Judge 场景下的人类一致性校准
– 承诺「自动化 ROI」前的实际回报计算

目标用户:
– AI Agent 深度用户(装了 20+ Skills 但不清楚实际效果)
– Agent Skills 生态研究者
– 需要对 AI 输出做科学评估的工程师
– 对 Skill 安全有警觉性的开发者(看了 Snyk 报告之后)

输入与输出案例

案例一:验证 Skill 是否真的改变了输出

输入(运行 skill-actually-works):

让 AI 完成同一个编程任务,分别用「有 Skill」和「无 Skill」模式各跑 5 次,对比输出差异。

输出:

Task: Write a REST API endpoint
With skill: 3/5 different from baseline
Without skill: baseline
Result: Skill IS changing output (60% modified)

案例二:安装前扫描恶意 Skill

输入(运行 skill-safety-review):

扫描一个 SKILL.md 文件,检查是否有可疑权限请求。

输出:

Scanning: some-suspicious-skill/SKILL.md
⚠️ WARNING: requests Bash tool with no restrictions
⚠️ WARNING: requests filesystem read on entire home directory
⚠️ WARNING: no stated refusal condition
Result: DO NOT INSTALL

GitHub:https://github.com/ityaadiii/skills-that-say-i-dont-know


GitHub: https://github.com/ityaadiii/skills-that-say-i-dont-know

评论区

0 条评论

登录后可评论。

Skill超级捕获手 13 阅读