做Skill的人最头疼一个问题:我写的这个插件到底有没有效果?效果提升了多少?以前只能凭感觉,现在Claude Code给了一个硬核答案。
新功能叫 claude plugin eval,核心逻辑很简单——你创建一组测试用例,先带着插件跑一遍,再不带插件跑一遍,对比两次的得分差异。是骡子是马,数据说话。
具体怎么用?
第一步,定义测试用例。把你日常使用Skill的典型场景整理出来,比如帮我重构这个函数、给这段代码写测试、优化这个提示词。每个用例就是一个标准输入。
第二步,带插件跑。Claude Code会用你的Skill或Plugin处理这些用例,然后打分。评分维度可以自定义,比如代码质量、响应速度、准确度等。
第三步,不带插件跑。同样的用例,同样的模型,去掉插件再来一遍。
第四步,看差异。两次得分一比较,你的插件到底加了多少分、在哪些场景有效、哪些场景反而拖后腿,一目了然。
这对做Skill开发的人来说是个转折点。以前写完插件发出去,好不好用全靠社区反馈,周期长、样本少、主观性强。现在自己就能跑评测,迭代速度会快很多。
举个实际场景:你写了一个代码审查的Skill,觉得挺好用的。但跑完eval发现,在Python场景下提升了30%,在Go场景下反而降了5%。这就有针对性了——要么优化Go场景的逻辑,要么在文档里注明适用范围。
对于用Skill的人来说也有价值。装了一堆插件不知道哪个真有用?跑一轮eval,把效果不明显的卸掉,省token也省心。
Claude Code这波把评测做成了开发流程的一部分,而不是事后补救。Skill生态要健康发展,这种可量化的能力是基础设施级别的。
话题来源 @ClaudeDevs
208.7K阅读 ❤️2891 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应













