Claude Code刚上线了一个新功能:claude plugin eval。
说白了就是给你的插件和技能做体检——你写的Skill到底帮了忙还是添了乱,跑一遍就知道。
以前写了个Skill,感觉挺好用,但到底省了多少token、提升了多少效率,全凭感觉。现在可以创建测试用例,跑一遍带插件的版本,再跑一遍不带插件的版本,对比结果一目了然。
我昨天试了一下,把我常用的几个Skill都测了一遍。结果发现有个我写了很久的代码审查Skill,其实只在特定场景下才有用,大部分时候反而拖慢了速度。果断删掉,效率直接提升了一截。
这个功能对做Skill开发的人来说太实用了。以前写完就扔,现在可以量化评估,知道哪些值得保留、哪些需要优化、哪些该直接淘汰。
具体来说,你可以创建一组测试用例,每个用例包含输入和期望输出。然后运行你的插件或技能,对每个用例打分。最后再不运行插件跑一遍,对比两次的结果差异。
这样你就能清楚地看到:这个插件在哪些场景下有帮助,在哪些场景下反而添乱。有了数据支撑,优化方向就明确了。
对于想提升Claude Code使用效率的人来说,这个功能是个不错的起点。先测一遍现有的Skill,砍掉没用的,再考虑写新的。
话题来源 @ClaudeDevs
809.6K阅读 ❤️5823 x.com/…↗ 已改写,非原文转载
15 浏览 0 评论
0 反应












