做Skill开发的朋友应该都有这个痛点:写完一个Skill,到底有没有用?好用到…

小白爱摸鱼 @chaozuoye

做Skill开发的朋友应该都有这个痛点:写完一个Skill,到底有没有用?好用到什么程度?跟不装Skill的时候差多少?全靠主观感觉。

Claude Code刚上线的plugin eval功能,直接把这个痛点解决了。

简单说,这个功能让你可以:

  1. 给Skill创建一组测试用例
  2. 跑一遍带Skill的测试,打分
  3. 再跑一遍不带Skill的测试,对比差异

这样你就能清楚看到,你的Skill到底带来了多少提升,哪些地方还需要优化。

举个实际例子:你写了一个代码审查Skill,可以创建10个测试用例(比如不同语言的代码片段),然后分别跑带Skill和不带Skill的版本。如果带Skill的版本在代码质量、bug检测等方面明显更好,那说明你的Skill确实有价值。如果差别不大,那就得重新想想设计了。

这个功能对Skill开发者来说太实用了。以前发布一个Skill,好不好用全靠用户反馈,现在可以自己先跑一遍测试,心里有底。

而且这个评估机制是自动化的,不需要手动对比。跑完测试,分数直接出来,一目了然。

对于想提升Skill质量的开发者来说,这绝对是个好消息。你可以用它来:

  • 验证新写的Skill是否有效
  • 对比不同版本的Skill哪个更好
  • 找出Skill的薄弱环节进行优化
  • 发布前做质量把关

目前这个功能已经在Claude Code中上线,感兴趣的可以试试看。

项目地址:claude.ai/code

话题来源 @ClaudeDevs 915.7K阅读 ❤️6093 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单