Claude Code刚上线了一个新功能:claude plugin eval。简单说就是帮你量化评估你的插件到底有没有用。
以前写了个插件,效果好不好全凭感觉。现在可以创建测试用例,跑一遍有插件的版本,再跑一遍没插件的版本,对比两次结果的差异,直接用数据说话。
我昨天拿自己写的一个代码审查插件试了一下,创建了10个测试用例,跑完发现插件在8个场景下确实提升了审查质量,但有2个场景反而拖慢了速度。这种量化反馈比自己瞎猜靠谱多了。
有个做AI工具开发的朋友看到这个功能,直接开始给自己的每个插件都做一轮eval。以前他总觉得插件效果不错,现在发现有些插件其实是在浪费token,砍掉之后整体效率反而提升了。
这个功能对做Agent开发的人来说特别实用。你可以快速验证哪些插件值得保留,哪些需要优化,哪些应该直接砍掉。不用再靠直觉判断,数据会告诉你答案。
话题来源 @ClaudeDevs
250.1K阅读 ❤️3134 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论
0 反应












