lamarck-skill:给所有 Skill 装上生产数据反馈环,让它们自己进化
你的 Claude Code 装了几十个 Skill,但它们真的在变好吗?
我见过太多人疯狂装 Skill——一个不满意就换一个,但从来没问过自己一个问题:这些 Skill 真的在进化吗?
今天想聊一个很特别的 Skill,它不是帮你完成某个具体任务的工具,而是给所有 Skill 当”教练”——lamarck-skill。
用进废退:你的 Skill 会衰减
很多人没意识到:Skill 也是会”过时”的。一个 Skill 在 A 项目里很好用,到了 B 项目可能反而拖后腿;或者你装了 50 个 Skill,实际用到的就 5 个,剩下的全是噪音。
lamarck-skill 的思路很简单粗暴:让每个 Skill 都在真实工作中接受考核。它会在每次你使用 Skill 后记录数据,积累到一定程度就判断:这个 Skill 到底好不好?哪些提示词需要改?哪些场景它根本不适应?
不是帮你打分,是帮你改进
市面上大多数 Skill 优化方案是:给你一套 benchmark,跑测试,打分。lamarck 不一样,它的信号源是你真实的编码会话。
具体来说:
- 每一次调用 Skill,都会生成一条证据记录(写入本地 data/pending.jsonl)
- 到 turn 结束时,触发一个轻量评估循环,对这次 Skill 使用打四维评分
- 当某个 Skill 的评分多次低于阈值,才触发”进化提案”——不是自动改,而是生成一个bounded edit 建议,等你批准
- 所有改动都写入 CHANGELOG.md,可回滚
这意味着:你的 Skill 优化是用真实生产数据喂出来的,而不是人工构造的测试用例。
支持多 Agent,也支持”用进废退”
lamarck-skill 目前支持 Claude Code、Codex、Cursor 和 pi 四个主流 Agent,所有证据写入同一个 ledger。所以你在不同工具里用的 Skill,共享同一套进化数据。
更有意思的是它的”信任层级”设计:
- 新装上的 Skill 默认处于”观察模式”(observe),只记录不评价
- 你认可某个 Skill 后可以提升到”进化模式”(evolve),它开始提建议
- 如果你特别信任一个 Skill,可以设成”自动模式”(auto),但即使在这里,每次改动还是会被 replay 验证——验证失败立刻回滚
如果某个 Skill 长期评分很高,它会进入”稳定模式”(stable),减少评估频率;一旦出现用户纠正或场景变化,立刻唤醒。
适合谁用?
如果你符合以下任意一条,lamarck 值得一试:
- 装了 20+ 个 Skill,但不知道哪些真正在帮你
- 团队多人使用 Agent,想积累一套”我们都认可的 Skill 进化记录”
- 不想每次改 Skill 全靠感觉,想有数据支撑
一句话总结
lamarck-skill 是给 Skill 装上了”使用数据反馈环”——不靠 benchmark,靠你真实的工作流来决定哪些 Skill 该进化、哪些该淘汰。
安装方式(Node 18+):
npx lamarck-skill
GitHub:https://github.com/newdee/lamarck-skill
评论区
登录后可评论。