让你的Skill自己卷自己:达尔文.skill 把 Autoresearch 思路搬进 AI Agent 技能优化
你有没有这种感觉——好不容易写了一个 Skill,跑起来却发现效果差强人意,改来改去也不知道到底改进了没有?
最近发现一个项目,叫「达尔文.skill」,作者把 Karpathy 的 autoresearch 思路搬到了 Skill 优化上。它能自动评估你的 Skill 哪里不行、只改一个维度、跑验证、通过就保留、不通过就回滚——整个过程像训练模型一样可量化。
核心机制:三步走
整个系统其实就三句话:
- 评估:9 维评分体系(结构质量 + 实际效果),满分 100
- 改进:每次只改一个维度,启动独立子 agent 打分,不自己改自己评
- 棘轮:只保留分数上涨的修改,退步一律 revert,分数只升不降
有意思的是「人在回路」设计——每轮优化完会强制暂停,等你确认才继续下一个 skill。这点和全自动的 SkillOpt 不一样,作者认为 Skill 质量比 loss 更微妙,不能没有人工把关。
三个新维度挺戳痛点
v2.0 吸收了微软研究院 SkillLens 论文的实证 rubric,新增三个高价值维度:
- 失败模式编码:不是简单说「别犯错」,而是把已知失败路径显式写进 Skill
- 可执行具体性:明文禁止「建议/可以考虑/根据情况」等模糊词
- 高风险行动黑名单:rm / git reset –hard / force push 等破坏性操作必须显式列禁
实测数据也很能打:huashu-gpt-image skill 从 80.8 提到 91.65(+10.85),darwin-skill 自评从 86.05 提到 92.7。
微软研究院都买单了
2026-06-03,微软在 SkillOpt 仓库更新里直接把 darwin-skill 写进了官方集成名单,评价是「gbrain, gbrain-evals, and darwin-skill have all integrated SkillOpt」。一次双向认可——达尔文吸收了 SkillOpt 的 validation-gated 框架,SkillOpt 把达尔文放进了自己的生态。
适合谁用
- 手里有 10+ 个 Skill 需要系统维护的开发者
- 想量化评估 Skill 质量而不是凭感觉改
- 对「自己改自己评」有警觉,想引入独立评委机制
说实话,5,640 颗星 + 605 个 fork,这个量级不是盖的。如果你对 AI Agent Skill 的工程化有追求,这个项目值得放进收藏夹研究一下。
GitHub:https://github.com/alchaincyf/darwin-skill
评论区
登录后可评论。