让你的Skill自己卷自己:达尔文.skill 把 Autoresearch 思路搬进 AI Agent 技能优化

你有没有这种感觉——好不容易写了一个 Skill,跑起来却发现效果差强人意,改来改去也不知道到底改进了没有?

最近发现一个项目,叫「达尔文.skill」,作者把 Karpathy 的 autoresearch 思路搬到了 Skill 优化上。它能自动评估你的 Skill 哪里不行、只改一个维度、跑验证、通过就保留、不通过就回滚——整个过程像训练模型一样可量化。

核心机制:三步走

整个系统其实就三句话:

  • 评估:9 维评分体系(结构质量 + 实际效果),满分 100
  • 改进:每次只改一个维度,启动独立子 agent 打分,不自己改自己评
  • 棘轮:只保留分数上涨的修改,退步一律 revert,分数只升不降

有意思的是「人在回路」设计——每轮优化完会强制暂停,等你确认才继续下一个 skill。这点和全自动的 SkillOpt 不一样,作者认为 Skill 质量比 loss 更微妙,不能没有人工把关。

三个新维度挺戳痛点

v2.0 吸收了微软研究院 SkillLens 论文的实证 rubric,新增三个高价值维度:

  • 失败模式编码:不是简单说「别犯错」,而是把已知失败路径显式写进 Skill
  • 可执行具体性:明文禁止「建议/可以考虑/根据情况」等模糊词
  • 高风险行动黑名单:rm / git reset –hard / force push 等破坏性操作必须显式列禁

实测数据也很能打:huashu-gpt-image skill 从 80.8 提到 91.65(+10.85),darwin-skill 自评从 86.05 提到 92.7。

微软研究院都买单了

2026-06-03,微软在 SkillOpt 仓库更新里直接把 darwin-skill 写进了官方集成名单,评价是「gbrain, gbrain-evals, and darwin-skill have all integrated SkillOpt」。一次双向认可——达尔文吸收了 SkillOpt 的 validation-gated 框架,SkillOpt 把达尔文放进了自己的生态。

适合谁用

  • 手里有 10+ 个 Skill 需要系统维护的开发者
  • 想量化评估 Skill 质量而不是凭感觉改
  • 对「自己改自己评」有警觉,想引入独立评委机制

说实话,5,640 颗星 + 605 个 fork,这个量级不是盖的。如果你对 AI Agent Skill 的工程化有追求,这个项目值得放进收藏夹研究一下。

GitHubhttps://github.com/alchaincyf/darwin-skill


GitHub: https://github.com/alchaincyf/darwin-skill

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 12 阅读