别再手写 Skill 了,微软开源了“技能训练器” SkillOpt

别再手写 Skill 了,微软开源了“技能训练器” SkillOpt

如果你最近在用 Claude Code、Codex、Cursor,肯定听过 Skill 这玩意。本质上它就是一份 Markdown 说明书:告诉 Agent 遇到什么任务该怎么调用工具、怎么组织步骤、怎么避坑。

但问题也很明显:Skill 要么手写累,要么一次性生成飘,要么让 Agent 自己改几轮就偏题。 微软最近开源了一个叫 SkillOpt 的项目,试图把「写 Skill」这件事,变成像训练神经网络一样严谨。

它到底在干什么?

SkillOpt 的论文名字很直接:《SkillOpt: Executive Strategy for Self-Evolving Agent Skills》,作者来自微软研究院,联合上海交大、复旦、同济,论文挂在 arXiv 上:arXiv:2605.23904

它的核心想法是:不碰模型权重,不改 Agent 框架,唯一可优化的就是那份 Skill 文档本身。 你可以把 best_skill.md 理解成 LLM Agent 的「可训练权重」——用 Rollout、Reflect、Aggregate、Select、Update、Validate 六阶段循环,在纯文本空间里做梯度式更新。

它有文本学习率、拒绝采样缓冲、epoch 级慢更新, deployment 时不增加任何额外推理调用,最终产物就是一个 300–2000 token 的 best_skill.md,直接给 Agent 用。

为什么值得关注?

  • 效果硬:论文在 6 个 benchmark、7 个目标模型、3 种执行环境下,共 52 个评测单元全部最优或并列最优。
  • 提升明显:在 GPT-5.5 上,直接对话平均涨 23.5 分,Codex agent loop 涨 24.8 分,Claude Code 涨 19.1 分。
  • 可迁移:优化出来的 Skill 在不同模型、不同 Agent CLI 之间能直接复用,不需要重新训练。
  • nightly 自进化:v0.2.0 还出了 SkillOpt-Sleep,夜间自动复盘历史 session,replay 高频任务,在保留集验证门控后沉淀成可复用 Skill。

怎么用?

官方已经装到了 PyPI,直接 pip install skillopt 就能跑;GitHub 仓库里还给了 Claude Code、Codex、Copilot、Devin、OpenClaw 的插件/MCP 集成示例。对开发者来说,基本是「clone 下来就能试」。

如果你还在靠「人工调 prompt + 人工改 skill」来提升 Agent,SkillOpt 这种把 Skill 当权重来训的思路,真的很值得跟。


GitHub: https://github.com/microsoft/SkillOpt

评论区

0 条评论

登录后可评论。

查看完整榜单
查看完整榜单
查看完整榜单