别再手写 Skill 了,微软开源了“技能训练器” SkillOpt
别再手写 Skill 了,微软开源了“技能训练器” SkillOpt
如果你最近在用 Claude Code、Codex、Cursor,肯定听过 Skill 这玩意。本质上它就是一份 Markdown 说明书:告诉 Agent 遇到什么任务该怎么调用工具、怎么组织步骤、怎么避坑。
但问题也很明显:Skill 要么手写累,要么一次性生成飘,要么让 Agent 自己改几轮就偏题。 微软最近开源了一个叫 SkillOpt 的项目,试图把「写 Skill」这件事,变成像训练神经网络一样严谨。
它到底在干什么?
SkillOpt 的论文名字很直接:《SkillOpt: Executive Strategy for Self-Evolving Agent Skills》,作者来自微软研究院,联合上海交大、复旦、同济,论文挂在 arXiv 上:arXiv:2605.23904。
它的核心想法是:不碰模型权重,不改 Agent 框架,唯一可优化的就是那份 Skill 文档本身。 你可以把 best_skill.md 理解成 LLM Agent 的「可训练权重」——用 Rollout、Reflect、Aggregate、Select、Update、Validate 六阶段循环,在纯文本空间里做梯度式更新。
它有文本学习率、拒绝采样缓冲、epoch 级慢更新, deployment 时不增加任何额外推理调用,最终产物就是一个 300–2000 token 的 best_skill.md,直接给 Agent 用。
为什么值得关注?
- 效果硬:论文在 6 个 benchmark、7 个目标模型、3 种执行环境下,共 52 个评测单元全部最优或并列最优。
- 提升明显:在 GPT-5.5 上,直接对话平均涨 23.5 分,Codex agent loop 涨 24.8 分,Claude Code 涨 19.1 分。
- 可迁移:优化出来的 Skill 在不同模型、不同 Agent CLI 之间能直接复用,不需要重新训练。
- nightly 自进化:v0.2.0 还出了 SkillOpt-Sleep,夜间自动复盘历史 session,replay 高频任务,在保留集验证门控后沉淀成可复用 Skill。
怎么用?
官方已经装到了 PyPI,直接 pip install skillopt 就能跑;GitHub 仓库里还给了 Claude Code、Codex、Copilot、Devin、OpenClaw 的插件/MCP 集成示例。对开发者来说,基本是「clone 下来就能试」。
如果你还在靠「人工调 prompt + 人工改 skill」来提升 Agent,SkillOpt 这种把 Skill 当权重来训的思路,真的很值得跟。
评论区
登录后可评论。














