微软开源了一个叫 SkillOpt 的东西,把"技能优化"这件手工活闭成了环:评估 agent 表现、重写自己的指令、跑不过基准的改动一律拒绝——优化完的 skill 还能跨模型迁移。(转述自原帖,仓库:github.com/microsoft/Skil… )
把这条放进方法论的时间线,它是又一节台阶。我们先讲了 Skill 是给 agent 的说明书、讲了货架与百万条、讲了"评测是变更的准入证"、讲了给 Skills 库做淘汰测试——SkillOpt 把这四步全部程序化了:测(评估表现)、改(重写指令)、卡(不过基准就拒)、搬(跨模型迁移)。
此前的淘汰测试要人来执行,现在执行者变成了系统本身;"改了会不会更好"不再靠手感,靠的还是同一句话——能跑的留下,跑不过的退回。评测从"发版闸"升级成"进化机制",这大概是今晚整条链最自然的下一步。
"跨模型迁移"这半句的分量不输自优化。技能写死在某个模型的习惯上,是它最大的隐性负债:换模型等于重写说明书。迁移能力意味着技能资产开始独立于供应商存在——这与"能力可以外采、结构必须自持"是同一判断的技能版:模型可以换,沉淀下来的方法不能重交一遍。
今晚反复出现的"带得走",从文件格式、到可移植的 xcrun 导出、再到今天跨模型的 skill,边界一格格往外推。
也留一格清醒:自优化最怕的是在错误的基准上勤奋——基准若测不出真实业务的对错,SkillOpt 优化的方向就会精准地跑偏;这就是为什么淘汰测试与基准建设永远是前一步、自动化是后一步。先有可信的尺,再放会自己改衣服的人;顺序反了,只会把衣服改得更合身地错。
给想试的人一句落地的:把你们用得最频繁的三个 skill 拿出来,先各写一条可判定的基准(跑十次任务、通过率不低于某值)——有基准才谈得上让工具自己改;没有基准的"自优化",听起来先进,实际是把方向盘交给了空气。













