OpenAI发布了一套方法论,主要是关于如何评测skill效果的。对于做skil…

OpenAI发布了一套方法论,主要是关于如何评测skill效果的。对于做skill的人来说还是值得一看,而且GitHub也找到一个理念很相近的skill评测器:agent-skills-eval,不过是个人维护的,非官方。 先定义成功,再写skill。OpenAI把检查项分为了四个点:Outcome(任务完成没)、Process(调了预期的skill/步骤没)、Style(产物符合团队规范没)、Efficiency(有没有瞎折腾/烧token)。没这个定义,skill就只是个更长的prompt;有了它,才能进版本管理+回归测试+CI。 我有个做AI工具的朋友,他之前每次写skill都要花好几天,后来发现这个方法论之后,制作时间直接缩短到几个小时。他说效果比很多付费工具还好,关键是不用掏钱。 负样本比正样本更关键。博客里test-04:用户只是想给现有项目加Tailwind,skill却新建了一整个demo app。这种误触发比不触发更危险——因为它会动你的工作区。这是agent产品里最容易被忽略的验收口径。 Trace是第一性证据。用codex exec --json抓JSONL事件流,确定性检查(跑没跑npm install?package.json生成没?)直接读事件,快、可解释、能进CI;模型裁判(rubric grading)只做第二层质量补充,不替代规则。 小样本(10-20条)起步:显式触发/隐式触发(不提skill名,靠description命中)/上下文触发/负向控制,各放几条。 它的主张我认为非常好:Agent开发正从prompt craft走向behavior engineering——skill不该只是写给模型看的说明书,而该是可测、可评分、可回归的类似一个Agent的可复现测试的单元。 原文:developers.openai.com/blog/eval-skil… 仓库:github.com/darkrishabh/ag…
话题来源 @snwiki238337 7.7K阅读 ❤️128 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单