Prompt 调来调去总差一点?Sentry 团队用 evals 驱动调优,有点东西
你有没有这种感觉——Prompt 调来调去,总觉得”差一点”,但说不上来差在哪?
大多数人的做法是凭感觉改词、加示例、换角色词,然后碰运气看 AI 这次给不给力。这不是调 Prompt,这是在抽奖。
prompt-optimizer 这个 Skill 来自 Sentry 团队(GitHub 926 Stars,1314 次安装),给了一种完全不一样的工作流:用 evals(可量化的评估)驱动 Prompt 调优。
核心逻辑很简单:先定义”好”的标准,再改 Prompt。
具体怎么做?它分了四类任务:
- New prompt:从零构建一个 prompt,先建 eval 集再写 prompt
- Existing prompt:优化已有 prompt,先跑 baseline,对比改进前后
- Model-family port:把 Prompt 从 GPT 迁移到 Claude 或 Gemini,适配各模型习惯
- Repeated failures:AI 反复出错,找根本原因而不是表面修词
每类任务都有对应的参考文档和工作流。比如优化已有 prompt 时,它会让你先聚类失败案例、找根因、写两条以上的候选方案,然后在同一批 eval case 上对比——谁赢上谁。
还有一个细节很戳中我:它要求记录 Optimization Log。每次调优都有据可查,模型换了、场景变了,调出来的东西不会白干。
实操方式很简单:
npx skills add getsentry/skills --skill prompt-optimizer
装好后直接说”优化这个系统 Prompt”或”帮我写一个新的 agent prompt”,Skill 自动触发。
如果你是 AI 应用开发者、或者在团队里负责调教 LLM 输出质量,这个 Skill 值得装上试试。比起”感觉写得好一点”,有 evals 的迭代才是真正专业的做法。
GitHub:https://github.com/getsentry/skills
评论区
0 条评论
登录后可评论。