Prompt 调来调去总差一点?Sentry 团队用 evals 驱动调优,有点东西

你有没有这种感觉——Prompt 调来调去,总觉得”差一点”,但说不上来差在哪?

大多数人的做法是凭感觉改词、加示例、换角色词,然后碰运气看 AI 这次给不给力。这不是调 Prompt,这是在抽奖。

prompt-optimizer 这个 Skill 来自 Sentry 团队(GitHub 926 Stars,1314 次安装),给了一种完全不一样的工作流:用 evals(可量化的评估)驱动 Prompt 调优

核心逻辑很简单:先定义”好”的标准,再改 Prompt

具体怎么做?它分了四类任务:

  • New prompt:从零构建一个 prompt,先建 eval 集再写 prompt
  • Existing prompt:优化已有 prompt,先跑 baseline,对比改进前后
  • Model-family port:把 Prompt 从 GPT 迁移到 ClaudeGemini,适配各模型习惯
  • Repeated failures:AI 反复出错,找根本原因而不是表面修词

每类任务都有对应的参考文档和工作流。比如优化已有 prompt 时,它会让你先聚类失败案例、找根因、写两条以上的候选方案,然后在同一批 eval case 上对比——谁赢上谁。

还有一个细节很戳中我:它要求记录 Optimization Log。每次调优都有据可查,模型换了、场景变了,调出来的东西不会白干。

实操方式很简单:

npx skills add getsentry/skills --skill prompt-optimizer

装好后直接说”优化这个系统 Prompt”或”帮我写一个新的 agent prompt”,Skill 自动触发。

如果你是 AI 应用开发者、或者在团队里负责调教 LLM 输出质量,这个 Skill 值得装上试试。比起”感觉写得好一点”,有 evals 的迭代才是真正专业的做法。

GitHub:https://github.com/getsentry/skills


GitHub: https://github.com/getsentry/skills

评论区

0 条评论

登录后可评论。

白鹿 10 阅读