别再拍脑袋测 Prompt 了,用 Promptfoo 把 AI 调教变成工程

别再拍脑袋测 Prompt 了,用 Promptfoo 把 AI 调教变成工程

很多人还在“感觉优化”阶段:把 prompt 改个措辞,发给模型,肉眼判断哪个回复更好,然后就用它了。说实话,这更像炼金术,不是工程。

今天我推荐一个能让你把 Prompt 调教、LLM 评估正式工程化的 Skillpromptfoo-evaluation

它是干什么的?

这个 Skill 基于 Promptfoo 框架,专门给 Claude Code / Codex 这类 AI 编程工具做 Prompt 评测。它会帮你:

  • 批量跑多组 prompt,看哪个版本输出更稳
  • LLM-as-Judge 做自动评分,不用人肉比对
  • 写自定义断言,把业务规则变成可复用的检查项
  • 管理 few-shot examples,避免好 prompt 被版本号玩丢

换句话说,你之前手工做的“A/B 测试 prompt”,它帮你自动化了。

为什么适合 Prompt 工程场景?

如果你是产品经理、算法工程师,或者只是天天和 AI 打交道的开发者,你会遇到这些问题:

  • prompt 改了三次,到底哪版更好?
  • 同一条指令,不同模型回复差异很大,怎么量化?
  • 团队有人改了 system prompt,上线前没做 regression?

这个 Skill 把这些问题变成了命令:一条命令跑全量评测,输出对比结果。比“感觉更好”靠谱一万倍。

使用方法

它已经集成在 daymade/claude-code-skills 仓库里,装好 Claude Code 之后直接 invoke:

# 评测某个 prompt 配置
promptfoo eval

它会读取 promptfooconfig.yaml,跑预设测试用例,然后输出每轮得分的汇总表。你甚至能把它接进 CI,prompt 变更自动触发评测。

小结

Promptfoo-evaluation 的核心价值就一句话:把“我觉得更好”变成“数据证明更好”。如果你还在手工对比 prompt,赶紧试试。

GitHub:https://github.com/daymade/claude-code-skills/tree/main/promptfoo-evaluation


GitHub: https://github.com/daymade/claude-code-skills/tree/main/promptfoo-evaluation

评论区

0 条评论

登录后可评论。

白鹿 943 阅读