别再拍脑袋测 Prompt 了,用 Promptfoo 把 AI 调教变成工程
别再拍脑袋测 Prompt 了,用 Promptfoo 把 AI 调教变成工程
很多人还在“感觉优化”阶段:把 prompt 改个措辞,发给模型,肉眼判断哪个回复更好,然后就用它了。说实话,这更像炼金术,不是工程。
今天我推荐一个能让你把 Prompt 调教、LLM 评估正式工程化的 Skill:promptfoo-evaluation。
它是干什么的?
这个 Skill 基于 Promptfoo 框架,专门给 Claude Code / Codex 这类 AI 编程工具做 Prompt 评测。它会帮你:
- 批量跑多组 prompt,看哪个版本输出更稳
- 用 LLM-as-Judge 做自动评分,不用人肉比对
- 写自定义断言,把业务规则变成可复用的检查项
- 管理 few-shot examples,避免好 prompt 被版本号玩丢
换句话说,你之前手工做的“A/B 测试 prompt”,它帮你自动化了。
为什么适合 Prompt 工程场景?
如果你是产品经理、算法工程师,或者只是天天和 AI 打交道的开发者,你会遇到这些问题:
- prompt 改了三次,到底哪版更好?
- 同一条指令,不同模型回复差异很大,怎么量化?
- 团队有人改了 system prompt,上线前没做 regression?
这个 Skill 把这些问题变成了命令:一条命令跑全量评测,输出对比结果。比“感觉更好”靠谱一万倍。
使用方法
它已经集成在 daymade/claude-code-skills 仓库里,装好 Claude Code 之后直接 invoke:
# 评测某个 prompt 配置
promptfoo eval
它会读取 promptfooconfig.yaml,跑预设测试用例,然后输出每轮得分的汇总表。你甚至能把它接进 CI,prompt 变更自动触发评测。
小结
Promptfoo-evaluation 的核心价值就一句话:把“我觉得更好”变成“数据证明更好”。如果你还在手工对比 prompt,赶紧试试。
GitHub:https://github.com/daymade/claude-code-skills/tree/main/promptfoo-evaluation
GitHub: https://github.com/daymade/claude-code-skills/tree/main/promptfoo-evaluation
评论区
0 条评论
登录后可评论。