你的Prompt到底有没有变好?Promptfoo让AI评价AI,把调 Prompt 变成一门科学
你有没有这种感觉——
调 Prompt 调了半天,感觉「挺好了」,结果一上线,换了个模型,或者用户换个问法,输出就崩了。
这不是你的问题。问题是:你从来没有系统性地测过你的 Prompt。
Promptfoo 是什么
Promptfoo 是一个开源的 LLM 评估框架,GitHub 21,800+ 星,全球最火的 Prompt 测试工具之一。
而这个 Skill,是把 Promptfoo 的能力直接接进 Claude Code——装上之后,Claude 就能帮你:
- 配置 Prompt 评估矩阵
- 写测试用例和断言(assertions)
- 用 LLM-as-Judge 自动打分
- 对比不同模型的表现
- 在 CI 里做回归测试
一句话:不是「感觉 Prompt 变好了」,而是有数据支撑「真的变好了」。
怎么用
安装(一条命令):
npx skills add https://github.com/promptfoo/promptfoo --skill promptfoo-evals
触发方式:
Claude Code 会自动识别包含 promptfoo、eval、LLM evaluation、prompt testing、model comparison 关键词的任务,装上之后直接开口就行。
典型用法:
帮我用 Promptfoo 评估一下这个客服 Prompt,需要覆盖10个测试用例,包括边界情况和幻觉检测。
对比一下 Claude Sonnet 和 GPT-4 在我这段代码审查 Prompt 上的表现,跑20个测试。
核心用法拆解
1. 配置评估矩阵(promptfooconfig.yaml)
providers:
- id: anthropic:messages:claude-sonnet-4-6
- id: openai:gpt-4.1
tests:
file://tests/cases.yaml
一个配置文件,同时测多个模型,输出对比报告。
2. 测试用例(assertions)
- description: "输出包含标准JSON"
assert:
- type: is-json
- type: python
value: file://scripts/metrics.py:custom_check
断言分两类:
– 确定性断言:contains、is-json、regex、cost、latency——免费、快速、可靠
– 模型打分:llm-rubric——用另一个 LLM 来评判输出质量,精确但要花钱
3. LLM-as-Judge
用强模型给弱模型的输出打分:
defaultTest:
assert:
- type: llm-rubric
value: "回答是否准确、简洁、有帮助?"
threshold: 0.7
provider: openai:gpt-4.1-mini
4. Echo Provider(预览模式)
不上 API,直接看渲染后的 Prompt 长什么样:
providers:
- echo # 返回渲染后的 prompt,不调用 API
省钱 + 调试神器。
为什么值得装
Prompt 工程最怕什么?没有基准线。
你优化了一版,比之前「感觉」好一点——但你不知道:
– 原来通过率多少,现在多少?
– 换个模型还能用吗?
– 改了系统 Prompt,有没有意外破坏其他场景?
Promptfoo + Claude = 自动化、可重复、有数据支撑的 Prompt 迭代闭环。
适用场景
| 场景 | 用法 |
|---|---|
| 上线前 QA | 跑全套测试用例,确保 Prompt 没有退化 |
| 模型选型 | 对比 Claude / GPT / Gemini 的输出质量 |
| A/B 测试 | 量化不同 Prompt 版本的效果差异 |
| RAG 评估 | 检测幻觉、验证引用准确性 |
| CI 集成 | 每次提交自动跑 Prompt 回归测试 |
总结
Promptfoo 是目前最专业的 Prompt 评估工具,这个 Skill 把它接进了 Claude Code,让整个测试流程在你的 AI 编程环境里直接跑起来。
装上它,你的 Prompt 就不再是「玄学调优」,而是工程化的、可度量的、可重复的工作流。
GitHub:https://github.com/promptfoo/promptfoo
⭐ 21,800+ Stars | 开源免费 | 支持 Claude Code、Cursor、Windsurf 等主流 AI 编程工具
评论区
登录后可评论。