调 Prompt 调了十几版还是不稳?试试这套 “Prompt 测试工作流”
写过 Prompt 的人都知道那种感觉——调了十几版,觉得”这版应该更好了吧”,结果一上线发现输出还是飘的。
问题不在于你不够努力,而在于你没有一套可重复的验证机制。
Prompt Tester 就是来解决这个问题的。它的核心思路是:先把”什么是好”定义清楚,再用数据说话,而不是靠玄学调 Prompt。
怎么用?
第一步:定义评估标准
用一张加权评分表说清楚”好”长什么样。比如做客服分类器:
| 标准 | 权重 | 说明 |
|---|---|---|
| 准确率 | 40% | 分类正确 |
| 稳定性 | 25% | 同样输入→同样输出 |
| 延迟 | 15% | 响应时间达标 |
| 格式 | 10% | 输出符合 JSON schema |
| 边界情况 | 10% | 能处理异常输入 |
第二步:建测试用例库
覆盖三类输入:正常情况、边界情况(模糊输入、空输入)、对抗性输入(乱码、垃圾数据)。用 YAML 格式存储,每条包含输入内容、期望分类和标签。
第三步:设计 Prompt 变体
写 2-3 个不同版本的 Prompt。比如:
- 变体A(简洁版):直接下指令,要求返回 JSON
- 变体B(详细版):加角色设定、示例、规则说明
第四步:跑评测,比结果
执行所有变体对所有测试用例,平台会做 JSON schema 验证、打分,最后聚合指标做横向比较。
适合什么场景?
- 搭客服分类机器人:用真实票据数据迭代 Prompt,而不是拍脑袋
- 优化 Agent 系统指令:换了模型或改了指令,上线前跑一遍回归测试
- 做 Prompt 版本管理:每次改动都留有据可查的分数记录
说白了,这套工作流就是让你把 Prompt 当代码来测——有测试用例、有评分、有 diff。
GitHub 仓库里直接有完整的 SKILL.md 可以读,Claude Code / Cursor / Codex 用户一行命令就能装。
GitHub: https://github.com/ComeOnOliver/skillshub
评论区
0 条评论
登录后可评论。