AI不会自检?GitHub这个Skill给AI装上自检回路!
你有没有这种感觉——喂给 AI 一段 Prompt,它吐出来的东西总觉得差一口气,但你又说不清差在哪?
问题不是 AI 不够强,是你没给它装上”自检回路”。
今天挖到一个超实用的 Skill——Agentic Evaluation Patterns,来自 GitHub 的 awesome-copilot 项目,专门教 AI 怎么自己给自己打分、自己修自己。
它把 Agent 自我提升的套路拆成了 3 种经典模式:
1. Basic Reflection(基础反思)
最简单粗暴:生成 → 自评 → 不过就改 → 再评 → 通过。
核心是让 AI 用结构化 JSON 输出评审结果,这样你才能拿程序解析它到底哪里没过。
output = llm(f"完成这个任务:{task}")
for i in range(max_iterations):
critique = llm(f"按标准评估:{criteria},输出:{output}")
if all_pass:
return output
output = llm(f"根据反馈改进:{failed}")
2. Evaluator-Optimizer(裁判分离)
生成和评审拆成两个独立模块,各干各的。生成器专心生成,评审器专心打分,分数够了就停,不够就打回重做。
这个模式特别适合代码、报告、分析这类质量要求高的任务。
3. Code-Specific Reflection(代码专项)
生成代码 → 自动写测试 → 运行测试 → 出错就修 → 再跑,直到测试全绿。
相当于给 AI 装了个内置的 TDD 循环,写出来的代码自带一层质量保障。
评测策略也很丰富:
– Outcome-Based:看输出有没有达成目标
– LLM-as-Judge:让另一个 LLM 来当裁判对比两个版本
– Rubric-Based:按维度打分(准确40%、清晰30%、完整30%),加权算总分
实操建议:
– 迭代次数设 3~5 次,防止 AI 陷入死循环
– 每次迭代要检查是否真的在进步(收敛检测),分数没提升就及时止损
– 用 JSON 输出评审结果,方便程序解析,别用纯文本
这个 Skill 对做 Prompt 调教、AI 工作流搭建的朋友特别有价值——它不只告诉你”怎么做”,而是给你一整套可复用的评测思维框架。
GitHub:
https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
评论区
登录后可评论。