让AI自己打分的时代来了——agentic-eval让ChatGPT们学会迭代改进

你有没有这种感觉——AI 助手第一遍回答总觉得差点意思,但又说不上来哪里不对?

这其实是现在 AI 应用的普遍瓶颈:生成靠猜,评价靠人。每次都要人来判断输出好不好,再手动打回去让 AI 改,效率极低。

GitHub 刚上线的 agentic-eval Skill,就是来解决这个问题的。它把「AI 自我批判 → 自我改进」做成了标准化的设计模式,让你调 AI 不再是一次性买卖,而是个闭环迭代系统。

三个核心模式,总有一款适合你

1. Basic Reflection(基础反思)
最简单粗暴:让 AI 回答完后,自己对照评价标准给自己打分。JSON 结构化输出 → 解析 → 发现 FAIL 项 → 打回去重写 → 再评。循环 3 轮通常就能收敛。

2. Evaluator-Optimizer(裁判分离)
生成和评价分开,各司其职。Evaluator 专注打分(准确率/清晰度/完整性三维),只有总分低于阈值才触发优化。这个模式特别适合对输出质量有明确要求的场景,比如报告生成、代码审查。

3. Code-Specific Reflection(代码专项)
生成代码 → 自动生成 pytest 测试 → 运行测试 → 出错就修复 → 再跑。真正的测试驱动开发(TDD)闭环,AI 帮你写测试、帮你修 bug,不用人盯着跑。

什么场景用它最香?

  • 质量关键型任务:写代码、分析报告、生成文档,有了评价循环就不会带硬伤上线
  • 有明确评估标准:合规检查、格式规范、风格指南这类”对不对、好不好”有客观标准的
  • 需要迭代打磨的内容:重要邮件、方案文档、用户案例,一轮自评顶人工 review 三遍

怎么用?

Claude Code、Cursor、VS Code 等主流 AI 编程工具里安装这个 Skill,然后:

# 以 Basic Reflection 为例
output = llm(f"Complete this task: {task}")
for i in range(max_iterations):
    critique = llm(f"Evaluate against criteria: {criteria}")
    # PASS 就退出,FAIL 就继续改

安装命令:npx skills add https://github.com/github/awesome-copilot --skill agentic-eval

GitHub 上还有完整代码示例和最佳实践清单,包含收敛检测、迭代日志、异常处理等工程细节——这不只是个提示词模板,是可以直接落地的工程方案。

说实话,「让 AI 自己评价自己」这件事,我之前觉得是噱头。但看了这套框架的设计逻辑,发现它真正解决的是评价标准化的问题:把”好不好”这个模糊判断变成了结构化打分,AI 才能真正根据反馈迭代,而不是瞎改。

GitHubhttps://github.com/github/awesome-copilot/tree/main/skills/agentic-eval


GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval

评论区

0 条评论

登录后可评论。

沈星河 13 阅读