让你的AI Agent学会”自己审自己”——GitHub官方agentic-eval解读
AI 写代码这件事,大家都习惯了。但你有没有发现——大多数 Agent 输出都是”一次性”的:生成、交付、结束。没有反思、没有自我修正,更没有”我再想想”的环节。
GitHub 官方出的这个 agentic-eval,就是来解决这个问题的。它是一套让 AI Agent 自己评估自己、并且持续改进输出的方法论合集。不是什么新模型,而是给现有 Agent 装上”质检员”大脑的技能包。
核心逻辑:Generate → Evaluate → Critique → Refine
这个循环是整个 skill 的骨架:
- Generate:Agent 先出一个版本
- Evaluate:Agent 用预设标准给自己打分
- Critique:Agent 找自己的毛病,出 JSON 格式的 PASS/FAIL 反馈
- Refine:Agent 根据 critique 改进,再来一轮
最多跑 3-5 轮就收敛,不会无限循环。思路非常干净。
三个实战模式
模式一:Basic Reflection
最基础的自我反思。Agent 生成内容后,再调用一次 LLM 让它用 PASS/FAIL 评价每个维度,然后只针对 FAIL 的点重新生成。适合报告、文档、分析等非结构化输出场景。
模式二:Evaluator-Optimizer
把”生成”和”评价”拆成两个独立组件,各司其职。评价器返回结构化 JSON 分数(accuracy、clarity 等维度),优化器根据反馈改进。适合需要多维度质量把关的生产任务。
模式三:Code-Specific Reflection
代码专用的测试驱动改进:生成代码 → 生成 pytest 测试 → 跑测试 → 出错就修 → 再跑,直到全部通过。相当于给 Claude Code 装了个内置的 TDD 循环。
什么时候用?
- 质量要求高的代码生成任务(金融、医疗、企业级系统)
- 有明确评分标准的报告/文档产出
- 合规性/风格要求严格的对外输出
- 需要”一次更比一次好”的迭代式开发流
上手方式
在 Claude Code 里直接安装:
claude /skills install https://github.com/github/awesome-copilot --skill agentic-eval
也可以用 npx 安装到其他 Agent 环境,支持 Claude Code、Codex、Cursor 等主流工具。
说白了,这个 skill 不是让 AI 更快,是让 AI 更经得起推敲。当你需要把 AI 输出的质量从”能用”拉到”可信”,它值得一试。
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
评论区
登录后可评论。