这个 GitHub 官方 Skill,教 AI 学会自己批改作业
最近在翻 GitHub 官方 awesome-copilot 仓库,发现一个被严重低估的 Skill——agentic-eval。
它的核心功能只有一个:教 AI 学会「自己批改自己的作业」。
听起来简单,但这个思路值千金。
什么是 Agentic Evaluation?
传统 AI 工作流是「一问一答」的单次生成。但 agentic-eval 教你构建一个迭代优化循环:
Generate → Evaluate → Critique → Refine → Output
也就是说,AI 先出一个答案,然后自我审查哪里不行,再改进,再审查,直到达标。这个模式特别适合:
- 代码生成:AI 写代码 → AI 生成测试 → 运行测试 → 有 Bug 就修
- 报告撰写:AI 写初稿 → 按评分维度打分 → 低于阈值就重写
- 复杂分析:AI 出结论 → 交叉验证 → 迭代打磨直到逻辑自洽
三个核心模式,具体可落地
模式一:基础 Reflection
AI 生成答案后,让它用 PASS/FAIL 格式自己打分,FAIL 的维度重点改进。代码示例直接给出,关键技巧是用 JSON 结构化输出,方便程序解析评审结果。
模式二:Evaluator-Optimizer 分离
把「生成器」和「评价器」分成两个独立模块,评分达到阈值(比如 0.8 分)才停止迭代。这个模式适合任务复杂度高、需要多轮打磨的场景。
模式三:代码专项 Reflection
专门为代码设计的测试驱动循环——AI 写代码 → 自动生成 pytest 测试 → 运行报错 → 针对错误修复。相当于给 AI 装了一个永不疲倦的 code reviewer。
实操建议
GitHub 官方给了一个快速启动检查清单:
- 先定义好评判标准(rubric),越具体越好
- 设置迭代上限(3-5 轮),防止 AI 死循环
- 加收敛检测——如果连续两轮分数不提升,直接停
- 全程记录轨迹,方便事后分析哪轮出了问题
这个 Skill 目前在 Smithery 上有 30 次安装,GitHub 仓库 stars 20,589,来自 GitHub 官方 awesome-copilot 项目。适合所有做 AI Agent 开发、对输出质量有要求的团队。
GitHub 链接:
https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
评论区
登录后可评论。