这个 GitHub 官方 Skill,教 AI 学会自己批改作业

最近在翻 GitHub 官方 awesome-copilot 仓库,发现一个被严重低估的 Skill——agentic-eval

它的核心功能只有一个:教 AI 学会「自己批改自己的作业」。

听起来简单,但这个思路值千金。


什么是 Agentic Evaluation?

传统 AI 工作流是「一问一答」的单次生成。但 agentic-eval 教你构建一个迭代优化循环

Generate → Evaluate → Critique → Refine → Output

也就是说,AI 先出一个答案,然后自我审查哪里不行,再改进,再审查,直到达标。这个模式特别适合:

  • 代码生成:AI 写代码 → AI 生成测试 → 运行测试 → 有 Bug 就修
  • 报告撰写:AI 写初稿 → 按评分维度打分 → 低于阈值就重写
  • 复杂分析:AI 出结论 → 交叉验证 → 迭代打磨直到逻辑自洽

三个核心模式,具体可落地

模式一:基础 Reflection
AI 生成答案后,让它用 PASS/FAIL 格式自己打分,FAIL 的维度重点改进。代码示例直接给出,关键技巧是用 JSON 结构化输出,方便程序解析评审结果。

模式二:Evaluator-Optimizer 分离
把「生成器」和「评价器」分成两个独立模块,评分达到阈值(比如 0.8 分)才停止迭代。这个模式适合任务复杂度高、需要多轮打磨的场景。

模式三:代码专项 Reflection
专门为代码设计的测试驱动循环——AI 写代码 → 自动生成 pytest 测试 → 运行报错 → 针对错误修复。相当于给 AI 装了一个永不疲倦的 code reviewer。


实操建议

GitHub 官方给了一个快速启动检查清单

  • 先定义好评判标准(rubric),越具体越好
  • 设置迭代上限(3-5 轮),防止 AI 死循环
  • 加收敛检测——如果连续两轮分数不提升,直接停
  • 全程记录轨迹,方便事后分析哪轮出了问题

这个 Skill 目前在 Smithery 上有 30 次安装,GitHub 仓库 stars 20,589,来自 GitHub 官方 awesome-copilot 项目。适合所有做 AI Agent 开发、对输出质量有要求的团队。

GitHub 链接:
https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval


GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 14 阅读