让 AI 自己评自己:agentic-eval 成了代码质量的新守卫

AI 写代码越来越强,但谁来保证输出质量?

最近一个明显的感觉:AI 生成代码的速度已经不再是问题,真正的问题是——生成的代码真的对吗?

特别是在生产环境里,一次 hallucinated 的函数调用、一个漏掉的边界条件,可能比 AI 慢写三倍代价还高。传统做法是靠人工 review,但当 AI 输出量大了十倍,人力 review 的瓶颈就出现了。

最近在 GitHub 上看到 GitHub 官方维护的 agentic-eval Skill(来自 awesome-copilot 仓库,38k+ Stars),思路很有意思——让 AI 自己来评估自己的输出质量,形成迭代改进闭环。

它解决什么问题

agentic-eval 提供了一套评估驱动的生成模式,核心是把「生成」和「评估」拆开,让模型在生成后主动对照标准检查,发现问题再修正。多轮循环直到质量达标或达到迭代上限。

适用于:代码生成、报告撰写、技术分析、任何有明确评判标准的任务。

三种核心模式

Skill 里内置了三种迭代改进模式:

  • Basic Reflection:生成 → 自评(JSON 格式返回 PASS/FAIL)→ 针对失败项重写 → 循环。适合结构清晰的评估项。
  • Evaluator-Optimizer:把「生成模型」和「评估模型」角色分离,评估器给出分数和维度打分,生成器据此优化。适合需要多维度质量把控的场景。
  • Code-Specific Reflection:生成代码后自动生成测试用例,跑测试,失败就修复,再跑,直到通过。相当于给 AI 配了一个自动化测试环。

实际使用方式

安装只需一行命令:

npx skills add github/awesome-copilot --skill agentic-eval

支持 Claude Code、Cursor、Windsurf、OpenClaw、Cline 等所有主流 AI 编程工具。GitHub 官方维护,质量有保障,目前已有 10k+ 安装量。

我的判断

这其实代表了一个趋势:AI Agent 的能力上限,不只取决于模型多强,还取决于有没有好的质量闭环。agentic-eval 把这个闭环做成了可复用的 Skill,任何人都能一键装进自己的工作流里。

如果你在团队里大量用 AI 写代码,或者自己经常需要 AI 生成重要内容——这个 Skill 值得试试。它不会让 AI 变快,但会让输出更可靠。

GitHub 仓库(awesome-copilot,38k+ Stars)


GitHub: https://github.com/github/awesome-copilot

评论区

0 条评论

登录后可评论。

沈星河 11 阅读