让 AI 自己评自己:agentic-eval 成了代码质量的新守卫
AI 写代码越来越强,但谁来保证输出质量?
最近一个明显的感觉:AI 生成代码的速度已经不再是问题,真正的问题是——生成的代码真的对吗?
特别是在生产环境里,一次 hallucinated 的函数调用、一个漏掉的边界条件,可能比 AI 慢写三倍代价还高。传统做法是靠人工 review,但当 AI 输出量大了十倍,人力 review 的瓶颈就出现了。
最近在 GitHub 上看到 GitHub 官方维护的 agentic-eval Skill(来自 awesome-copilot 仓库,38k+ Stars),思路很有意思——让 AI 自己来评估自己的输出质量,形成迭代改进闭环。
它解决什么问题
agentic-eval 提供了一套评估驱动的生成模式,核心是把「生成」和「评估」拆开,让模型在生成后主动对照标准检查,发现问题再修正。多轮循环直到质量达标或达到迭代上限。
适用于:代码生成、报告撰写、技术分析、任何有明确评判标准的任务。
三种核心模式
Skill 里内置了三种迭代改进模式:
- Basic Reflection:生成 → 自评(JSON 格式返回 PASS/FAIL)→ 针对失败项重写 → 循环。适合结构清晰的评估项。
- Evaluator-Optimizer:把「生成模型」和「评估模型」角色分离,评估器给出分数和维度打分,生成器据此优化。适合需要多维度质量把控的场景。
- Code-Specific Reflection:生成代码后自动生成测试用例,跑测试,失败就修复,再跑,直到通过。相当于给 AI 配了一个自动化测试环。
实际使用方式
安装只需一行命令:
npx skills add github/awesome-copilot --skill agentic-eval
支持 Claude Code、Cursor、Windsurf、OpenClaw、Cline 等所有主流 AI 编程工具。GitHub 官方维护,质量有保障,目前已有 10k+ 安装量。
我的判断
这其实代表了一个趋势:AI Agent 的能力上限,不只取决于模型多强,还取决于有没有好的质量闭环。agentic-eval 把这个闭环做成了可复用的 Skill,任何人都能一键装进自己的工作流里。
如果你在团队里大量用 AI 写代码,或者自己经常需要 AI 生成重要内容——这个 Skill 值得试试。它不会让 AI 变快,但会让输出更可靠。
GitHub 仓库(awesome-copilot,38k+ Stars)
评论区
登录后可评论。