AI写代码十分钟,验证要三小时?GitHub官方出品的这个Skill让Agent学会自检

你代码写得飞快,但验证了吗?

AI 时代有个新矛盾:生成代码只要几分钟,验证代码可能要几小时。你让 AI 帮你写了个函数,它乖乖交差了——但边界情况对吗?安全漏洞扫了吗?跟项目风格一致吗?你还得从头review一遍。

GitHub 官方出的 agentic-eval,就是来解决这个问题的。

它是什么

这是一个让 AI Agent 学会「自检」的 Skill。装上之后,Agent 不是写完就完事,而是会自动走一个评估→批判→改进的循环,直到质量达标才收手。

核心给了三套模式:

  • Basic Reflection:让 Agent 自己review自己的输出,发现问题就改,改完再review,循环最多3轮。
  • Evaluator-Optimizer:把「生成」和「评估」拆成两个独立步骤,防止自己打分自己放水。
  • Code-Specific Test-Driven Refinement:自动生成测试用例,跑过了才算过——这才是真正的测试驱动开发。

用在哪里

最适合这几类任务:

  • 重要代码生成(支付、安全模块、核心算法)——不能有漏网bug
  • 报告和分析类任务——要求结构清晰、数据准确
  • 代码重构——有测试用例护体,改完不引入新问题
  • 建立 CI 流程——每次 commit 自动触发评估

怎么装

一行命令搞定:

npx skills add https://github.com/github/awesome-copilot --skill agentic-eval

支持 Claude Code、Cursor、GitHub Copilot、Windsurf、OpenClaw 等所有主流 AI 编程工具。

为什么值得关注

GitHub 官方出品,awesome-copilot 仓库累计 27.4K stars,这个 Skill 每周还有 7.9K 的新增安装——完全经过社区验证。

它本质上解决的是一个认知错配:以前我们觉得 AI 写得越多越好,但现在越来越多人意识到——AI 写代码不值钱,能验证代码的 AI 才值钱

GitHub:https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval


GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 13 阅读