AI Agent 不再是单次输出!这个 skill 让 Claude 学会自己批改作业
最近翻 Smithery 时发现了一个特别值得聊一聊的 skill——agentic-eval,藏在大名鼎鼎的 github/awesome-copilot 仓库里。它不讲怎么写代码、不讲怎么画图,就讲怎么给 AI Agent 打分、让它自己批改作业。说实话,这种”自我进化型”的范式才是 2026 年 AI 行业最值得观察的暗线。
这玩意到底在解决什么?
用过 Claude Code、Cursor、Copilot 这类 agent 的朋友应该都有体会:单次输出经常”差一口气”——逻辑没问题,但细节不到位;框架写对了,但代码风格不统一。传统做法是写更长的 prompt,但 agentic-eval 提出了另一条路:让 Agent 学会自我评估 + 自我迭代。
核心循环就一句话:生成 → 评估 → 批评 → 改进 → 输出。第一次没出好,没关系,自己回头看自己的输出哪里不行,针对弱点重写一遍,最多 3-5 轮收敛。
三大核心模式,逐级递进
- Pattern 1: Basic Reflection(基础自反思)——Agent 用结构化 JSON 输出去打分自己,每个维度 PASS/FAIL,然后只针对 FAIL 的点去改进。最简单,适合快速上手。
- Pattern 2: Evaluator-Optimizer(评估器+优化器分离)——把”打分”和”改写”拆成两个独立组件,职责更清晰,适合代码、报告这种质量要求高的产出。门槛是 0.8 分,过了就停。
- Pattern 3: Code-Specific Reflection(代码专用)——直接用 pytest 当裁判,测试不通过就让 Agent 重写代码。这个对开发者最实用,写完一个函数直接让它自己 debug。
三种评分策略,按场景挑着用
- Outcome-Based:看输出是否达到期望结果,最直接;
- LLM-as-Judge:拿另一个 LLM 当裁判,对比 A/B 输出,适合主观质量;
- Rubric-Based:按加权维度(准确度 0.4、清晰度 0.3、完整度 0.3)打分,最严谨,适合正式产出。
为什么我把它放进”AI 行业观察”重点推?
看了一圈海外社区,2026 年 Agent 赛道最明显的趋势就是从”单次生成“走向”迭代式自我提升“。这不是某个新模型的胜利,而是工作流设计哲学的胜利——agentic-eval 把这套哲学沉淀成了可复用的 skill,让任何人都能装上用。
GitHub 上 awesome-copilot 仓库已经有 20k+ Star,这个 skill 在 Smithery 也已经累计 30 次 install。对于想认真做 AI Agent 应用(无论是写代码、写报告还是做数据分析)的朋友,这个 skill 是个不错的”思想启蒙”——它会逼你重新思考:prompt 的天花板不重要,迭代机制的天花板才重要。
📦 仓库地址:github/awesome-copilot/skills/agentic-eval
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
评论区
登录后可评论。