AI 写代码总差一点?这个 GitHub 20k+ Stars 的 Skill 给 AI 加了个内置 QA
你有没有发现,现在大部分 AI 编程工具都是”一枪头”模式——生成代码,完事。但实际工作中,一遍过的代码质量往往不够。
GitHub 最近在 awesome-copilot 项目里放了一个叫 agentic-eval 的 Skill,专门解决这件事:给 AI 加一个自我评估 + 迭代改进的闭环。
核心就是一个循环:
生成 → 评估 → 批评 → 优化 → 再生成
听起来简单,但背后有一套完整的评估策略:
1. Basic Reflection(基础反思)
让 AI 生成一次答案后,再让另一个 LLM 调用专门对照标准去评价,标记 PASS/FAIL,然后针对失败的点重新生成。这个模式适合代码、报告、分析报告这类质量要求高的场景。
2. Evaluator-Optimizer(评估器-优化器分离)
把”生成”和”评估”拆成两个独立组件,各自有明确的职责。生成器负责干活,评估器负责打分,分数不达标就打回重做。好处是逻辑清晰,容易调参。
3. Code-Specific Reflection(代码专项反思)
生成代码后自动跑测试,失败了就让 AI 根据报错自己修,修完再跑,再失败再修——最多循环 3 轮。这个对 TDD(测试驱动开发)场景特别有用。
4. 多种评估策略
– Outcome-Based:看输出有没有达到预期结果
– LLM-as-Judge:用另一个 LLM 来对比两条输出哪个更好
– Rubric-Based:按维度打分(准确性 40%、清晰度 30%、完整性 30%),加权算总分
什么时候用?
– 写重要代码不想第一版就埋雷
– 生成报告要求格式/风格达标
– 需要对 AI 输出做质量门槛管控
实话说,这个 Skill 本身更像一套方法论文档(SKILL.md),但他把 Agent 自我提升的核心套路梳理得很清楚,GitHub 20.5k stars 说明开发者对这类”AI 迭代改进”模式的关注度在上升。
如果你用 Claude Code 或者 GitHub Copilot,装上这个 Skill 相当于给 AI 配了一个内置 QA,值得试试。
GitHub 链接:
github/awesome-copilot/skills/agentic-eval
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
评论区
登录后可评论。