GitHub 开源新 Skill:让 AI 自己给自己打分的编程工作流!
你有没有这种感觉——让 AI 写代码,第一版看起来挺对,但就是不知道它到底靠不靠谱?
这就是 Agentic Eval 要解决的问题。
GitHub 前两天悄悄在 awesome-copilot 仓库里上线了一个新 Skill,叫 agentic-eval,专门教 AI Agent 如何自我评测 + 迭代改进。说出来好像很玄,但实际上你完全可以把这个工作流用到自己的 Claude Code / Cursor / VS Code AI 编程流里。
三个核心模式,总有一款适合你
1. Basic Reflection(自我反思)
让 AI 写完代码后,自己给自己打一批评判题——比如”这段代码有没有边界问题?””逻辑是否完整?””有没有安全漏洞?”
for i in range(max_iterations):
critique = llm(f"用 JSON 评价这段代码:{output},标准:{criteria}")
if all_pass:
return output
output = llm(f"根据反馈改进:{failed},原代码:{output}")
本质就是一个 Generate → Evaluate → Refine 的循环,直到所有检查项都 PASS。
2. Evaluator-Optimizer(裁判分离)
把”生成者”和”评判者”拆成两个独立模块,职责更清晰。生成模型负责干活,评判模型负责打分——两个模型可以不同,也允许用同一个但不同的 Prompt。
class EvaluatorOptimizer:
def run(self, task):
output = self.generate(task)
for _ in range(max_iterations):
score = self.evaluate(output, task)
if score >= threshold:
return output
output = self.optimize(output, feedback)
3. Code-Specific Reflection(代码专项)
专门针对代码场景设计的 TDD 循环:AI 生成代码 → AI 生成测试 → 运行测试 → 失败就修 → 直到测试通过。
for _ in range(max_iterations):
result = run_tests(code, tests)
if result["success"]:
return code
code = llm(f"根据错误修复:{result['error']},原代码:{code}")
评测策略:四种武器
| 策略 | 适用场景 |
|---|---|
| Outcome-Based | 有明确正确答案的任务 |
| LLM-as-Judge | 需要对比 A/B 两个方案的优劣 |
| Rubric-Based | 多维度评分(准确性+清晰度+完整性) |
| Test-Driven | 代码生成的质量验收 |
为什么这对编程工具党有用?
我之前写过好几篇关于 Claude Code / Cursor 的文章,有个共同痛点:AI 写代码容易,但判断它写得对不对、够不够好,全靠人肉 Review。
agentic-eval 给了你一套自动化这个 Review 环节的套路。接入工作流后,AI 写代码 → 自己跑测试 → 自己打分 → 不及格就重写——整个过程全自动,你只需要最后看一眼结果。
特别适合:自动化测试还没写完的项目、AI 生成代码需要做合规审查的团队、想给 AI 编程工具加一层质量门的个人开发者。
仓库在 GitHub,Skill 文件就是 SKILL.md,可以直接拽到你的 Claude Code 项目里用。
👉 https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
GitHub: https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval
评论区
登录后可评论。