你的 AI 助手,真的会”自检”吗?——agent-self-evaluation 评测
你的 AI 助手,真的会”自检”吗?
用 Claude Code 跑了半天,输出一大串——结果你心里还是没底:这质量到底行不行?
这个问题不只是你一个人的困惑。即便是再强的模型,也会在复杂任务里漏边角、过度自信、或者输出了一堆你根本用不上的东西。
ECC 团队最近出了一个新 Skill,专门解决这个:agent-self-evaluation。
它是干嘛的
简单说,就是给 AI Agent 装了一个”自检模块”。每当完成一个复杂任务(3+ 文件、50+ 行代码,或者一个完整的工作流),它会停下来,用一套5 轴评分体系给自己打分:
- 准确性:事实、API 名字、语法都对吗?
- 完整性:用户要的都覆盖了吗?
- 清晰度:解释能看懂吗?
- 可操作性:用户能直接上手用吗?
- 简洁度:有没有废话?
每个维度 1-5 分,低于 4 分必须给出具体证据——不能只说”可能有问题”,得说清楚”哪里有问题、为什么”。
为什么值得关注
大多数 Agent 的工作流是:接任务 → 执行 → 输出 → 结束。中间没有停顿、没有反思。
agent-self-evaluation 在”执行”和”结束”之间加了一个结构化的自我评审环节。它不是要替代人工 review,而是让 Agent 在把结果交给你之前,先自己过一遍——类似一个严格的内部 QA。
ECC 官方说,这个 Skill 特别适合:
- 涉及 3 个以上文件或 50 行以上代码的修改
- 多步骤工作流(实现 → 测试 → 评审)
- 调试 session 超过 3 次尝试
- 设计文档、架构决策类输出
怎么用
在 Claude Code 里安装 ECC 后,直接激活 agent-self-evaluation Skill。它会在检测到复杂任务完成后自动触发,输出一个结构化的评分卡,包含:
- 5 轴各自的分值 + 证据
- 综合评分(平均分,保留 1 位小数)
- 1-3 条具体改进建议
整个过程不需要人工干预,Agent 自己评、自己改。
我的感受
这个 Skill 的价值不在于”评分”,而在于强制 Agent 给出证据。当它必须说清楚”哪里不对、为什么不对”的时候,很多隐藏的问题就被提前揪出来了。
如果你经常用 Claude Code 处理复杂任务,agent-self-evaluation 是一个值得加进日常流的 Skill。
GitHub 链接:affaan-m/ECC(含 agent-self-evaluation)
GitHub: https://github.com/affaan-m/ECC
评论区
登录后可评论。