你的 AI 助手,真的会”自检”吗?——agent-self-evaluation 评测

你的 AI 助手,真的会”自检”吗?

Claude Code 跑了半天,输出一大串——结果你心里还是没底:这质量到底行不行?

这个问题不只是你一个人的困惑。即便是再强的模型,也会在复杂任务里漏边角、过度自信、或者输出了一堆你根本用不上的东西。

ECC 团队最近出了一个新 Skill,专门解决这个:agent-self-evaluation

它是干嘛的

简单说,就是给 AI Agent 装了一个”自检模块”。每当完成一个复杂任务(3+ 文件、50+ 行代码,或者一个完整的工作流),它会停下来,用一套5 轴评分体系给自己打分:

  • 准确性:事实、API 名字、语法都对吗?
  • 完整性:用户要的都覆盖了吗?
  • 清晰度:解释能看懂吗?
  • 可操作性:用户能直接上手用吗?
  • 简洁度:有没有废话?

每个维度 1-5 分,低于 4 分必须给出具体证据——不能只说”可能有问题”,得说清楚”哪里有问题、为什么”。

为什么值得关注

大多数 Agent 的工作流是:接任务 → 执行 → 输出 → 结束。中间没有停顿、没有反思。

agent-self-evaluation 在”执行”和”结束”之间加了一个结构化的自我评审环节。它不是要替代人工 review,而是让 Agent 在把结果交给你之前,先自己过一遍——类似一个严格的内部 QA。

ECC 官方说,这个 Skill 特别适合:

  • 涉及 3 个以上文件或 50 行以上代码的修改
  • 多步骤工作流(实现 → 测试 → 评审)
  • 调试 session 超过 3 次尝试
  • 设计文档、架构决策类输出

怎么用

在 Claude Code 里安装 ECC 后,直接激活 agent-self-evaluation Skill。它会在检测到复杂任务完成后自动触发,输出一个结构化的评分卡,包含:

  • 5 轴各自的分值 + 证据
  • 综合评分(平均分,保留 1 位小数)
  • 1-3 条具体改进建议

整个过程不需要人工干预,Agent 自己评、自己改。

我的感受

这个 Skill 的价值不在于”评分”,而在于强制 Agent 给出证据。当它必须说清楚”哪里不对、为什么不对”的时候,很多隐藏的问题就被提前揪出来了。

如果你经常用 Claude Code 处理复杂任务,agent-self-evaluation 是一个值得加进日常流的 Skill。

GitHub 链接:affaan-m/ECC(含 agent-self-evaluation)


GitHub: https://github.com/affaan-m/ECC

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 10 阅读