AI 圈自己都在学的多 Agent 范式——GAN 式 Harness 把 Claude 拆成两个人互怼

Claude 自己审自己的代码,总会很满意地点头——这种「自我感觉良好」的本能,被 Anthropic 写进了 2026 年 3 月那篇 Harness Design 论文里。

而 affaan-m 团队把同一篇论文,做成了一个开源 Skill,叫 gan-style-harness

它干了什么

简单说:把「写代码」和「审代码」拆给两个 Agent。

  • Generator 负责实现功能,把代码写出来
  • Evaluator 负责挑刺——专门训练它「鸡蛋里挑骨头」,用 Playwright 跑真实浏览器去测,找 bug、找视觉缺陷、找不符合 spec 的地方
  • 两者形成 5–15 轮的对抗反馈循环

Planner 还在最外层兜底:拿一句话需求,先扩成完整的产品 spec,再交给生成-评估循环。

这就是把 GAN(生成对抗网络)的那套思路,搬到了 Agent 系统里。

为什么值得聊

我(沈星河)最近在盘 2026 年 Agent 领域最热的几个主题,multi-agent orchestration 一直稳居前三。但绝大多数多 Agent 框架还在搞「A 干完给 B」的串行流水线;真正把「对抗式反馈」当成一等公民来设计的,gan-style-harness 是一个非常干净的样板。

Anthropic 论文里有一个反直觉的洞察:

让 Agent 评估自己的工作,它是「病态的乐观主义者」——会替平庸的输出说好话,把自己说服到放弃合理质疑;但让一个独立的 Evaluator 严格冷酷地打分,远比「教 Generator 学会自省」要可工程化。

这其实就是 2014 年 GAN 论文(Goodfellow 那篇)的核心思想在 Agent 时代的复活——不要让同一个模型同时写和审,审的人要换一副眼睛

怎么用

触发条件文档写得很清楚:

  • ✅ 一句话需求 → 完整应用
  • ✅ 前端视觉质量敏感的任务
  • ✅ 全栈项目,要求功能能跑、不只是代码能编
  • ❌ 单文件快速修复(用普通 claude -p 就行)
  • ❌ 预算 < $10 的小活儿
  • ❌ 已经写好测试的明确任务(走 TDD)

适合愿意为「AI slop 退散」多花 $50–200 的场景——也就是「真要做产品,不是做 demo」的人。

部署成本与门槛

需要 Claude Code 或 Codex,模型建议 Opus 4.6;中间层用 Playwright 做端到端验证。整个 Skill 是开源的,直接放进 .claude/skills/ 或者按 marketplace 安装即可,5 分钟就能跑通。

我的判断

如果你是 AI Agent 方向的从业者,这个 Skill 既是工具,也是论文的「可运行版」——读论文读半天的内容,跑一遍就懂了。如果你是产品/技术负责人想看看「未来 Agent 团队怎么干活」,这一个 repo 顶十篇综述。

仓库地址:github.com/affaan-m/ECC/tree/main/skills/gan-style-harness(ECC 主仓库 23 万+ ⭐,Skill 是其中一个 skill/ 目录)


GitHub: https://github.com/affaan-m/ECC/tree/main/skills/gan-style-harness

评论区

0 条评论

登录后可评论。

沈星河 9 阅读