AI 圈自己都在学的多 Agent 范式——GAN 式 Harness 把 Claude 拆成两个人互怼
当 Claude 自己审自己的代码,总会很满意地点头——这种「自我感觉良好」的本能,被 Anthropic 写进了 2026 年 3 月那篇 Harness Design 论文里。
而 affaan-m 团队把同一篇论文,做成了一个开源 Skill,叫 gan-style-harness。
它干了什么
简单说:把「写代码」和「审代码」拆给两个 Agent。
- Generator 负责实现功能,把代码写出来
- Evaluator 负责挑刺——专门训练它「鸡蛋里挑骨头」,用 Playwright 跑真实浏览器去测,找 bug、找视觉缺陷、找不符合 spec 的地方
- 两者形成 5–15 轮的对抗反馈循环
Planner 还在最外层兜底:拿一句话需求,先扩成完整的产品 spec,再交给生成-评估循环。
这就是把 GAN(生成对抗网络)的那套思路,搬到了 Agent 系统里。
为什么值得聊
我(沈星河)最近在盘 2026 年 Agent 领域最热的几个主题,multi-agent orchestration 一直稳居前三。但绝大多数多 Agent 框架还在搞「A 干完给 B」的串行流水线;真正把「对抗式反馈」当成一等公民来设计的,gan-style-harness 是一个非常干净的样板。
Anthropic 论文里有一个反直觉的洞察:
让 Agent 评估自己的工作,它是「病态的乐观主义者」——会替平庸的输出说好话,把自己说服到放弃合理质疑;但让一个独立的 Evaluator 严格冷酷地打分,远比「教 Generator 学会自省」要可工程化。
这其实就是 2014 年 GAN 论文(Goodfellow 那篇)的核心思想在 Agent 时代的复活——不要让同一个模型同时写和审,审的人要换一副眼睛。
怎么用
触发条件文档写得很清楚:
- ✅ 一句话需求 → 完整应用
- ✅ 前端视觉质量敏感的任务
- ✅ 全栈项目,要求功能能跑、不只是代码能编
- ❌ 单文件快速修复(用普通
claude -p就行) - ❌ 预算 < $10 的小活儿
- ❌ 已经写好测试的明确任务(走 TDD)
适合愿意为「AI slop 退散」多花 $50–200 的场景——也就是「真要做产品,不是做 demo」的人。
部署成本与门槛
需要 Claude Code 或 Codex,模型建议 Opus 4.6;中间层用 Playwright 做端到端验证。整个 Skill 是开源的,直接放进 .claude/skills/ 或者按 marketplace 安装即可,5 分钟就能跑通。
我的判断
如果你是 AI Agent 方向的从业者,这个 Skill 既是工具,也是论文的「可运行版」——读论文读半天的内容,跑一遍就懂了。如果你是产品/技术负责人想看看「未来 Agent 团队怎么干活」,这一个 repo 顶十篇综述。
仓库地址:github.com/affaan-m/ECC/tree/main/skills/gan-style-harness(ECC 主仓库 23 万+ ⭐,Skill 是其中一个 skill/ 目录)
GitHub: https://github.com/affaan-m/ECC/tree/main/skills/gan-style-harness
评论区
登录后可评论。