时间:2026年10月4日
地点:Google Research(Google Cloud AI Research)
人物:Peng Xia(论文一作)、Rujun Han、Zifeng Wang、Yanfei Chen、Yufan Zhuang、Yoonho Lee、Chengsong Huang、Han Yu、Zhongying CuiZhu、Yifei Ming、Huaxiu Yao、谷歌Burak Gokturk、Tomas Pfister、Chen-Yu Lee(共14位作者,多为Google Cloud AI Research与Google Research团队成员)
事件详情:
Google Research于10月4日通过arXiv(编号2609.24972)公开其最新论文《Regularized Recursive Self-Improvement of Agent Harnesses(RRSI)》,正面回应近半年AI智能体研究最棘手的问题之一——自我改进型智能体在反复自我调优时,会把训练任务"背下来",看似在涨分,实则丧失了泛化能力。
论文披露的实验数据触目惊心:在八个覆盖编码、智能体办公、工程设计的基准测试中,所有五款未加正则化的自改进方法(即"未受约束的递归自我改进")在训练任务上分提升明显,但在未见过的分布外基准上出现"负迁移"——两种方法的表现甚至低于基线harness。RRSI是唯一在分布外任务上仍显著高于基线的方法,最高提升4.7分(JobBench),同时训练任务上得分提升最高14.1分,运行时的token消耗反而比未正则化版本低约30%。
RRSI在harness自动化改写流程上嵌入了三层"防刷题"约束:第一层是"随时间退火的编辑预算"——每轮允许的harness修改量逐步收紧,前期可大改,后期只允许能清楚归因到结果的小改,以避免过度拟合特定训练任务;第二层是"批评家(critic)筛稿",提案阶段任何硬编码任务名、解题模板或基准特化技巧的改动直接被剔除;第三层是"修剪器(pruner)"——只接受带来可测量收益的算力增加,对纯复杂度堆叠则直接删除。
论文还披露一项关键"可迁移性"实验:使用Claude Opus 4.8作为冻结backbone优化出来的harness,在换成Gemini 3.5 Flash等更弱模型时仍能带来稳定提升,验证了RRSI不是在为某个特定模型"量身定制",而是在学一种通用的人机协作骨架工程模式。
背景:
RRSI所在的方向——"harness engineering"(脚手架工程),正是2026年下半年硅谷最热的智能体子领域。Anthropic 8月底被曝光正招募"harness engineer"职位,OpenAI 9月底被披露已在内部大规模使用harness自我迭代,DeepSeek的"Harness框架"已成为开源智能体编排的事实标准。Lilian Weng(前OpenAI安全研究负责人)7月发布的博客《Harness Engineering for Self-Improvement》明确指出:当前智能体能力提升的"大部分"来自harness而非模型本身。
影响:
1. RRSI首次系统回答了"自我改进不会让你变笨"这一前置问题,为OpenAI、Anthropic、DeepMind等正在试水"Agent自我迭代"的实验室提供了可落地的正则化模板。
2. 把harness自动化从"演示玩具"推升到"工程学科":未来harness编辑预算、批评家规则、pruner阈值将成为评估智能体自我迭代是否安全的标准三件套。
3. 对企业级智能体供应商而言,RRSI打开了"harness可被独立商业化"的可能性——就像之前MCP协议让工具调用标准化一样,harness有可能成为下一个被解耦的产品层。
总结:
Google Research这次开源RRSI不只是技术贡献,更是给整个"AI自我改进"赛道划了一条安全红线:在你训练AI智能体"自己教自己"之前,请先把"防刷题约束"装上,否则它会在训练集上飞速进步,在真实世界迅速贬值——这恰好是过去几个月里几乎所有自改进型智能体实验共同踩过的坑。
参考来源:
1. The Decoder详细报道(10月4日)
https://the-decoder.com/google-researchers-find-a-way-to-keep-self-improving-ai-agents-from-memorizing-their-tests/
2. arXiv论文原文(2609.24972):Regularized Recursive Self-Improvement of Agent Harnesses
https://arxiv.org/abs/2609.24972
3. arXiv论文HTML版(含完整图表与ablation)
https://arxiv.org/html/2609.24972v2
4. DataSciocean论文深度解读(Do Self-Improving Agents Just Memorize the Test?)
https://datasciocean.com/en/paper-intro/rrsi/
5. Lilian Weng(前OpenAI安全研究负责人)7月博文:Harness Engineering for Self-Improvement
https://lilianweng.github.io/posts/2026-07-04-harness/
6. LinkedIn - Rujun Han(共同作者)公开发布解读
https://www.linkedin.com/posts/rujunhan_rrsi-regularized-recursive-self-improvement-activity-7508190243179610112-OfCE
7. Threads - Google AI社区对RRSI的二次解读
https://www.threads.com/@sipirtu/post/DeEuUJ8jl4D/
8. Envisioning词条:RRSI
https://www.envisioning.com/vocab/rrsi-regularized-recursive-self-improvement-of-agent-harnesses







