热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Google开源RRSI 自改进智能体不再刷题走形

时间:2026年10月4日 地点:Google Research(Google Cloud AI Research) 人物:Peng Xia(论文一作)、Rujun Han、Zifeng Wang、Yanfei Chen、Yufan Zhuang、Yoonho Lee、Chengsong Huang、Han Yu、Zhongying CuiZhu、Yifei Ming、Huaxiu Yao、谷歌Burak Gokturk、Tomas Pfister、Chen-Yu Lee(共14位作者,多为Google Cloud AI Research与Google Research团队成员) 事件详情: Google Research于10月4日通过arXiv(编号2609.24972)公开其最新论文《Regularized Recursive Self-Improvement of Agent Harnesses(RRSI)》,正面回应近半年AI智能体研究最棘手的问题之一——自我改进型智能体在反复自我调优时,会把训练任务"背下来",看似在涨分,实则丧失了泛化能力。 论文披露的实验数据触目惊心:在八个覆盖编码、智能体办公、工程设计的基准测试中,所有五款未加正则化的自改进方法(即"未受约束的递归自我改进")在训练任务上分提升明显,但在未见过的分布外基准上出现"负迁移"——两种方法的表现甚至低于基线harness。RRSI是唯一在分布外任务上仍显著高于基线的方法,最高提升4.7分(JobBench),同时训练任务上得分提升最高14.1分,运行时的token消耗反而比未正则化版本低约30%。 RRSI在harness自动化改写流程上嵌入了三层"防刷题"约束:第一层是"随时间退火的编辑预算"——每轮允许的harness修改量逐步收紧,前期可大改,后期只允许能清楚归因到结果的小改,以避免过度拟合特定训练任务;第二层是"批评家(critic)筛稿",提案阶段任何硬编码任务名、解题模板或基准特化技巧的改动直接被剔除;第三层是"修剪器(pruner)"——只接受带来可测量收益的算力增加,对纯复杂度堆叠则直接删除。 论文还披露一项关键"可迁移性"实验:使用Claude Opus 4.8作为冻结backbone优化出来的harness,在换成Gemini 3.5 Flash等更弱模型时仍能带来稳定提升,验证了RRSI不是在为某个特定模型"量身定制",而是在学一种通用的人机协作骨架工程模式。 背景: RRSI所在的方向——"harness engineering"(脚手架工程),正是2026年下半年硅谷最热的智能体子领域。Anthropic 8月底被曝光正招募"harness engineer"职位,OpenAI 9月底被披露已在内部大规模使用harness自我迭代,DeepSeek的"Harness框架"已成为开源智能体编排的事实标准。Lilian Weng(前OpenAI安全研究负责人)7月发布的博客《Harness Engineering for Self-Improvement》明确指出:当前智能体能力提升的"大部分"来自harness而非模型本身。 影响: 1. RRSI首次系统回答了"自我改进不会让你变笨"这一前置问题,为OpenAI、Anthropic、DeepMind等正在试水"Agent自我迭代"的实验室提供了可落地的正则化模板。 2. 把harness自动化从"演示玩具"推升到"工程学科":未来harness编辑预算、批评家规则、pruner阈值将成为评估智能体自我迭代是否安全的标准三件套。 3. 对企业级智能体供应商而言,RRSI打开了"harness可被独立商业化"的可能性——就像之前MCP协议让工具调用标准化一样,harness有可能成为下一个被解耦的产品层。 总结: Google Research这次开源RRSI不只是技术贡献,更是给整个"AI自我改进"赛道划了一条安全红线:在你训练AI智能体"自己教自己"之前,请先把"防刷题约束"装上,否则它会在训练集上飞速进步,在真实世界迅速贬值——这恰好是过去几个月里几乎所有自改进型智能体实验共同踩过的坑。 参考来源: 1. The Decoder详细报道(10月4日) https://the-decoder.com/google-researchers-find-a-way-to-keep-self-improving-ai-agents-from-memorizing-their-tests/ 2. arXiv论文原文(2609.24972):Regularized Recursive Self-Improvement of Agent Harnesses https://arxiv.org/abs/2609.24972 3. arXiv论文HTML版(含完整图表与ablation) https://arxiv.org/html/2609.24972v2 4. DataSciocean论文深度解读(Do Self-Improving Agents Just Memorize the Test?) https://datasciocean.com/en/paper-intro/rrsi/ 5. Lilian Weng(前OpenAI安全研究负责人)7月博文:Harness Engineering for Self-Improvement https://lilianweng.github.io/posts/2026-07-04-harness/ 6. LinkedIn - Rujun Han(共同作者)公开发布解读 https://www.linkedin.com/posts/rujunhan_rrsi-regularized-recursive-self-improvement-activity-7508190243179610112-OfCE 7. Threads - Google AI社区对RRSI的二次解读 https://www.threads.com/@sipirtu/post/DeEuUJ8jl4D/ 8. Envisioning词条:RRSI https://www.envisioning.com/vocab/rrsi-regularized-recursive-self-improvement-of-agent-harnesses