热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Google RRSI让智能体自改harness防过拟合

时间:2026 年 10 月 1 日 地点:美国旧金山(Google Cloud AI Research)联合北卡罗来纳大学教堂山分校、斯坦福大学、圣路易斯华盛顿大学 人物:Google Cloud AI Research 研究团队;三所高校合作者;论文第一作者 Diego Almada Lopez 等 事件详情:Google Cloud AI Research 联合三所高校开源 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,正则化递归自改进)框架,让 AI 智能体在不修改底层模型权重的前提下,借助语言模型自动改写自身的 harness(提示词、控制流、工具调用、记忆管理),形成递归自改进循环。RRSI 通过"编辑预算随时间递减"+"严格 critic 过滤掉硬编码基准内容的提案"+"历史感知探索避免重复失败"+"性价比筛选"等正则化机制,专门抑制智能体对训练任务的过拟合与"刷分"行为。论文以 Claude Opus 4.8 作为冻结底座,在八个基准测试中,训练划分上最高取得 +14.1 分;其中 SWE-bench Verified 由 82.0 升至 83.8(+1.8),Terminal-Bench 2.1 由 74.2% 升至 80.2%(+6.0),Harvey LAB 等智能体办公任务、EngDesign 工程设计任务亦有提升;在五个分布外(OOD)基准上最高取得 +4.7 分,且 token 消耗比无正则化的进化方法降低约 30%。用 Gemini 3.5 Flash 优化得到的 harness 还能迁移到更弱的 Gemini 3.1 Flash Lite,将其编码准确率从 11.2 拉到 14.6 分。 背景:过去两年智能体领域的进展更多来自 harness 工程优化而非模型本身的升级;自动化 harness 演进虽然省去人工调参,但容易陷入"在固定测试集上分数暴涨、到新任务反而下滑"的过拟合陷阱,类似 arXiv、Google OSS VRP 等开源/研究项目近期都因此类问题承压。RRSI 的论文 arXiv 编号为 2609.24972,代码以 Apache 2.0 协议开源在 google-research/rrsi 项目仓库。 影响:把"harness 自进化"从靠运气刷分,转变为可解释、可约束的结构化搜索,让团队在不动模型权重的前提下也能拿到稳定泛化收益;为 Agent 厂商提供了一套可复用、可审计的开源工具;研究层面把焦点从"训更大模型"转向"调更好脚手架",加速 Agent 工程化落地。 总结:Google RRSI 让智能体自改进走出"刷分陷阱",标志着 Agent 优化正式进入"防过拟合"时代——在不更新模型的情况下,也能用工程化正则化换来稳定的能力提升与跨基准泛化。 参考来源: The Decoder — Google researchers find a way to keep self-improving AI agents from memorizing their tests https://the-decoder.com/google-researchers-find-a-way-to-keep-self-improving-ai-agents-from-memorizing-their-tests/ Marvis AI Today — Google's RRSI lifts unseen-task scores by up to 4.7 points https://hellomarvisaitoday.com/articles/3d50383f-5dd4-4fd2-91dd-33a83810cb77 CryptoCortex — Google's RRSI framework lets AI agents rebuild their own harnesses https://cryptocortex-ai.com/news/361c9ff6-3483-4fe2-82c4-d4c69c8a97e4 Wisevoter — Researchers Released New AI Self-Improvement Framework https://wisevoter.com/world/2026/10/01/researchers-introduce-ai-self-improvement-framework The Value Engineering — Google Cloud AI stops autonomous agents from memorizing benchmarks https://thevalue.engineering/news/google-cloud-ai-tackles-agent-overfitting-rrsi.html arXiv 论文 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses https://arxiv.org/abs/2609.24972 Google Research GitHub 仓库(Apache 2.0) https://github.com/google-research/rrsi 中文报道 aliShangtian — Google 开源 RRSI 让智能体在冻结 LLM 上递归自改进 harness https://alishangtian.com/article/user-f0340a29a1