Google和DeepMind最近放了一篇论文,叫Dream-RSI,讲的是递归自我改进(RSI)。但它的实现方式和我们之前想的不太一样。
传统思路是让模型自己训练自己,或者修改自己的权重。Dream-RSI走了另一条路:模型不改权重,而是改自己的探索策略。
具体来说,Agent每次执行任务都会留下完整的探索历史:试过哪些方案、哪些失败了、哪个分支效果最好、花了多少计算。Dream-RSI把这些历史做成一个Replay Simulator,然后让Agent在里面不断做梦:如果当时先走另一个分支呢?如果多开几个并行任务呢?如果这个方向早点停掉呢?
关键是,历史里的结果都已经算过了,所以这些实验根本不用重新调用Coding Agent和Evaluator。一次昂贵的真实探索,可以拿来做成千上万次几乎零执行成本的策略实验。
找到更好的策略之后,再把它部署回真实世界,于是就形成了一个完整循环:探索 → 积累历史 → 做梦 → 改进Policy → 再探索 → 再做梦。
效果也很好。在GPU Kernel任务里,VGG16和LayerNorm达到类似性能,分别少用了2.43×和1.79× generations;ConvDiv和ConvMax在相近预算下,性能分别提高了2.09×和1.44×。
还有一个实验特别有意思。他们也试过更传统的办法:把过去探索得到的经验总结出来,直接塞回Prompt里指导下一轮,结果反而更差。因为这些总结出来的经验很容易变成偏见,让Agent过早集中在某几个看起来正确的方向上,反而损失了探索的多样性。
所以这篇论文真正值得关注的地方,是它展示了另一条RSI路线:模型不一定要先学会修改自己的权重,Agent可以先学会修改自己的Harness。怎么搜索、开多少分支、什么时候继续、什么时候放弃、计算资源怎么分配,这些过去由人类工程师设计的东西,现在也开始进入Agent自己的优化循环。
话题来源 @MaxForAI
❤️1387 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应













