2026-09-17 12:25
AI123

谷歌联合DeepMind提出Dream-RSI框架:智能体靠“做梦”改进探索策略

9月16日,谷歌联合Google DeepMind、马里兰大学及弗吉尼亚大学发布研究论文,提出Dream-RSI框架,为递归自我改进(RSI)提供了一条新路线。该方法让智能体在执行任务时,将所有探索过程记录为一棵“发现树”,并在其中“做梦”——通过重放历史来评估和优化探索策略,而无需修改底层模型权重。

Dream-RSI将执行与决策分离:底层发现智能体由Gemini 3.1 Pro或3.7 Flash驱动,负责生成候选代码;顶层轻量编排层中的探索策略决定从哪些节点继续、何时停止等。每次真实探索都会把路径、决策和执行反馈存入历史树。策略迭代时,只读取历史树进行重放,不调用模型、不执行代码,从而大幅降低评估成本。

研究在三个领域验证了效果。算法优化任务中,Dream-RSI以317次调用使Lasso正则化路径求解器达到固定策略550次甚至SimpleTES基线51200次生成的水平;圆填充问题上追平AlphaEvolveV2的最强纪录;GPU内核优化中,达到同等性能的生成次数降至固定探索的1/2.43。实验还发现,将历史总结为高层提示注入智能体后,性能反而低于无引导基线,说明“做梦”式的代码级策略优化比抽象经验指导更有效。

论文已发布至arXiv,并配有项目页面。

来源
  1. 2026-09-18 03:49 | venturebeat.com:Google's Dream-RSI cuts discovery-agent calls up to 162x by replaying searches it already ran
    阅读原文

    Teams continue to burn through tens of thousands of tokens and agent calls as they refine exploration loops — and much of that spend, Google researchers argue, goes to paths that previously failed. Their answer is to let agents "dream" their way through those loops instead, learning from earlier att...

  2. 2026-09-17 15:41 | 36氪:谷歌RSI论文:AI自进化,做梦吧
    阅读原文

    有意思,谷歌刚被曝跑通了RSI,一篇关于如何让AI实现自我进化的论文,就被官方发到了网上。 打开方式还挺别致,“做梦”。 对,没让大模型重新训练自己,也不是让AI直接修改自己的权重,而是Dream-RSI,直接就是一个“梦中学”。 不开玩笑,咱还是正经说,其实是研究人员们发现了一个有点妙的事情: AI真实探索留存下的历史记录,本身就是一个模拟世界。 于是,一次昂贵的真实探索结束后,Agent不必真的重新跑上几百、几千遍实验,就可以在过去已经发生过的搜索树里,进行虚拟推演(做梦),反复试验新的搜索策略。 等找到更好的策略,再回到真实环境里跑一次。 新的探索,又会...

  3. 2026-09-17 12:42 | 新浪财经:谷歌RSI论文:AI自进化,做梦吧!
    阅读原文

    鱼羊 发自 凹非寺 量子位 | 公众号 QbitAI有意思,谷歌刚被曝跑通了RSI,一篇关于如何让AI实现自我进化的论文,就被官方发到了网上。打开方式还挺别致,“做梦”。对,没让大模型重新训练自己,也不是让AI直接修改自己的权重,而是Dream-RSI,直接就是一个“梦中学”。不开玩笑,咱还是正经说,其实是研究人员们发现了一个有点妙的事情:AI真实探索留存下的历史记录,本身就是一个模拟世界。于是,一次昂贵的真实探索结束后,Agent不必真的重新跑上几百、几千遍实验,就可以在过去已经发生过的搜索树里,进行虚拟推演(做梦),反复试验新的搜索策略。等找到更好的策略,再回到真实环境里跑一次。新的探索,...

  4. 2026-09-16 20:57 | 36氪:震撼,谷歌破解了RSI?AI靠「做梦」学会无限进化
    阅读原文

    谷歌,可能已经破解了RSI! 就在刚刚,谷歌联合 Google DeepMind、马里兰大学及弗吉尼亚大学,发表了一篇重磅论文。 这一次,他们展示了一条完全不同的RSI路线:AI自我进化,居然可以靠做梦? 这一次,谷歌是让智能体把自己走过的每一步存成一棵树,然后在树里「做梦」。 在梦里练出更优的探索策略,再回到现实继续干。 论文地址:https://arxiv.org/abs/2609.14858 Dream-RSI的效果可以说是相当震撼: 算法优化任务,主流进化搜索系统需要跑51200代,Dream-RSI调用317次就达到了同等水平。 圆填充问题,追平...

其他新闻

查看全部