谷歌让智能体在虚拟世界里反复做梦演练搜索路线,真实算力开销直接砍掉162倍!
智能体变强原来不用疯狂烧钱跑实验,换一套搜索打法就够了!
递归自提升智能体Dream-RSI把历史探索记录组装成回放模拟器,让搜索策略在虚拟决策树上反复跑分迭代,底层模型一行不改,最高压缩162倍大模型调用量,同时保住算法工程和数学优化的成果质量。
AI变强靠堆实验,这笔账已经算不过来
你日常看到的AI科学发现,全部遵循同一套流水线:AI智能体提出候选方案,机器运行代码做评估,拿到结果再调整下一轮想法,循环往复直到跑出满意答案。这套流程在简单任务上跑得挺顺,可一旦问题复杂度飙升,比如让AI智能体设计一套高性能GPU内核或者推导一道开放式数学猜想,每一次方案测试都要吞掉大量算力,等待时间从几分钟拉长到几小时。
测试一两个想法,算力账单还能忍,可当你想优化AI智能体本身的搜索策略时,麻烦就炸开了!判断一套搜索策略到底好不好,你不能只看一两次尝试的运气,你得完整跑完成百上千轮"提出方案—评估反馈"循环,才能看清这套策略会不会绕远路、会不会漏掉优质答案,每调试一版新策略就要重新走完一遍漫长的真实实验,金钱和时间成本直接翻倍往上蹿。
市面上不少智能体系统干脆摆烂,用一套写死的固定搜索策略跑完全部任务,部署起来确实省事,可它不会从过往失败和成功里吸取教训,反复把算力砸向没有希望的方向!还有一部分系统选择在线实时迭代策略,一边做真实探索一边更新打法,然而元层级的反馈来得太慢,策略还没看出好坏,大量算力就已经烧完了,这就怪了——我们希望AI自己学会怎么更好地搜索答案,可检验搜索策略好坏这件事本身,就无比烧钱!
历史数据只当阅读材料,结构信息全丢了
几乎所有AI科学探索系统都会完整保存全部历史尝试记录,包括每一个提出的方案、运行之后的报错、拿到的分数、分支演变轨迹,数据量相当庞大。绝大多数系统对待这些历史数据只做两件事:一是把历史文本丢进大模型的提示词里当阅读参考;二是拿这些数据做微调去修改模型权重参数。
把过往经历当阅读材料听起来合理,里面却藏着一个致命短板!大模型读完一堆过去的案例,只能提炼出文字层面的经验感悟,它知道哪些思路曾经成功、哪些思路踩过坑,却没办法模拟"如果我当初换一套搜索逻辑,结局会不会不一样"这个关键问题。打个生活化的比方,你玩闯关游戏完整通关一遍存下全部存档,普通做法是回看通关录像记住哪里有陷阱,然而存档真正的潜力在于你可以回到任意分叉路口换一套操作打法,看看能不能更快通关!
过往全部探索过程本质上是一棵巨大的发现决策树(discovery decision tree),每一个分叉代表一次选择,每一个树节点已经存好了这次尝试的最终结果,过去大家只盯着树上的文字记录,完全忽略整棵树可以拿来充当虚拟试验场这件事!你不需要重新运行一遍代码,不需要占用GPU做真实运算,仅仅遍历已经存好的决策树,就可以模拟另外一套搜索策略会做出什么选择、拿到什么收获,这就是Dream-RSI"做梦"式仿真的核心逻辑。
这就是 “做梦” 式仿真的核心逻辑,AI 不去触碰真实世界,直接在已经发生过的历史记录里面演练各式各样的搜索策略!
但是这里有一个关键点要分清,这个虚拟环境不能生成全新的现实结果,它只能复现过去已经发生过的所有可能性!
它不能创造现实中没有出现过的新分支,它专门用来干一件事,快速打分评估不同搜索策略的优劣!
在历史树上做梦演练,搭建闭环自我提升循环
Dream-RSI整套运行流程拆成三个连贯步骤,环环相扣,每一轮循环结束系统本身就会变得更会搜索。
第一步叫在线探索,系统使用当前正在生效的搜索策略驱动编码智能体去解决真实难题,像算法设计、数学推导、GPU内核编写这类任务,每一次尝试不管成功还是失败,全部决策节点、运行输出、分数指标都会完整保存,一点点生长出一棵庞大的决策树,底层的编码模型和评判结果的评估器全程保持原样,整套循环只改动一件东西:控制往哪条分支探索的搜索策略代码!
第二步做模拟器构建,系统把一轮轮跑出来的多棵决策树整理合并,做成一个可以反复调用的回放模拟器(replay simulator)池,所有过去真实实验得到的结果全部锁死不会发生任何改动,这就是虚拟演练的地基。
第三步就是做梦式策略改良,系统生成很多套不一样的候选搜索策略全部丢进回放模拟器池里跑仿真,一套策略在虚拟环境里会自主挑选要走哪些分支、优先看哪些尝试、并行开启多少条探索路线、什么时候停止一条没有希望的分支,因为全部结果已经提前存好,整套模拟过程不会调用昂贵的计算资源,成千上百套候选策略短时间内就能全部跑完拿到客观性能评分!
表现最好的那一套搜索策略会被挑选出来重新部署回真实的在线探索环节,新一轮真实探索又会产出全新的决策树补充进模拟器池,模拟器的场景变得更加丰富,下一轮演练的基准也变得更强。
整套闭环就这样转起来,现实探索产出历史数据,历史数据虚拟打磨策略,打磨完的策略再回到现实产出更多数据!
很多人会产生一个疑问,既然虚拟环境只有过去已经见过的场景,打磨出来的策略,放到全新的真实场景还管用吗!
这里要分清两件事,模拟器不产生新问题,但是它打磨的对象不是解决某一道题的答案,而是通用搜索决策逻辑,也就是遇到分叉,怎么选分支,开多少并行任务,什么时候放弃路线。
这套做决策的逻辑,是可以迁移到全新未知的搜索空间当中!
当然它也存在天然边界,如果现实出现模拟器完全没有见过的极端全新模式,虚拟演练就失去参考样本,这也是这套机制绕不开的局限!
两种利用历史的路线,数据证明提示词灌输效果有限
手里攒下一大堆历史探索记录,摆在开发者面前有两条截然不同的道路:
第一条道路,提取历史的经验教训,整理成文字提示,直接喂给大模型,告诉模型,之前哪些思路好用,以后多往这个方向靠拢。
第二条道路,也就是这套方案选择的路线,把完整决策树保留,做成可交互的回放模拟器,让 AI 在树上面反复跑不同搜索策略。
不少人会想,把经验写成提示词,操作简单省事,为什么还要费功夫搭建模拟器呢!
实测数据给出了很明确的答案,把历史总结出来的方向,直接硬塞进提示词,整体的表现反而会往下掉!
道理其实不难理解,当你强行告诉 AI,你应该多走 A 方向,少碰 B 方向,等于人为给搜索加上很强的约束。科学探索最忌讳过早锁死思考方向,很多重大突破恰恰来自于一开始看起来没有前景的冷门分支。
文字层面的提示引导,会直接压缩探索的多样性,AI 过早扎堆涌向少数几条被看好的路径,直接错过潜在更好的解法!而回放模拟器不会做这种硬性方向规定,它不会告诉 AI “你应该选哪条路”。它只负责提供一套打分机制,不同的搜索策略自由做选择,模拟器会客观算出这套策略最终能挖到多好结果,消耗多少代价,并行效率高不高。
系统依靠分数筛选更优秀的决策逻辑,而不是靠人类或者历史总结出来的文字观点,强制规定探索走向!
这里还能观察到一个有意思的现象,经过多轮循环迭代之后,搜索策略会演化出动态调节算力分配的能力。
当整体任务的性能快速上涨的时候,策略主动减少每一轮的尝试数量,节约算力资源;当性能增长陷入停滞,策略又主动放开预算,增加探索的尝试次数,去挖掘新可能性!
策略自己学会松紧调节,不需要人类手动设置固定参数,这就是元层级自我迭代带来的变化!
三类硬核任务实测,底层模型没动性能却涨了
这套闭环机制,在三类完全不一样的硬核任务上,做完完整的对照测试,每一组实验都会设置对照组,对照组使用固定不变的搜索策略,底层大模型、评估工具、硬件资源全部保持一致。
第一类任务是算法工程,目标是让 AI 设计出高效的 Lasso 正则路径求解程序,这类算法大量用在生物基因数据分析,金融数据建模场景。
在同样要求数值结果完全正确的前提下,对比传统基线系统,它最高减少 162 次大模型调用;对比固定搜索策略的对照组,也能节省 1.7 倍的调用量。
AI 自主摸索出来的求解算法,融合多种高级优化手段,包含特征筛选、数学不等式剪枝、矩阵惰性计算、内存硬件对齐优化,不是简单抄人类现成代码,是真正组合创新出高效实现!
第二类任务属于纯数学优化,包含和差构造,圆填充布局,自相关不等式三个经典难题。
很多旧系统想要拿到不错结果,需要五万多次生成迭代;这套机制只需要不到一千次生成,就达到顶尖系统的同等水平,节约超过 50 倍的计算预算!
第三类任务是 GPU 内核工程,也就是写 GPU 上面高速运行的计算代码,这类任务要同时兼顾算法逻辑,内存读写模式,硬件并行特性,复杂度非常高。
针对 VGG16、LayerNorm 这两个内核,它只需要对照组 1/2.43、1/1.79 的迭代次数,就可以达到一样的运行速度;针对 ConvDiv、ConvMax 内核,如果使用一样多的迭代预算,最终性能分别提升 2.09 倍、1.44 倍!
全部实验有一个共同前提,底层用来写代码的大模型完全不变,改变的仅仅是 “往哪里探索,探索多少” 这套上层控制逻辑!
很多人会误以为 AI 能力提升,全部靠更大的模型,更多参数,但是这些实验清晰展示,上层搜索调度策略的迭代,同样能带来巨大收益!
然而实验数据同样暴露出客观的现实,这套方案不是万能的神器。
回放模拟器只能基于已经见过的历史轨迹开展演练,如果前期第一轮在线探索,本身就完全漏掉一大片关键搜索分支,模拟器的素材先天就存在缺口,那么演练打磨出来的策略,上限会被旧历史框住!
这也意味着,第一轮真实探索的基础样本质量,会直接决定整套系统的天花板!
回放模拟器里的回放评分公式
Dream-RSI设计了一个回放评分公式,给策略在模拟器里的表现打分。这个分数算三样东西:你在这条轨迹上找到的最好解有多好、你一共做了多少次尝试、你的并行效率高不高。
找到的解越好分越高,这是明摆着的。尝试次数越多分越低,因为真实的AI调用是要花钱的。并行效率越高分越高,因为一次同时跑多条线比一条一条跑要快。
这三个指标之间有张力。你想找到更好的解,可能得多试很多次;你想省成本少试几次,可能就错过了好方向。策略要在这三者之间找到平衡点。
有意思的地方来了。这个评分公式里有一个系数叫做beta,控制着成本惩罚的力度。beta高,策略就保守,少试几次;beta低,策略就激进,愿意多花钱去找更好的解。Dream-RSI在整个回放过程中,会自动扫一遍不同的beta值,看哪个beta下策略的表现最好。
然后最有戏剧性的部分来了:开发智能体拿到回放反馈后,去改策略代码。策略代码是真实可执行的程序,控制着真实探索中的每一个决定。改完之后在同一个模拟器里再跑一遍,新分数和旧分数直接对比。分数高的版本留到下一轮真实探索里用。
这里有个数学保证:因为候选策略集合里一定包含当前正在用的策略,所以选出来的新策略在模拟器里的平均得分不可能比旧的差。换句话说,每一轮策略只会变好或者持平,不会退步。
这个“策略代码被反复改写”的机制,就是Dream-RSI最核心的那根脊梁骨。
那这个自动进化的策略,到了真实的发现任务里,到底管不管用?
模拟器天花板藏在第一轮探索的样本里
回放模拟器只能基于已经见过的历史轨迹开展演练,如果前期第一轮在线探索本身就完全漏掉一大片关键搜索分支,模拟器的素材先天就存在缺口,演练打磨出来的策略上限会被旧历史框住!
这意味着第一轮真实探索的基础样本质量会直接决定整套系统的天花板,模拟器再强大也没法凭空变出它从未见过的可能性,它只能在你已经走过的路上帮你找到更优的走法,却没法帮你发现一条你压根没踏上去过的新路。
随着一轮一轮循环运行,历史决策树会越积越多,模拟器池的体积持续膨胀,未来怎么高效裁剪老旧历史数据、保留有价值的仿真样本、控制存储开销,依旧是等待解决的难题。
更深层的矛盾在于:当模拟器池越来越大,不同候选策略在不同子树上表现差异巨大,简单的平均得分可能掩盖策略的真实特性,一套策略可能在数学优化子树上拿高分却在GPU内核子树上垫底,这种跨任务的不一致性怎么在打分环节被合理处理,目前还没有成熟的方案。
看懂这套机制,我们能落地的三条行动启示
你在使用自动探索类 AI 智能体的时候,第一件事,分清系统优化的对象,到底是底层生成答案的模型,还是上层控制搜索流程的策略!很多工具只会迭代生成出来的答案,很少会迭代 “怎么搜索答案” 这一层控制器,你可以优先关注那些允许上层搜索逻辑自我迭代的工具。
你要学会区分两种使用历史数据的模式:一种是提炼文字总结丢进提示;另一种是保留完整决策分支做仿真回放。
遇到开放性探索任务,不要迷信把过往经验全部写进提示词,强文字引导很容易扼杀探索多样性,适度保留 AI 自主试错的空间,反而更容易收获惊喜。
你要明白虚拟仿真演练有明确边界,虚拟环境只能基于已经发生过的历史做推演,它不能凭空生成现实世界没有见过的全新可能性。
虚拟打磨后的策略依旧需要回到真实世界做验证,虚拟仿真负责低成本筛选策略,真实世界负责产出全新的未知样本,二者缺一不可!
我们还需要留意一个没有被彻底解决的现实问题,随着一轮一轮循环运行,历史决策树会越积越多,模拟器池的体积会持续膨胀。
未来怎么高效裁剪老旧历史数据,保留有价值的仿真样本,控制存储开销,依旧是等待解决的难题。
原文期刊:arXiv
发表日期:2026-09-14
原文标题:Dream-RSI: Recursive Self-Improvement through Evolving Worlds
作者单位背景:Google、马里兰大学、弗吉尼亚大学、Google DeepMind
最核心的范式转换:把"经验"从文本还原为结构
文章里那个闯关游戏的比喻其实点到了要害。过去业界处理历史数据的主流方式——塞进 prompt 或做 fine-tuning——本质上都是把结构化的决策轨迹压扁成了非结构化的文本。一旦压扁,分叉点之间的因果关系、并行分支之间的竞争关系、资源分配的时间动态,全部丢失了。
Dream-RSI 做的事情,严格来说不是"做梦",而是把被压扁的经验重新还原成可交互的决策树。"做梦"是一个很好的传播隐喻,但技术本质更接近强化学习里的 offline RL + replay buffer 的思路——只不过 replay 的对象不是单步 (s, a, r, s') 转移,而是整棵搜索子树。
一个值得追问的问题:为什么 prompt 灌输反而掉点?
文章给出的解释是"过早锁死方向、压缩多样性",这个判断大概率是对的,但可以再挖一层:
- Prompt 传递的是结论,模拟器传递的是评价函数。 当你告诉模型"多走 A 方向",模型学到的是一个静态偏好;而当模型在模拟器上跑分时,它学到的是"在什么状态下、以什么代价、走哪条路能拿到什么回报"——这是一个条件化的策略映射,信息量远高于一句话。
- Prompt 是开环的,模拟器是闭环的。 提示词一旦写进去就不会根据当前搜索状态动态调整,而模拟器上的策略演化天然是一个闭环优化过程。
更大的图景
这项工作放在 2025-2026 年 AI for Science 的大背景下看,其实回应了一个越来越尖锐的矛盾:
模型推理成本在快速下降,但真实实验成本(wet lab、物理仿真、大规模数值计算)并没有同步下降。
Dream-RSI 的思路本质上是把优化循环从昂贵的真实世界搬到了廉价的虚拟回放中,只在必要时才回到真实世界采集新数据。这和自动驾驶领域的 sim-to-real、机器人领域的 domain randomization 是同一个哲学:用尽可能多的廉价仿真替代尽可能少的昂贵真实交互。
如果这个方向继续推进,下一步很可能是把模拟器本身也做成可学习的——不只是回放历史,而是用世界模型(world model)去外推历史中未见过的分支。到那时候,"做梦"这个比喻就会从修辞变成字面意义上的准确描述了。