Token导航 LogoToken导航TokenDH.com

搜索预算节省50倍!谷歌RSI新作:Agent 在“做梦”中自进化

更新时间 2026-09-18来源 智猩猩正文 1723字阅读约 6分钟6 张图片
智猩猩AI整理
编辑:没方

递归式自我改进(RSI)正变得越来越重要,尤其对于自主 AI Agent 而言,其能力进步很大程度上取决于能否在复杂领域中发现高价值解决方案。推动这一过程的关键是有效的探索。

然而,如何管理并持续改进探索策略,仍是当前系统面临的重要瓶颈。

一方面,固定的探索策略无法随着搜索空间不断扩大而自适应调整;另一方面,在线优化探索策略又需要在庞大的元搜索空间中进行搜索,而这种优化往往依赖长程 Rollout,反馈不仅延迟严重,且获取成本高昂。

为此,Google联合提出 Dream-RSI,这是一个面向可扩展探索与递归式自我改进的框架。该框架引入了一个轻量编排层,在不修改底层 Coding Agent 的情况下,将探索过程显式化并程序化,使探索策略本身可以被控制和优化。

图片
  • 标题:Dream-RSI: Recursive Self-Improvement through Evolving Worlds

在算法工程任务上,Dream-RSI 相比 SimpleTES,它最多可将 Agent 调用次数减少 162 倍。 在数学优化任务中, Dream-RSI 与 SimpleTES 相比,其搜索预算可节省 50 倍以上。在 GPU Kernel 工程任务上,Dream-RSI 在相同预算约束下,将 Kernel 性能最高提升至 2.09 倍。  


此外,该成果还登上了 Hugging Face 论文周榜。

图片

01

Dream-RSI 在回放模拟器中“做梦”,

持续优化探索策略

如下图所示,Dream-RSI 通过三个核心阶段构成一个 RSI 闭环:在线探索、构建回放模拟器,以及基于 Dreaming 的策略改进。  

图片

首先,当前探索策略会指导 Coding Agent 进行真实的在线探索,不断扩展发现树(Discovery Tree),并记录整个搜索过程中产生的历史执行轨迹。

研究团队的核心洞察是:这些不断积累的发现历史,本身就可以成为已探索搜索空间的回放模拟器(Replay Simulator)。

Dream-RSI 将历史发现过程组织成发现树,并在由这些发现树构建的回放模拟器中进行“Dreaming”。

Agent 会在“脑海中”构想出大量不同的候选探索策略,再把这些策略放入回放模拟器中进行模拟执行,尝试不同的搜索分支、探索顺序、并行方式和停止策略。

由于这些节点的执行结果已经被记录下来,Dream-RSI 无需反复进行昂贵的真实在线探索,就能够快速、低成本地获得 Off-policy 反馈,用于评估和改进探索策略。

经过改进的策略随后会重新部署到在线环境中,推动下一轮真实探索;新产生的发现历史又会继续扩充模拟器池,从而在元探索层面形成一个持续自我改进的 RSI 闭环。

02

实验结果

研究团队在 8 个科学发现任务上评估了 Dream-RSI,覆盖三个不同领域:算法工程、数学优化和 GPU Kernel 工程。

图片

Gemini-3.1 Pro 下,Recursive Fixed Exploration 用 550 次 Agent 调用得到的平均运行时间为 3587.1ms,Dream-RSI 只使用 317 次调用,平均时间进一步降至 2931.0ms。

Gemini-3.7-Flash 下,则从 3200 次调用、2516.7ms 改进到 1879 次调用、2350.6ms。而 SimpleTES 使用了 51,200 generations,平均运行时间为 3804.8ms。

也就是说,Dream-RSI 在更少搜索预算下拿到了更快的最终程序,并且相较 SimpleTES,Gemini-3.1 Pro 版本的搜索调用量减少约 162 倍。

在数学优化任务中,包括 Sum-Difference(和差问题)、Autocorrelation(自相关问题)和 Circle Packing(圆堆积问题),Dream-RSI 在 1000 次以内的生成(generations)处于较强水平;与 SimpleTES 相比,其搜索预算可节省 50 倍以上。

图片

在 GPU Kernel 工程任务上,在 VGG16 和 LayerNorm 上,Dream-RSI 达到相近最终性能时分别少用 2.43×、1.79× 生成次数。在相近预算下,ConvDiv 和 ConvMax 的最终性能则分别提升 2.09× 和 1.44×。这说明进化探索策略带来的收益并不局限于某一种算法搜索任务。

图片
文章标签Google智能体学术研究
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多