深夜研究实验室中,研究员背影面对曲面大屏,屏幕上生长出冰蓝色发光的树状结构,枝干间有金色光点流动
Dream-RSI让智能体在由自己探索历史构成的世界里“做梦”并改进策略。, AI生成插画,非新闻照片

一篇署名Google、Google DeepMind、马里兰大学与弗吉尼亚大学的论文提出了一种新的递归自我改进(RSI)路线:让智能体在自己过去的探索历史中“做梦”,在梦里迭代出更优的探索策略,再回到真实世界继续探索。论文题为《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》,于9月14日提交至arXiv(编号2609.14858),未经同行评审。

RSI指AI系统通过帮助改进下一代AI来加速自身能力增长的反馈回路,正是上周Anthropic CEO Dario Amodei呼吁“放缓前沿”时点名的核心担忧。Dream-RSI展示的路径并不改变底层模型的权重:一个轻量编排层把“探索策略”变成显式可编程的代码,而底层编码智能体、评估器和执行接口保持固定。

论文的关键洞察是,智能体累积的发现历史本身可以充当一个重放模拟器。探索过程被记录为发现树:每个节点代表一次生成-评估尝试,继承父节点的历史。离线阶段,智能体在这棵历史树构成的世界里“做梦”——用记录到的结果评估候选策略,只付出极低成本获得异策略反馈;改进后的策略再被部署到线上推动新一轮探索,不断扩充模拟器池,形成自我改进的闭环。论文结尾的句子是:“智能体必须做梦才能递归自我改进,历史就是它做梦时所处的世界。”

结果部分给出了三组自报数字。在算法工程领域,用Gemini 3.1 Pro运行Dream-RSI优化Lasso正则化路径求解器,仅317次调用就把平均运行时间从3587.1毫秒压到2931.0毫秒;论文对比称,固定探索策略需要约550次调用才能达到类似水平,基线进化搜索系统SimpleTES为获得相近结果生成了51200次。换成更便宜的Gemini 3.7 Flash后,1879次调用把运行时间做到了2350.6毫秒。在数学优化领域,和差问题、圆装填、自相关不等式三个任务中,Dream-RSI在1000代以内达到或超越了强基线,其中圆装填任务追平谷歌AlphaEvolve V2的最强纪录。在GPU内核工程领域(VGG16等内核),达到同等性能所需的生成次数约为固定探索的1/2.43。

论文还报告了一个反直觉的结果:在数学任务中,人类为智能体提供方向性提示反而比不提供更差。研究者将之归因于探索策略的搜索空间极大,人类直觉未必覆盖其中值得改进的分支。

需要标注口径:这是arXiv预印本,数字全部由作者自报,未经独立复现或同行评审;论文只改探索策略而不动权重,意味着它的增益与底层模型解耦,小模型同样适用。更值得注意的是它出现的时间:正当硅谷就是否应放缓前沿能力展开激烈争论时,这篇论文把“递归自我改进”从担忧的对象变成了一篇可复现的工程论文。

[1][2]