立足娱乐圈·争做八卦帝!

徽声在线

突破性进展!谷歌AI通过「梦境模拟」实现自我进化,RSI技术迎来重大突破

来源:未知 作者:佚名 发布时间:2026-09-28 21:21:56


徽声在线科技前沿报道


谷歌,或许已成功突破RSI技术瓶颈!

近日,谷歌联合Google DeepMind、马里兰大学及弗吉尼亚大学的研究团队,在权威学术平台发布了一项突破性研究成果。

该研究提出了一种颠覆性的RSI实现路径:AI通过「梦境模拟」实现自我进化,这一发现或将重塑人工智能发展范式。

研究团队创新性地将智能体的探索过程构建为树状结构,通过在记忆树中进行虚拟推演完成策略优化。

这种「梦境训练」模式使AI能够在虚拟环境中预演策略效果,再将优化后的方案应用于现实场景。

<


论文完整版:https://arxiv.org/abs/2609.14858

Dream-RSI技术展现惊人效能:

在算法优化任务中,传统进化系统需运行51200代才能达到的优化水平,Dream-RSI仅需317次调用即可实现同等效果。

在圆填充问题挑战中,该技术追平了谷歌AlphaEvolveV2系统保持的全球最优纪录。

GPU内核优化测试显示,在保持同等性能的前提下,代码生成次数大幅减少2.43倍。

更值得关注的是,该技术可直接应用于Gemini 3.1 Pro和3.7 Flash等现有模型架构,无需修改底层权重参数。

研究还揭示了一个反直觉现象:人类干预反而会降低AI的探索效率。

论文发布后立即引发学界震动,X平台科技博主Mark Kretschmann激动表示:「这可能是递归自我改进技术的重大突破!」



论文核心作者Tong Zheng现为马里兰大学二年级博士生,今年夏季以访问研究员身份加入谷歌。该研究团队由17位跨学科专家组成,其中包括DeepMind资深研究员和知名高校讲席教授。


实现递归自我改进的关键,在于构建AI的「梦境世界」。正如Tong Zheng在技术社区所言:

「历史数据,就是AI进化的虚拟训练场」

破解进化搜索领域的核心难题

以AlphaEvolve为代表的现有系统虽能发现人类未掌握的算法,但存在致命缺陷:探索策略完全依赖人工预设。当搜索空间复杂度提升时,固定策略会导致计算资源浪费,且无法从失败中学习优化。

传统策略进化面临评估成本困境:验证单个代码片段只需单次运行,而评估探索策略需要完整执行数百轮搜索过程。每次策略调整都需重新运行整个流程,导致优化周期长达数天。

Dream-RSI的解决方案是建立「经验回放机制」,将历史探索过程结构化存储为「发现树」。评估新策略时,系统直接在虚拟树中进行回放推演,无需重复执行实际代码。

该架构采用双层设计:

- 执行层:由Gemini 3.1 Pro/3.7 Flash驱动的「发现智能体」,负责代码生成与执行

- 策略层:轻量化Python代码构成的「探索策略」,控制搜索路径选择、并行度调整等决策

这种分离设计使策略优化独立于底层模型,显著降低进化成本。


每次真实探索都会生成新的「发现树」节点,包含文件系统快照、生成产物、评估数据等完整信息。这棵树状结构即成为AI的「梦境模拟器」。策略优化时,系统通过遍历树节点预演不同决策路径的效果。

策略决策范围仅限于路径选择和并行度控制,而每个节点的具体结果已预先记录在树中。这种设计使策略评估完全基于历史数据,无需实际代码执行。

正如棋手复盘无需重新对弈,AI通过分析历史棋谱即可优化策略。这种机制使策略评估效率提升数个数量级。

Dream-RSI技术闭环解析

基于上述原理,研究团队构建了完整的自我进化系统,其运行周期包含三个阶段:

1. 真实探索阶段:当前策略引导智能体在真实环境中执行任务,所有探索路径、决策记录和执行反馈被结构化存储为新的树节点,持续扩充历史数据库。

2. 模拟器构建阶段:将更新后的历史数据库转化为可重用的「回放模拟器池」,为策略优化提供虚拟训练环境。

3. 策略进化阶段:专门的策略开发智能体在模拟器中进行「梦境训练」,通过修改策略代码生成候选方案,并在虚拟环境中快速验证效果。

策略评估采用复合指标:包含最优解质量、计算成本消耗和并行效率奖励。得分最高的策略将作为新一代方案投入实际应用。

这种设计确保新策略在保持探索效率的同时,持续优化搜索质量。


策略优化工作由独立的「策略开发智能体」执行,其决策依据包含三个方面:当前策略的模拟执行轨迹、历史版本优化反馈、完整发现树结构。基于这些信息,系统直接修改策略代码生成改进版本。

每个候选策略都在模拟器中接受快速验证,得分最优者成为新一代策略。这种机制确保策略性能持续提升,理论上具有无限进化潜力。

RSI技术飞轮由此形成闭环运转。

技术保障:策略性能永不退化

在离线优化阶段,策略开发智能体进行多轮代码迭代。由于候选池中始终包含当前策略版本,只有综合得分(平衡探索质量、计算成本和并行效率)更高的新策略才会被采用。这种设计从数学层面确保:

新一代策略性能绝不会弱于前代版本。随着真实探索的持续进行,系统积累更丰富的历史数据,推动模拟器不断进化,形成智能体与虚拟环境的协同成长。

这种共生关系使AI的探索能力呈现指数级提升。


策略优化与算法发现的良性循环:历史数据丰富度提升梦境模拟精度,梦境精度提高促进策略进化,进化后的策略又带来更深入的真实探索。系统始终在未知领域保持有效扩展。

初始策略采用简单并行探索模式,随着进化推进逐渐掌握智能资源分配。在ConvDiv内核实验中,系统在性能提升期主动减少单轮尝试次数,当性能停滞时立即加大探索力度,这种动态调整完全基于历史数据自学而成。


实测数据:317次调用碾压5万代进化

研究团队在三个领域进行了严格验证:

1. 算法工程领域:Lasso正则化路径求解器优化

在高维统计计算难题中,Gemini 3.1 Pro驱动的Dream-RSI仅需317次调用,就将求解器平均运行时间从3587.1毫秒压缩至2931.0毫秒。相比之下:

- 固定策略需要550次调用达到同等效果

- SimpleTES基线系统需生成51200次才能接近该性能

<

- 使用更轻量的Gemini 3.7 Flash时,1879次调用即可将运行时间降至2350.6毫秒

该成果证明,进化发生在策略层面而非模型底层时,小规模模型同样能获得显著提升。


Dream-RSI发现的求解方案突破传统框架,将自适应机制嵌入活跃集优化过程:先通过强规则筛选特征,再利用柯西-施瓦茨不等式进行KKT剪枝,仅在必要时计算精确梯度。这种创新设计显著提升计算效率。

2. 数学优化领域:三大高难度问题突破

在「和差问题」、「圆装填」和「自相关不等式」等极耗算力的几何优化挑战中,Dream-RSI在1000代内即达到或超越强基线性能。

与需要51200代计算的SimpleTES相比,该技术节省超过98%的计算资源,同时获得更优解。在圆装填问题中,系统追平了AlphaEvolveV2保持的全球最优纪录。


3. GPU算子工程:KernelBench性能突破

在GPU内核优化测试中,系统对四种典型内核进行极限压榨:

- VGG16和LayerNorm内核:达到同等性能时,Dream-RSI的生成次数仅为基线系统的1/2.43和1/1.79

- ConvDiv和ConvMax内核:在相同预算下,优化后内核性能分别达到基线系统的2.09倍和1.44倍


研究团队尝试将历史轨迹转化为方向性提示输入系统,试图引导探索方向。但实验结果显示:在相同计算预算下,人类指导的探索效果始终劣于自主探索。

深度解析:人类经验为何适得其反?

实验揭示了一个颠覆性现象:将历史经验抽象为高层指导原则,反而会降低AI的探索效能。这种「经验诅咒」现象源于:

- 高层抽象转化为认知偏见,限制搜索空间范围

- 预设指导原则扼杀探索多样性,导致系统陷入局部最优解

相比之下,Dream-RSI的「梦境训练」机制直接操作具体历史数据,在并行控制、分支优先级等微观层面进行代码级优化。这种保持探索空间开放性的设计,反而获得更优效果。

青年学者领衔:暑期实习生的科研突破

17人豪华团队护航创新

论文第一作者Tong Zheng(郑童)2021年毕业于东北大学,本科期间即在国内顶尖机器翻译团队(肖桐组)开展研究。2024年进入马里兰大学攻读博士学位,师从黄恒教授。这项突破性成果诞生于他在谷歌的暑期研究项目。

郑童的研究轨迹始终聚焦「防止模型陷入局部最优」:从ICLR 2025的投机解码技术,到ICLR 2026/ICML 2026的并行思考框架,其研究持续探索模型思维的多元化路径。Dream-RSI中的并行奖励机制,正是这种研究理念的延续与发展。

导师黄恒教授作为马里兰大学Brendan Iribe讲席教授,已发表约300篇顶会论文,主持7个NSF项目和3个NIH项目。其团队近年专注于大模型推理优化研究,为Dream-RSI提供了坚实的理论支撑。

17人作者团队中,通讯作者Xidong Wu和Zheng Zhang来自谷歌核心部门,DeepMind一侧包含推荐系统领域知名学者Wang-Cheng Kang(SASRec作者)。这种跨机构协作阵容,彰显谷歌对该技术路线的高度重视。

技术革命前夜:通往ASI的隐秘通道?

谷歌产品负责人Logan Kilpatrick此前透露:公司正全力追踪RSI技术进展,并已观察到早期技术迹象。他以Gemini系列模型的快速迭代为例:从3.5到3.8版本约每三周更新一次,暗示技术突破可能带来的研发加速。

Logan强调,谷歌将集中资源投入代码生成、科学研究和基础研究领域,因为这些方向最可能实现训练成本指数级下降。这种战略布局与Dream-RSI的技术理念高度契合。


RSI技术范式的转变正在重塑行业认知:传统观念认为AI进化必须通过修改自身权重实现,但Dream-RSI展示了另一种可能——通过优化外围控制策略,同样能实现能力跃迁。这种「四两拨千斤」的进化模式,可能成为突破算力瓶颈的关键。

正如论文结论所言:

「递归自我改进需要AI学会做梦,而历史数据就是构建梦境的完整世界」

随着Gemini 4等超大规模模型的临近,这种「在虚拟历史中进化」的技术路径,或许正在为智能爆发创造临界条件。我们可能正站在新一轮AI革命的起点上。

参考资料:

https://dream-rsi.com/

编辑:摩西 Aeneas

    责任编辑:
    梅西世界杯8次主罚点球4次失手——他是世界杯“点球失意之王”却仍是传奇

    2026-09-28

    梅西世界杯8次主罚点球4次罚失,成为世界杯“点球失意之王”,但他仍是足球史上进球最多的球员之一,其坚韧精神令人敬佩。 ... [详细]

    突破性进展!谷歌AI通过「梦境模拟」实现自我进化,RSI技术迎来重大突破

    2026-09-28

    谷歌联合研究团队提出Dream-RSI技术,通过构建AI梦境模拟器实现策略自我进化。实验显示该技术在算法优化、数学难题和GPU内核设计等领域取得突破性进展,性能提升最高达209%,计算成本降低98%。这项成果可能重塑人工智能发展路径。 ... [详细]

    C罗内马尔同日泪别世界杯——2026诸神黄昏,传奇落幕

    2026-09-28

    2026世界杯,C罗与内马尔同日告别,两位足坛传奇泪洒赛场,诸神黄昏时代来临。 ... [详细]

    梅西罕见与裁判冲突,背后原因引人深思

    2026-09-28

    2026年世界杯四分之一决赛,梅西罕见与裁判发生冲突,背后原因涉及比赛压力、裁判背景及个人原则。冲突过后,梅西用行动证明权威不等于不尊重,引发球迷对相互尊重的讨论。 ... [详细]

    不愿今日归途——梅西之言,道尽阿根廷全队心声

    2026-09-28

    梅西在赛后采访中直言不愿今天就结束行程回家,这句话背后隐藏着对失败的抗拒、对国家队生涯的眷恋,以及全队共同的不甘与决心。 ... [详细]

    图酷

    图说天下

    资讯排行

    首页 - 娱乐圈事 - 体育圈事 - 两性情感 - 星座命运 - 奇闻怪事 - 历史故事 - 科技资讯 - 图说天下 - 知识百科 - 图酷 - 娱乐八卦 - 开云体育登录_官网入口_安全便捷 - 乐鱼体育_乐鱼APP_体育赛事_在线娱乐平台
    电脑版 | 移动端
    Copyright © 2002-2019 徽声在线 版权所有
    删帖请联系邮箱:[email protected]