递归式自我改进,幕后揭秘
Google DeepMind 发布了“Dream-RSI:通过演化世界实现递归式自我改进”——其内部的编码模型从未改变。
Google DeepMind 发布了“Dream-RSI:通过演化世界实现递归式自我改进”——其内部的编码模型从未改变。幕后揭秘:这个短语在过去 60 年的含义是什么,Dream-RSI 中实际循环的是什么(一种在记录的搜索树上“梦想”的 Python 探索策略),以及为什么 317 次代理调用而非 550 次是折扣,而不是起飞。判决:NEEDS REVIEW。
本视频涵盖的内容
- 1965 → 2008:I. J. Good 的“智能爆炸”,Yudkowsky 的种子 AI——一台重写自身权重的机器
- 2025:AlphaEvolve——48 乘法 4×4 矩阵乘法,恢复了 Google 计算的 0.7%,Gemini 内核速度提高 23%
- 2026:Dream-RSI——策略改进,编码器、判断器和重写器都已冻结;提示语是“不要解决科学任务”
- X:“Google 刚刚攻克了递归式自我改进”(819 个赞)VS HN:“称其为 RSI 似乎具有误导性”
- 使用数字:§4.1 Lasso 550 → 317 次代理调用,3587 → 2931 毫秒;表 1 圆形填充 2.635983 = AlphaEvolveV2;§4.3 KernelBench 减少了 2.43 倍 / 1.79 倍的生成次数,速度提高了 2.09 倍;附录 B.2 提示(均来自上述 PDF)
翻译的文字记录
译自英文原版旁白。可用音频和字幕由 YouTube 控制。
0:00 递归式自我改进是一种理念,即 AI 使自己变得更聪明, 然后利用更聪明的自己再次进行改进,本周 Google 发表了一篇 标题中包含这两个词的论文,其中模型的权重从未改变。 三个数字。 Anthropic 的 CEO 表示这个循环从夏天就开始运行了, 这也是他放缓整个行业发展的原因。 宣布 Google 刚刚攻克了这一难题的推文在一天内获得了八百个赞。 一天之内。
0:24 而论文本身的标题结果是 317 次模型调用而非 550 次, 这是一个折扣,而不是起飞。 三分钟内:这个短语的由来,Dream-RSI 内部实际循环的是什么, 以及如何阅读下一篇封面印有 RSI 的论文。 这里是 The Daily Diff,幕后揭秘。 1965 年。I. J. 古德,一位在布莱切利园与图灵共事的统计学家, 写道,一个超智能机器可以设计出更好的机器,
0:52 称之为智能爆炸,是人类有史以来最后一次发明, 前提是机器足够温顺,能够告诉我们如何控制它, 而人们在逗号之后就停止阅读了。 四十年来,这个短语的含义就是:一个系统编辑自己的 源代码或权重,并且每次迭代都变得更聪明。 埃利泽·尤德科夫斯基 2008 年的论文使其成为 AI 安全的支撑词,当时没有人有机器可以测试它,这是 定义。然后在 2025 年 5 月,DeepMind 发布了 AlphaEvolve,
1:23 一个 Gemini 代理,它提出代码,对其进行评分,保留获胜者并对其进行变异。 它在 48 个步骤中完成了四乘四复数矩阵的乘法, 打破了 Strassen 在 1969 年创下的记录,并回收了 Google 全球计算的约零点 七个百分点,这在 Google 的规模下,相当于 在沙发底下找到一个数据中心。 Gemini 正在帮助训练 Gemini,这个短语也悄然从安全 博客进入了新闻稿。 Dream-RSI 在该循环之上安装了一个控制器。
1:52 一个策略,一个真实的 Python 程序,决定 要扩展搜索树的哪些分支, 有多少个并行,以及何时放弃。 Gemini 编写候选代码,一个固定的评估器对其进行评分。 每次运行都会留下一个记录了尝试过什么以及分数如何的树。 这棵树变成了一个回放模拟器:第二个同样冻结的 Gemini 重写 策略,新策略根据记录的结果进行测试,而不是 在真实的 GPU 上。
2:16 论文称之为梦想,一次真实的运行可以支付数千次梦想的 运行,零执行成本。 获胜者重新上线,记录的世界池不断增长, 重复。附录 B.2 中的提示告诉自我改进的 AI, 书面指示:只编辑这一个文件,不要解决科学任务。 测量。在 Lasso 求解器任务上,固定探索花费了 550 次 Gemini 调用才达到 3.6 秒,Dream-RSI 花费了 317 次才达到 2.9 秒, 两者都击败了 scikit-learn。
2:46 在 KernelBench 上,它以大约 2.4 倍的生成次数达到了相同的内核速度。 更少的代。在圆形填充方面,它的得分为 2.635983,这精确到小数点后六位, 这正是 AlphaEvolve 第二版去年取得的成绩。 去年取得了成绩。 所以 X 读了标题:Google 刚刚攻克了递归式自我改进。 Hacker News 阅读了 PDF:称其为 RSI 似乎具有误导性。 而同一周,一位竞争对手的 CEO 表示,这个循环从夏天就开始运行了, 所有人都应该放慢速度。
3:13 三句话,同样的两个词,三台不同的机器。 那么,周一,如何阅读下一篇 RSI 论文。 一:问哪个对象改变了,是权重、代码还是搜索设置; Dream-RSI 改变了第三个。 二:问谁被冻结了;这里是编码器、判断器和重写器, 全部三个。三:问标题数字是什么单位。 节省的计算是优化;模型以前无法达到的基准是 起飞,但还没有人发布过。
3:40 判决,幕后揭秘:NEEDS REVIEW。 循环是真实的,节省的开支是可测量的,封面上的两个词 描述的机器在论文中并不存在。 如果你宁愿阅读而不是听我说,The Daily Diff 每天早上免费发送到你的收件箱, 在 thedailydiff.dev,链接在下方。 在评论中告诉我接下来要打开什么。 这就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。
4:00 负责任地合并。
来源
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



