遞迴自我改進,內部揭秘
Google DeepMind 發佈了「Dream-RSI:透過演化世界進行遞迴自我改進」— 其中使用的編碼模型從未改變。
Google DeepMind 發佈了「Dream-RSI:透過演化世界進行遞迴自我改進」— 其中使用的編碼模型從未改變。內部揭秘:這個詞語在過去 60 年的含義是什麼,Dream-RSI 中實際循環的是什麼(一個在記錄的搜尋樹上「夢想」的 Python 探索策略),以及為什麼 317 次代理呼叫而非 550 次是折扣而非飛躍。判決:NEEDS REVIEW。
本影片重點
- 1965 → 2008:I. J. Good 的「智慧爆炸」、Yudkowsky 的種子 AI — 一種能重寫自身權重的機器
- 2025:AlphaEvolve — 48 次乘法的 4×4 矩陣乘法,回收 Google 運算量的 0.7%,Gemini 核心速度提高 23%
- 2026:Dream-RSI — 策略改進,編碼器、評判器和重寫器都已凍結;提示寫著「不要解決科學任務」
- X:「Google 剛剛攻克了遞迴自我改進」(819 個讚)對比 HN:「稱之為 RSI 似乎有誤導性」
- 使用的數字:§4.1 Lasso 550 → 317 次代理呼叫,3587 → 2931 毫秒;表格 1 圓形填充 2.635983 = AlphaEvolveV2;§4.3 KernelBench 2.43× / 1.79× 更少的生成,最高 2.09× 更快;附錄 B.2 提示(均來自上方的 PDF)
翻譯文字稿
譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。
0:00 遞迴自我改進是指 AI 讓自己變得更聰明, 然後使用更聰明的自己再次執行此操作,而本週 Google 發佈了一篇 標題中帶有這兩個詞的論文,其中模型的權重從未 移動。三個數字。 Anthropic 的執行長表示,這個循環自夏天以來一直在運行, 這就是他要求整個行業放慢速度的原因。 宣布 Google 剛剛攻克它的推文一天內就獲得了八百個讚。 一天內。
0:24 而這篇論文本身的主要結果是 317 次模型呼叫而非 550 次, 這是一個折扣,而不是飛躍。 三分鐘內:這個詞語的來源,Dream-RSI 內部實際循環的是什麼, 以及如何閱讀下一篇封面上有 RSI 的論文。 這是 The Daily Diff,內部揭秘。 1965 年。I. J. Good,一位在圖靈身旁工作的布萊切利園統計學家, 寫道,一台超智慧機器可以設計出更好的機器,
0:52 稱之為智慧爆炸和人類所需作的最後一項發明, 前提是機器要足夠溫順,能告訴我們如何控制它, 這就是那些「前提是」的人在逗號後就停止閱讀的原因。 四十多年來,這個詞語的含義正是如此:一個編輯自身 原始碼或權重,並在每次迭代中變得更聰明的系統。 Eliezer Yudkowsky 2008 年的論文使其成為 AI 安全性的支撐詞,而當時沒有機器可以測試它,這是一個理想的定義條件。 然後在 2025 年 5 月,DeepMind 推出了 AlphaEvolve,
1:23 一個 Gemini 代理,它提出程式碼,獲得評分,保留獲勝者並再次變異 它們。它在 48 步內完成了四乘四複數矩陣的乘法, 打破了 Strassen 在 1969 年創下的紀錄,並且它回收了 Google 全球運算量的約零 點七百分比,以 Google 的規模來看,這就像在沙發底下發現了一個資料中心。 沙發底下找到的資料中心。 Gemini 現在正在幫助訓練 Gemini,這個詞語悄悄地從安全 部落格轉移到新聞稿中。 Dream-RSI 在該循環之上附加了一個控制器。
1:52 一個策略,一個實際的 Python 程式,決定 要擴展搜尋樹的哪些分支, 多少個並行,以及何時放棄。 Gemini 撰寫候選程式碼,然後一個固定的評估器對其進行評分。 每次運行都會留下一個記錄了嘗試過什麼和得分多少的樹狀結構。 該樹狀結構成為一個重播模擬器:第二個同樣被凍結的 Gemini 重寫 策略,並且新策略是根據記錄的結果進行測試,而不是 在真實 GPU 上進行測試。
2:16 論文稱之為夢想,一次真實運行可以支付數千次夢想的成本, 零執行成本。 獲勝者重新上線,記錄世界池不斷增長, 重複。附錄 B.2 中的提示明確告訴自我改進的 AI: 只編輯此文件,不要解決科學任務。 測量結果。在 Lasso 解算器任務中,固定探索耗費 550 次 Gemini 呼叫,達到 三點六秒;Dream-RSI 耗費 317 次,達到兩點九秒, 兩者都擊敗了 scikit-learn。
2:46 在 KernelBench 上,它以大約兩點四倍更少的生成次數,達到了相同的核心速度。 而圓形填充則獲得了兩點六三五九八三的分數,這與 AlphaEvolve 第二版去年 所得分數精確到小數點後六位完全一致。 去年得到的分數。 所以 X 讀了標題:Google 剛剛攻克了遞迴自我改進。 Hacker News 讀了 PDF:稱之為 RSI 似乎有誤導性。 同一週,一位競爭對手的執行長表示,該循環自夏天以來一直在運行, 每個人都應該放慢速度。
3:13 三句話,同樣的兩個詞,三種不同的機器。 所以,星期一,如何閱讀下一篇 RSI 論文。 一:詢問什麼物件會改變,是權重、程式碼還是搜尋設定; Dream-RSI 改變了第三個。 二:詢問誰是凍結的;這裡是指編碼器、評判器和重寫器, 全部三者。三:詢問標題數字的單位是什麼。 節省的運算是優化;模型之前無法達到的基準是 起飛,而目前還沒有人發佈過。
3:40 判決,內部揭秘:需要審查。 循環是真實的,節省是可測量的,而封面上的兩個詞 描述的機器並不在論文中。 如果你寧願閱讀這份內容而不是聽我說,The Daily Diff 會在每個早晨 免費發送到你的收件箱,網址是 thedailydiff.dev,連結在下方。 在評論中告訴我接下來要揭示什麼。 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。
4:00 負責任地合併。
來源
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



