再帰的自己改善、その裏側
Google DeepMindは「Dream-RSI: 再帰的自己改善による進化する世界」を発表しました。
Google DeepMindは「Dream-RSI: 再帰的自己改善による進化する世界」を発表しました。その中にあるコーディングモデルは決して変わりません。その裏側では、60年間このフレーズが何を意味してきたのか、Dream-RSI(記録された探索木上で「夢を見る」Python探索ポリシー)で実際にループしているもの、そして550ではなく317のエージェント呼び出しが割引であって離陸ではない理由が語られます。評決:NEEDS REVIEW。
この動画の要点
- 1965年 → 2008年:I. J. Goodの「知能爆発」、ユドコウスキーのシードAI — 自身の重みを書き換える機械
- 2025年:AlphaEvolve — 48回の乗算による4×4行列乗算、Googleの計算能力の0.7%を回復、Geminiカーネルが23%高速化
- 2026年:Dream-RSI — ポリシーは改善されるが、コーダー、評価者、書き換えはすべて固定されている。プロンプトは「科学的タスクを解決しないこと」と指示
- X: 「Googleは再帰的自己改善を達成したばかりだ」(819いいね)vs HN: 「これをRSIと呼ぶのは誤解を招くようだ」
- 使用された数値:§4.1 Lasso 550 → 317のエージェント呼び出し、3587 → 2931 ms;表1 円充填 2.635983 = AlphaEvolveV2;§4.3 KernelBench 2.43× / 1.79×少ない世代数、最大2.09×高速化;付録B.2 プロンプト(すべて上記のPDFより)
翻訳されたトランスクリプト
オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。
0:00 再帰的自己改善とは、AIが自分自身を賢くするという考え方で、 その賢くなった自分を使って再びそれを行う、そして今週Googleは その二つの言葉をタイトルに含む論文を発表しました。その中でモデルの重みは決して 動きません。3つの数字。 AnthropicのCEOは、このループが夏から続いていると言っています、 それが彼が業界全体を減速させる理由です。 Googleがそれを達成したと発表したツイートは、1日で800件の「いいね」を集めました。 1日で。
0:24 そして、この論文の主要な結果は、550回のモデル呼び出しではなく317回で、 これは割引であり、離陸ではありません。 3分で:このフレーズがどこから来たのか、Dream-RSIの内部で実際にループしているもの、 そしてRSIが表紙にある次の論文をどう読むか。 これはThe Daily Diff、その裏側です。 1965年。I. J. チューリングの隣で働いていたブレッチリーパークの統計学者であるグッドは、 超知能機械がさらに優れた機械を設計できると書き、
0:52 それを知能爆発と呼び、人間がこれまでに必要とする最後の発明だとしました。 ただし、その機械が十分に温厚で、我々にそれを制御する方法を教えることができるならば、と。 それが「ただし」の人々がカンマの後に読み続けるのをやめてしまうところです。 40年間、このフレーズはまさにそれを意味していました:自身のソースや重みを編集し、 毎回賢くなっていくシステムです。 エリーザー・ユドコウスキーの2008年のエッセイにより、AI安全保障の主要な言葉となり、 誰もそれをテストする機械を持っていませんでした。これは定義にとって理想的な条件です。 その後、2025年5月にDeepMindはAlphaEvolveを出荷しました。
1:23 これはコードを提案し、スコア付けされ、勝者を保持して再び変異させるGeminiエージェントです。 これは48ステップで4×4の複素行列を乗算し、 1969年にStrassenが打ち立てた記録を破り、Googleの全世界の計算能力の約0.7%を回復します。Googleの規模では、 これはソファの下で見つかったデータセンターに匹敵します。 ソファの下で見つかったデータセンターに匹敵します。 Geminiは今やGeminiのトレーニングを助けており、このフレーズは静かに安全保障ブログから プレスリリースへと移行しました。 Dream-RSIは、そのループの上にコントローラーをボルトで固定します。
1:52 ポリシー、つまり実際のPythonプログラムが、 探索木のどのブランチを 展開するか、いくつ並行して行うか、そしていつ諦めるかを決定します。 Geminiが候補コードを書き、固定された評価者がそれを採点します。 各実行は、試されたこととそれらのスコアのツリーを残します。 そのツリーはリプレイシミュレーターとなります。2番目の、同様に固定されたGeminiが ポリシーを書き換え、新しいポリシーは実際のGPUではなく、記録された結果に対してテストされます。 実際のGPUではなく、記録された結果に対してテストされます。
2:16 この論文はこれを夢見と呼び、1回の実際の実行で数千回の夢見た実行を 実行コストゼロでまかなうことができます。 勝者はオンラインに戻り、記録された世界のプールは成長し、 繰り返されます。そして付録B.2のプロンプトは、自己改善AIに書面で、 書面で:この1つのファイルのみを編集し、科学的タスクを解決しないように指示します。 測定されました。Lassoソルバータスクでは、固定探索は3.6秒に到達するのに550回のGemini呼び出しを費やし、 Dream-RSIは2.9秒に到達するのに317回を費やし、 どちらもscikit-learnを上回りました。
2:46 KernelBenchでは、約2.4倍少ない世代で同じカーネル速度に達しました。 円充填では2.635983というスコアを記録しました。これは、AlphaEvolveバージョン2が昨年記録したスコアと、 正確に小数点以下6桁まで一致します。 昨年記録したスコアと、正確に小数点以下6桁まで一致します。 だからXはタイトルを読みました:「Googleは再帰的自己改善を達成したばかりだ」。 Hacker NewsはPDFを読みました:「これをRSIと呼ぶのは誤解を招くようだ」。 そして同じ週、競合他社のCEOは、このループが夏から続いており、 誰もが減速すべきだと述べました。
3:13 3つの文、同じ2つの言葉、3つの異なる機械。 では月曜日、次のRSI論文をどう読むか。 1つ:何が変わるのか、重みか、コードか、探索設定かを問いかけます。Dream-RSIは3番目を変更します。 Dream-RSIは3番目を変更します。 2つ:誰が固定されているのかを問いかけます。ここでは、コーダー、評価者、リライターの3人全員です。 3人全員です。3つ:主要な数値が何の単位であるかを問いかけます。 計算の節約は最適化です。以前モデルが到達できなかったベンチマークは 離陸であり、それはまだ誰も発表していません。
3:40 評決、その裏側:NEEDS REVIEW。 ループは現実のものであり、節約は測定されており、表紙の2つの言葉は 論文には書かれていない機械について説明しています。 私が話すよりもこれを読みたい場合は、毎朝The Daily Diffが受信トレイに届きます。 毎日無料でthedailydiff.devで入手できます。リンクは下にあります。 次に何を開くべきかコメントで教えてください。 そして今日の差分は以上です。 私はAxrisiのNikoです。
4:00 Merge responsibly.
情報源
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



