+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

再帰的自己改善、その裏側

Google DeepMindは「Dream-RSI: 再帰的自己改善による進化する世界」を発表しました。

Google DeepMindは「Dream-RSI: 再帰的自己改善による進化する世界」を発表しました。その中にあるコーディングモデルは決して変わりません。その裏側では、60年間このフレーズが何を意味してきたのか、Dream-RSI(記録された探索木上で「夢を見る」Python探索ポリシー)で実際にループしているもの、そして550ではなく317のエージェント呼び出しが割引であって離陸ではない理由が語られます。評決:NEEDS REVIEW。

書面版を読む(英語) ↗

この動画の要点

  • 1965年 → 2008年:I. J. Goodの「知能爆発」、ユドコウスキーのシードAI — 自身の重みを書き換える機械
  • 2025年:AlphaEvolve — 48回の乗算による4×4行列乗算、Googleの計算能力の0.7%を回復、Geminiカーネルが23%高速化
  • 2026年:Dream-RSI — ポリシーは改善されるが、コーダー、評価者、書き換えはすべて固定されている。プロンプトは「科学的タスクを解決しないこと」と指示
  • X: 「Googleは再帰的自己改善を達成したばかりだ」(819いいね)vs HN: 「これをRSIと呼ぶのは誤解を招くようだ」
  • 使用された数値:§4.1 Lasso 550 → 317のエージェント呼び出し、3587 → 2931 ms;表1 円充填 2.635983 = AlphaEvolveV2;§4.3 KernelBench 2.43× / 1.79×少ない世代数、最大2.09×高速化;付録B.2 プロンプト(すべて上記のPDFより)

翻訳されたトランスクリプト

オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。

0:00 再帰的自己改善とは、AIが自分自身を賢くするという考え方で、 その賢くなった自分を使って再びそれを行う、そして今週Googleは その二つの言葉をタイトルに含む論文を発表しました。その中でモデルの重みは決して 動きません。3つの数字。 AnthropicのCEOは、このループが夏から続いていると言っています、 それが彼が業界全体を減速させる理由です。 Googleがそれを達成したと発表したツイートは、1日で800件の「いいね」を集めました。 1日で。

0:24 そして、この論文の主要な結果は、550回のモデル呼び出しではなく317回で、 これは割引であり、離陸ではありません。 3分で:このフレーズがどこから来たのか、Dream-RSIの内部で実際にループしているもの、 そしてRSIが表紙にある次の論文をどう読むか。 これはThe Daily Diff、その裏側です。 1965年。I. J. チューリングの隣で働いていたブレッチリーパークの統計学者であるグッドは、 超知能機械がさらに優れた機械を設計できると書き、

0:52 それを知能爆発と呼び、人間がこれまでに必要とする最後の発明だとしました。 ただし、その機械が十分に温厚で、我々にそれを制御する方法を教えることができるならば、と。 それが「ただし」の人々がカンマの後に読み続けるのをやめてしまうところです。 40年間、このフレーズはまさにそれを意味していました:自身のソースや重みを編集し、 毎回賢くなっていくシステムです。 エリーザー・ユドコウスキーの2008年のエッセイにより、AI安全保障の主要な言葉となり、 誰もそれをテストする機械を持っていませんでした。これは定義にとって理想的な条件です。 その後、2025年5月にDeepMindはAlphaEvolveを出荷しました。

1:23 これはコードを提案し、スコア付けされ、勝者を保持して再び変異させるGeminiエージェントです。 これは48ステップで4×4の複素行列を乗算し、 1969年にStrassenが打ち立てた記録を破り、Googleの全世界の計算能力の約0.7%を回復します。Googleの規模では、 これはソファの下で見つかったデータセンターに匹敵します。 ソファの下で見つかったデータセンターに匹敵します。 Geminiは今やGeminiのトレーニングを助けており、このフレーズは静かに安全保障ブログから プレスリリースへと移行しました。 Dream-RSIは、そのループの上にコントローラーをボルトで固定します。

1:52 ポリシー、つまり実際のPythonプログラムが、 探索木のどのブランチを 展開するか、いくつ並行して行うか、そしていつ諦めるかを決定します。 Geminiが候補コードを書き、固定された評価者がそれを採点します。 各実行は、試されたこととそれらのスコアのツリーを残します。 そのツリーはリプレイシミュレーターとなります。2番目の、同様に固定されたGeminiが ポリシーを書き換え、新しいポリシーは実際のGPUではなく、記録された結果に対してテストされます。 実際のGPUではなく、記録された結果に対してテストされます。

2:16 この論文はこれを夢見と呼び、1回の実際の実行で数千回の夢見た実行を 実行コストゼロでまかなうことができます。 勝者はオンラインに戻り、記録された世界のプールは成長し、 繰り返されます。そして付録B.2のプロンプトは、自己改善AIに書面で、 書面で:この1つのファイルのみを編集し、科学的タスクを解決しないように指示します。 測定されました。Lassoソルバータスクでは、固定探索は3.6秒に到達するのに550回のGemini呼び出しを費やし、 Dream-RSIは2.9秒に到達するのに317回を費やし、 どちらもscikit-learnを上回りました。

2:46 KernelBenchでは、約2.4倍少ない世代で同じカーネル速度に達しました。 円充填では2.635983というスコアを記録しました。これは、AlphaEvolveバージョン2が昨年記録したスコアと、 正確に小数点以下6桁まで一致します。 昨年記録したスコアと、正確に小数点以下6桁まで一致します。 だからXはタイトルを読みました:「Googleは再帰的自己改善を達成したばかりだ」。 Hacker NewsはPDFを読みました:「これをRSIと呼ぶのは誤解を招くようだ」。 そして同じ週、競合他社のCEOは、このループが夏から続いており、 誰もが減速すべきだと述べました。

3:13 3つの文、同じ2つの言葉、3つの異なる機械。 では月曜日、次のRSI論文をどう読むか。 1つ:何が変わるのか、重みか、コードか、探索設定かを問いかけます。Dream-RSIは3番目を変更します。 Dream-RSIは3番目を変更します。 2つ:誰が固定されているのかを問いかけます。ここでは、コーダー、評価者、リライターの3人全員です。 3人全員です。3つ:主要な数値が何の単位であるかを問いかけます。 計算の節約は最適化です。以前モデルが到達できなかったベンチマークは 離陸であり、それはまだ誰も発表していません。

3:40 評決、その裏側:NEEDS REVIEW。 ループは現実のものであり、節約は測定されており、表紙の2つの言葉は 論文には書かれていない機械について説明しています。 私が話すよりもこれを読みたい場合は、毎朝The Daily Diffが受信トレイに届きます。 毎日無料でthedailydiff.devで入手できます。リンクは下にあります。 次に何を開くべきかコメントで教えてください。 そして今日の差分は以上です。 私はAxrisiのNikoです。

4:00 Merge responsibly.

情報源

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

関連動画

under-the-hood · ja · 2026/09/24

SAML、その仕組み:手紙の中の署名

SAMLは、ほとんどすべての仕事用アプリへのログインを可能にし、その署名は署名対象のXML内に存在します。その仕組み:アプリ、ブラウザ、IDプロバイダ間のログインのやり取り、アサーションの見た目、なぜ正規化があらゆるバイトで一致する必要があるのか、そしてなぜ2012年から2025年まで同じバグクラスが再発し続けるのか。Trail of Bitsの「SAML: A fractal of bad de

3:02 ↗
under-the-hood · ja · 2026/09/23

モデルが舞台裏で死ぬとき

AIモデルは死ぬのではなく、シャットダウンの日付が設定され、翌朝にはAPIコールが「モデルは非推奨になりました。詳細はこちらでご確認ください」という404を返します。舞台裏では、4つの状態のパイプライン(アクティブ → レガシー → 非推奨 → 廃止)、通知期間(OpenAIは6ヶ月以上/3ヶ月以上/プレビュー版で約2週間。Anthropicは60日以上)、開発者にとって何が問題になるか(うるさい

3:15 ↗
under-the-hood · ja · 2026/09/21

ClaudeがRSA-896を因数分解。RSAが実際に破られる仕組み

9月19日、Anthropicのエンジニアが、オープンソースのCADO-NFSふるいのGPUポートであるClaudeと、2,048台のアイドル状態のGPUで10日間で約30GPU年を使い、270桁の挑戦数であるRSA-896を因数分解しました。これは、CognitionのDevinがRSA-260に同じことを行ってから16日後の出来事です。舞台裏では、因数分解の記録が実際にどのように設定されるか(

3:39 ↗
under-the-hood · ja · 2026/09/19

パスキー、その内側

パスキーは、デバイスが考案し、決してあなたに見せず、あなたを含む誰にも渡すことを拒否するパスワードです。その内側:WebAuthnの儀式(サイトごとのキーペア、チャレンジ、署名)、ブラウザが書き込みフィッシングを撲滅する唯一のフィールド(オリジン)、デバイスに紐付けられたキーと同期されたキー、AAGUID、そして「フィッシングに強い」と「移動できない」が同じ特性である理由 — これが「パスキーは好

3:12 ↗