+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Rekursive Selbstverbesserung, unter der Haube

Google DeepMind veröffentlichte „Dream-RSI: Rekursive Selbstverbesserung durch sich entwickelnde Welten“ – und das darin enthaltene Codierungsmodell ändert sich nie.

Google DeepMind veröffentlichte „Dream-RSI: Rekursive Selbstverbesserung durch sich entwickelnde Welten“ – und das darin enthaltene Codierungsmodell ändert sich nie. Unter der Haube: Was der Begriff 60 Jahre lang bedeutete, was in Dream-RSI tatsächlich in Schleife läuft (eine Python-Explorationsrichtlinie, die über aufgezeichnete Suchbäume „träumt“) und warum 317 Agentenaufrufe statt 550 ein Rabatt und kein Abheben sind. Urteil: NEEDS REVIEW.

Die schriftliche Ausgabe lesen (Englisch) ↗

Was dieses Video behandelt

  • 1965 → 2008: I. J. Goods „Intelligenzexplosion“, Yudkowskys Seed AI – eine Maschine, die ihre eigenen Gewichte umschreibt
  • 2025: AlphaEvolve – 48-Multiplikations-4×4-Matrix-Multiplikation, 0,7 % der Google-Rechenleistung wiedergewonnen, Gemini-Kernels 23 % schneller
  • 2026: Dream-RSI – die Richtlinie verbessert sich, der Coder, der Richter und der Umschreiber sind alle eingefroren; die Aufforderung lautet „Lösen Sie die wissenschaftliche Aufgabe nicht“
  • X: „Google hat gerade die rekursive Selbstverbesserung geknackt“ (819 Likes) vs HN: „dies als RSI zu bezeichnen, scheint irreführend“
  • Verwendete Zahlen: §4.1 Lasso 550 → 317 Agentenaufrufe, 3587 → 2931 ms; Tabelle 1 Kreispackung 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× weniger Generationen, bis zu 2.09× schneller; Anhang B.2 Prompt (alles aus dem obigen PDF)

Übersetztes Transkript

Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.

0:00 Rekursive Selbstverbesserung ist die Idee, dass eine KI sich selbst intelligenter macht, dann das intelligentere Selbst verwendet, um es erneut zu tun, und diese Woche veröffentlichte Google eine Arbeit mit diesen beiden Worten im Titel, in der sich die Gewichte des Modells nie ändern. Drei Zahlen. Der CEO von Anthropic sagt, diese Schleife laufe seit dem Sommer, was sein Grund ist, die gesamte Branche zu verlangsamen. Der Tweet, der verkündete, dass Google es gerade geknackt hatte, sammelte achthundert Likes an einem Tag.

0:24 Und das Hauptergebnis der Arbeit ist 317 Modellaufrufe statt 550, was ein Rabatt ist, kein Abheben. In drei Minuten: woher der Begriff kam, was tatsächlich in Dream-RSI in Schleife läuft, und wie man die nächste Arbeit mit RSI auf dem Titel liest. Dies ist The Daily Diff, unter der Haube. 1965. I. J. Good, ein Statistiker aus Bletchley Park, der neben Turing arbeitete, schreibt, dass eine ultra-intelligente Maschine noch bessere Maschinen entwerfen könnte,

0:52 nennt es eine Intelligenzexplosion und die letzte Erfindung, die der Mensch je machen muss, vorausgesetzt, die Maschine ist gefügig genug, um uns zu sagen, wie man sie steuert, was das Vorausgesetzt-ist, dass die Leute nach dem Komma aufhören zu lesen. Vierzig Jahre lang bedeutete der Begriff genau das: ein System, das seinen eigenen Quellcode oder seine Gewichte bearbeitet und bei jedem Durchgang intelligenter wird. Eliezer Yudkowskys Essay von 2008 machte es zum tragenden Wort der KI-Sicherheit, und niemand hatte eine Maschine, an der man es testen konnte, was die ideale Bedingung für eine Definition ist. Dann, im Mai 2025, lieferte DeepMind AlphaEvolve aus,

1:23 einen Gemini-Agenten, der Code vorschlägt, bewerten lässt, die Gewinner behält und sie erneut mutiert. Es multiplizierte 4x4 komplexe Matrizen in 48 Schritten, schlug einen Rekord, den Strassen 1969 aufgestellt hatte, und es stellt etwa null Komma sieben Prozent der weltweiten Rechenleistung von Google wieder her, was im Google-Maßstab ein Rechenzentrum ist, das unter dem Sofa gefunden wurde. Gemini half nun bei der Ausbildung von Gemini, und der Begriff wanderte leise von Sicherheits- Blogs in Pressemitteilungen. Dream-RSI schraubt einen Controller auf diese Schleife.

1:52 Eine Richtlinie, ein tatsächliches Python-Programm, entscheidet, welche Zweige des Suchbaums erweitert werden sollen, wie viele parallel, und wann aufgegeben werden soll. Gemini schreibt den Kandidatencode, und ein fester Evaluator bewertet ihn. Jeder Lauf hinterlässt einen Baum dessen, was versucht wurde und was es bewertet hat. Dieser Baum wird zu einem Replay-Simulator: Ein zweiter, ebenfalls eingefrorener Gemini schreibt die Richtlinie um, und die neue Richtlinie wird gegen die aufgezeichneten Ergebnisse getestet, anstatt auf echten GPUs.

2:16 Das Papier nennt dies Träumen, und ein echter Lauf bezahlt Tausende von geträumten Läufen ohne Ausführungskosten. Der Gewinner geht wieder online, der Pool der aufgezeichneten Welten wächst, wiederholen. Und die Eingabeaufforderung in Anhang B.2 sagt der selbstverbessernden KI, schriftlich: Bearbeiten Sie nur diese eine Datei und lösen Sie die wissenschaftliche Aufgabe nicht. Gemessen. Bei der Lasso-Löser-Aufgabe benötigte die feste Exploration 550 Gemini-Aufrufe, um drei Komma sechs Sekunden zu erreichen, Dream-RSI benötigte 317, um zwei Komma neun zu erreichen, und beide schlugen scikit-learn.

2:46 Auf KernelBench erreichte es die gleiche Kernelgeschwindigkeit mit etwa zwei Komma vier mal weniger Generationen. Und beim Kreispacken erzielte es zwei Komma sechs drei fünf neun acht drei, was genau, auf sechs Dezimalstellen, dem entspricht, was AlphaEvolve Version zwei letztes Jahr erzielt hat. Also las X den Titel: Google hat gerade die rekursive Selbstverbesserung geknackt. Hacker News las das PDF: Dies als RSI zu bezeichnen, scheint irreführend. Und in derselben Woche sagte der CEO eines Konkurrenten, die Schleife laufe seit dem Sommer und jeder sollte langsamer werden.

3:13 Drei Sätze, dieselben zwei Worte, drei verschiedene Maschinen. Also, Montag, wie man die nächste RSI-Arbeit liest. Erstens: Fragen Sie, welches Objekt sich ändert, die Gewichte, der Code oder die Sucheinstellungen; Dream-RSI ändert das dritte. Zweitens: Fragen Sie, wer eingefroren ist; hier sind es der Coder, der Richter und der Umschreiber, alle drei. Drittens: Fragen Sie, wofür die Schlagzeilenzahl eine Einheit ist. Gesparte Rechenleistung ist Optimierung; ein Benchmark, den das Modell zuvor nicht erreichen konnte, ist der Abflug, und niemand hat das bisher veröffentlicht.

3:40 Urteil, unter der Haube: NEEDS REVIEW. Die Schleife ist real, die Einsparungen sind gemessen, und die beiden Worte auf dem Titel beschreiben eine Maschine, die nicht im Papier ist. Wenn Sie dies lieber lesen möchten, als mich es sagen zu hören, landet der Diff jeden Morgen kostenlos in Ihrem Posteingang unter the daily diff dot dev, Link unten. Sagen Sie mir in den Kommentaren, was ich als Nächstes öffnen soll. Und das ist der Diff für heute. Ich bin Niko von Axrisi.

4:00 Verantwortungsvoll zusammenführen.

Quellen

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Ähnliche Videos