Rekurzivní sebezdokonalování, pod kapotou
Google DeepMind publikoval "Dream-RSI: Rekurzivní sebezdokonalování skrze vyvíjející se světy" — a programovací model uvnitř se nikdy nemění.
Google DeepMind publikoval "Dream-RSI: Rekurzivní sebezdokonalování skrze vyvíjející se světy" — a programovací model uvnitř se nikdy nemění. Pod kapotou: co tato fráze znamenala 60 let, co se skutečně cyklí v Dream-RSI (zásada průzkumu v Pythonu, která "snít" nad zaznamenanými vyhledávacími stromy), a proč 317 volání agenta namísto 550 je sleva, nikoli vzlet. Verdikt: NEEDS REVIEW.
Přečtěte si psané vydání (anglicky) ↗
Co toto video pokrývá
- 1965 → 2008: I. J. Goodova "exploze inteligence", Yudkowského seed AI — stroj, který přepisuje své vlastní váhy
- 2025: AlphaEvolve — 48násobné násobení matice 4×4, 0,7 % výpočetního výkonu Google získáno, jádra Gemini o 23 % rychlejší
- 2026: Dream-RSI — politika se zlepšuje, kodér, soudce a přepisovač jsou zmraženi; prompt říká "Neřešte vědecký úkol"
- X: "Google právě prolomil rekurzivní sebezdokonalování" (819 lajků) vs HN: "nazývat to RSI se zdá zavádějící"
- Použitá čísla: §4.1 Lasso 550 → 317 volání agenta, 3587 → 2931 ms; Tabulka 1 kruhové balení 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× méně generací, až 2.09× rychlejší; Příloha B.2 prompt (vše z výše uvedeného PDF)
Přeložený přepis
Přeloženo z původního anglického vyprávění. Dostupné audio a titulky jsou řízeny YouTube.
0:00 Rekurzivní sebezdokonalování je myšlenka, že se AI sama vylepšuje, poté používá vylepšené já k tomu, aby to udělala znovu, a tento týden Google publikoval článek s těmito dvěma slovy v názvu, ve kterém se váhy modelu nikdy nepohybují. Tři čísla. Generální ředitel Anthropicu říká, že tato smyčka běží od léta, což je jeho důvod ke zpomalení celého odvětví. Tweet oznamující, že Google to právě prolomil, nasbíral osm set lajků za den.
0:24 A hlavní výsledek samotného článku je 317 volání modelu namísto 550, což je sleva, nikoli vzlet. Za tři minuty: odkud fráze pochází, co se skutečně cyklí uvnitř Dream-RSI a jak číst další článek s RSI na obálce. Tohle je The Daily Diff, pod kapotou. 1965. I. J. Good, statistik z Bletchley Parku, který pracoval vedle Turinga, píše, že ultra-inteligentní stroj by mohl navrhovat ještě lepší stroje,
0:52 nazývá to explozí inteligence a posledním vynálezem, který člověk kdy bude potřebovat, za předpokladu, že stroj bude dostatečně poslušný, aby nám řekl, jak ho ovládat, což je to 'za předpokladu', co lidé přestanou číst po čárce. Po čtyřicet let tato fráze znamenala přesně to: systém, který upravuje svůj vlastní zdroj nebo váhy a s každým průchodem je chytřejší. Esej Eliezer Yudkowského z roku 2008 z ní udělala nosné slovo AI bezpečnosti, a nikdo neměl stroj, na kterém by to mohl testovat, což je ideální podmínka pro definici. Poté v květnu 2025 DeepMind vydal AlphaEvolve,
1:23 agenta Gemini, který navrhuje kód, nechá ho ohodnotit, uchovává vítěze a mutuje je znovu. Násobil komplexní matice čtyři krát čtyři v 48 krocích, překonal rekord, který Strassen stanovil v roce 1969, a získává zpět asi nula celá sedm desetiny procenta celosvětového výpočetního výkonu Google, což v měřítku Google je datové centrum nalezené pod pohovkou. Gemini nyní pomáhal trénovat Gemini, a fráze se tiše přesunula z bezpečnostních blogů do tiskových zpráv. Dream-RSI přidává řídicí jednotku nad tuto smyčku.
1:52 Politika, skutečný program v Pythonu, rozhoduje, které větve vyhledávacího stromu rozšířit, kolik paralelně a kdy to vzdát. Gemini píše kandidátský kód a pevný evaluátor ho hodnotí. Každý běh zanechává strom toho, co bylo zkoušeno a co to ohodnotilo. Tento strom se stává simulačním přehrávačem: druhý, stejně zmrazený Gemini přepisuje politiku a nová politika je testována proti zaznamenaným výsledkům namísto na skutečných GPU.
2:16 Článek to nazývá sněním a jeden skutečný běh platí za tisíce sněných za nulové náklady na provedení. Vítěz se vrací online, fond zaznamenaných světů roste, opakovat. A prompt v příloze B.2 říká samo-vylepšující AI, písemně: upravte pouze tento jeden soubor a neřešte vědecký úkol. Změřeno. Na úloze Lasso řešitele, pevný průzkum spotřeboval 550 volání Gemini, aby dosáhl tří celých šesti sekund, Dream-RSI spotřeboval 317, aby dosáhl dvou celých devíti, a oba překonaly scikit-learn.
2:46 Na KernelBench dosáhl stejné rychlosti jádra s přibližně dva celé čtyřnásobně méně generací. A na kruhovém balení dosáhl skóre dva celé šest tři pět devět osm tři, což je přesně, na šest desetinných míst, to, co AlphaEvolve verze dva skórovala minulý rok. Takže X si přečetlo název: Google právě prolomil rekurzivní sebezdokonalování. Hacker News si přečetl PDF: nazývat to RSI se zdá zavádějící. A ve stejném týdnu generální ředitel konkurenta řekl, že smyčka běží od léta a všichni by měli zpomalit.
3:13 Tři věty, stejná dvě slova, tři různé stroje. Takže, pondělí, jak číst další článek o RSI. Jedna: zeptejte se, který objekt se mění, váhy, kód nebo nastavení vyhledávání; Dream-RSI mění třetí. Dvě: zeptejte se, kdo je zmrazen; zde je to kodér, soudce a přepisovač, všichni tři. Tři: zeptejte se, co je hlavní číslo za jednotku. Ušetřený výpočet je optimalizace; benchmark, kterého model dříve nedosáhl, je vzlet, a to nikdo ještě nepublikoval.
3:40 Verdikt, pod kapotou: NEEDS REVIEW. Smyčka je skutečná, úspory jsou měřené a dvě slova na obálce popisují stroj, který v článku není. Pokud si to raději přečtete, než abyste mě slyšeli, diff vám přistane ve schránce každé ráno, zdarma na the daily diff dot dev, odkaz níže. Řekněte mi, co mám otevřít příště v komentářích. A to je diff pro dnešek. Jsem Niko z Axrisi.
4:00 Spojte se zodpovědně.
Zdroje
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



