+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Rekursiv självförbättring, under huven

Google DeepMind publicerade "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" – och den kodningsmodell som används ändras aldrig.

Google DeepMind publicerade "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" – och den kodningsmodell som används ändras aldrig. Under huven: vad frasen betydde i 60 år, vad som faktiskt loopar i Dream-RSI (en Python-utforskningspolicy som "drömmer" över inspelade sökträd), och varför 317 agentanrop istället för 550 är en rabatt, inte ett genombrott. Dom: NEEDS REVIEW.

Läs den skrivna upplagan (engelska) ↗

Vad den här videon täcker

  • 1965 → 2008: I. J. Goods "intelligensexplosion", Yudkowskys "seed AI" — en maskin som skriver om sina egna vikter
  • 2025: AlphaEvolve — 48-multiplikation 4×4 matris-multiplikation, 0,7% av Googles beräkningskraft återhämtad, Gemini-kärnor 23% snabbare
  • 2026: Dream-RSI — policyn förbättras, kodaren, bedömaren och omskrivaren är alla frysta; prompten säger "Lös inte den vetenskapliga uppgiften"
  • X: "Google knäckte precis rekursiv självförbättring" (819 gilla-markeringar) kontra HN: "att kalla detta RSI verkar missvisande"
  • Använda siffror: §4.1 Lasso 550 → 317 agentanrop, 3587 → 2931 ms; Tabell 1 cirkelpackning 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× färre generationer, upp till 2.09× snabbare; Appendix B.2 prompt (allt från ovanstående PDF)

Översatt transkription

Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.

0:00 Rekursiv självförbättring är idén att en AI gör sig själv smartare, och sedan använder det smartare jaget för att göra det igen, och den här veckan publicerade Google en artikel med dessa två ord i titeln, där modellens vikter aldrig rör sig. Tre siffror. Anthropic's VD säger att denna loop har kört sedan i somras, vilket är hans anledning att sakta ner hela branschen. Tweeten som annonserade att Google precis knäckte det samlade åttahundra gilla-markeringar på en dag.

0:24 Och artikelns egna huvudresultat är 317 modellanrop istället för 550, vilket är en rabatt, inte ett genombrott. På tre minuter: var frasen kom ifrån, vad som faktiskt loopar inuti Dream-RSI, och hur man läser nästa artikel med RSI på omslaget. Detta är The Daily Diff, under huven. 1965. I. J. Good, en statistiker från Bletchley Park som arbetade bredvid Turing, skriver att en ultraintelligent maskin skulle kunna designa ännu bättre maskiner,

0:52 kallar det en intelligensexplosion och den sista uppfinningen människan någonsin behöver göra, förutsatt att maskinen är tillräckligt följsam för att berätta hur vi ska kontrollera den, vilket är det "förutsatt att" människor slutar läsa efter kommatecknet. I fyrtio år betydde frasen exakt det: ett system som redigerar sin egen källa eller vikter och blir smartare för varje pass. Eliezer Yudkowskys uppsats från 2008 gjorde det till det bärande ordet inom AI säkerhet, och ingen hade en maskin att testa det på, vilket är den ideala förutsättningen för en definition. Sedan i maj 2025 lanserade DeepMind AlphaEvolve,

1:23 en Gemini-agent som föreslår kod, får den bedömd, behåller vinnarna och muterar dem igen. Den multiplicerade fyra-gånger-fyra komplexa matriser i 48 steg, och slog ett rekord som Strassen satte 1969, och den återhämtar ungefär noll komma sju procent av Googles världsomspännande beräkningskraft, vilket i Googles skala är ett datacenter hittat under soffan. Gemini hjälpte nu till att träna Gemini, och frasen flyttades tyst från säkerhets- bloggar till pressmeddelanden. Dream-RSI fäster en styrenhet ovanpå den loopen.

1:52 En policy, ett verkligt Python-program, bestämmer vilka grenar av sökträdet som ska utökas, hur många parallellt, och när man ska ge upp. Gemini skriver kandidatkoden, och en fast utvärderare bedömer den. Varje körning lämnar efter sig ett träd av vad som provats och vad det fick för poäng. Det trädet blir en replay-simulator: en andra, lika frusen Gemini skriver om policyn, och den nya policyn testas mot de inspelade resultaten istället för på riktiga GPU:er.

2:16 Artikeln kallar detta för att drömma, och en riktig körning betalar för tusentals drömda sådana till noll exekveringskostnad. Vinnaren går tillbaka online, poolen av inspelade världar växer, upprepas. Och prompten i Appendix B.2 säger till den självförbättrande AI:n, skriftligen: redigera endast denna fil, och lös inte den vetenskapliga uppgiften. Mätt. På Lasso-lösningsuppgiften använde fast utforskning 550 Gemini-anrop för att nå 3,6 sekunder, Dream-RSI använde 317 för att nå 2,9, och båda slog scikit-learn.

2:46 På KernelBench nådde den samma kärnhastighet med ungefär 2,4 gånger färre generationer. Och på cirkelpackning fick den 2,6359 83, vilket är exakt, till sex decimaler, vad AlphaEvolve version två fick förra året. Så X läste titeln: Google knäckte precis rekursiv självförbättring. Hacker News läste PDF:en: att kalla detta RSI verkar missvisande. Och samma vecka sa en konkurrents VD att loopen hade kört sedan sommaren och att alla borde sakta ner.

3:13 Tre meningar, samma två ord, tre olika maskiner. Så, på måndag, hur man läser nästa RSI-artikel. Ett: fråga vilket objekt som ändras, vikterna, koden, eller sökinställningarna; Dream-RSI ändrar det tredje. Två: fråga vem som är frusen; här är det kodaren, domaren och omskrivaren, alla tre. Tre: fråga vad huvudnumret är en enhet av. Sparad beräkningskraft är optimering; ett riktmärke som modellen inte kunde nå förut är genombrottet, och ingen har publicerat det ännu.

3:40 Dom, under huven: behöver granskas. Loopen är verklig, besparingarna är mätta, och de två orden på omslaget beskriver en maskin som inte finns i artikeln. Om du hellre läser detta än hör mig säga det, landar diffen i din inkorg varje morgon, gratis på the daily diff dot dev, länk nedan. Berätta vad jag ska öppna upp nästa gång i kommentarerna. Och det var diffen för idag. Jag är Niko från Axrisi.

4:00 Slå samman ansvarsfullt.

Källor

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Relaterade videor