Vetë-përmirësimi rekursiv, në thellësi
Google DeepMind publikoi "Dream-RSI: Vetë-Përmirësimi Rekursiv nëpërmjet Botëve në Evolucion" — dhe modeli i kodimit brenda tij nuk ndryshon kurrë.
Google DeepMind publikoi "Dream-RSI: Vetë-Përmirësimi Rekursiv nëpërmjet Botëve në Evolucion" — dhe modeli i kodimit brenda tij nuk ndryshon kurrë. Në thellësi: çfarë ka nënkuptuar fraza për 60 vjet, çfarë qarkullon në të vërtetë në Dream-RSI (një politikë eksplorimi Python që "ëndërron" mbi pemët e kërkimit të regjistruara), dhe pse 317 thirrje agjenti në vend të 550 është një zbritje, jo një ngritje. Vendimi: NEEDS REVIEW.
Lexoni edicionin e shkruar (anglisht) ↗
Çfarë mbulon kjo video
- 1965 → 2008: "shpërthimi i inteligjencës" i I. J. Good, AI e farës e Yudkowsky-t — një makinë që rishkruan peshat e veta
- 2025: AlphaEvolve — shumëzim matrice 4×4 me 48-fishim, 0.7% e llogaritjes së Google e rikuperuar, bërthamat Gemini 23% më të shpejta
- 2026: Dream-RSI — politika përmirësohet, koduesi, gjykatësi dhe rishkruesi janë të gjithë të ngrirë; kërkesa thotë "Mos e zgjidh detyrën shkencore"
- X: "Google sapo theu vetë-përmirësimin rekursiv" (819 pëlqime) vs HN: "ta quash këtë RSI duket mashtruese"
- Numrat e përdorur: §4.1 Lasso 550 → 317 thirrje agjenti, 3587 → 2931 ms; Tabela 1 paketim rrethi 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× më pak gjenerata, deri në 2.09× më shpejt; Shtojca B.2 kërkesa (të gjitha nga PDF-ja e mësipërme)
Transkript i përkthyer
Përkthyer nga tregimi origjinal në anglisht. Audio dhe titrat e disponueshme kontrollohen nga YouTube.
0:00 Vetë-përmirësimi rekursiv është ideja që një AI e bën veten më të zgjuar, pastaj përdor vetëdijen më të zgjuar për ta bërë përsëri, dhe këtë javë Google publikoi një punim me ato dy fjalë në titull, në të cilin peshat e modelit nuk lëvizin. Tre numra. CEO i Anthropic thotë se kjo cikël ka funksionuar që nga vera, që është arsyeja e tij për të ngadalësuar të gjithë industrinë. Postimi në Twitter që njoftonte se Google sapo e kishte thyer, mblodhi tetëqind pëlqime në një ditë.
0:24 Dhe rezultati kryesor i vetë punimit është 317 thirrje modeli në vend të 550, që është një zbritje, jo një ngritje. Në tre minuta: nga erdhi fraza, çfarë qarkullon në të vërtetë brenda Dream-RSI, dhe si të lexoni punimin tjetër me RSI në kopertinë. Ky është The Daily Diff, në thellësi. 1965. I. J. Good, një statistikane e Bletchley Park që punoi pranë Turing, shkruan se një makinë ultra-inteligjente mund të projektonte makina edhe më të mira,
0:52 e quan atë një shpërthim inteligjence dhe shpikjen e fundit që njeriu do të duhet të bëjë ndonjëherë, me kusht që makina të jetë mjaft e bindshme për të na treguar si ta kontrollojmë, që është ajo që njerëzit ndalojnë së lexuari pas presjes. Për dyzet vjet fraza nënkuptonte saktësisht këtë: një sistem që redakton të vetën burim ose pesha dhe del më i zgjuar çdo kalim. Eseja e Eliezer Yudkowsky-t e vitit 2008 e bëri atë fjalën mbështetëse të AI sigurisë, dhe askush nuk kishte një makinë për ta testuar, gjë që është kushti ideal për një përkufizim. Pastaj në maj 2025 DeepMind dërgoi AlphaEvolve,
1:23 një agjent Gemini që propozon kod, e vlerëson atë, ruan fituesit dhe i muton përsëri. Ai shumëzoi matrica komplekse katër me katër në 48 hapa, duke thyer një rekord që Strassen vendosi në vitin 1969, dhe rikuperon rreth zero pikë shtatë për qind të llogaritjes globale të Google, gjë që në shkallën e Google është një qendër të dhënash e gjetur nën divan. Gemini tani po ndihmonte në trajnimin e Gemini, dhe fraza u zhvendos qetësisht nga siguria blogje në njoftime për shtyp. Dream-RSI ngjitet një kontrollues mbi atë cikël.
1:52 Një politikë, një program i vërtetë Python, vendos cilat degë të pemës së kërkimit duhet zgjerohen, sa në paralel, dhe kur të heqin dorë. Gemini shkruan kodin kandidat, dhe një vlerësues i fiksuar e vlerëson atë. Çdo ekzekutim lë pas një pemë të asaj që u provua dhe çfarë u vlerësua. Ajo pemë bëhet një simulator riprodhimi: një Gemini i dytë, po aq i ngrirë rishkruan politikën, dhe politika e re testohet kundër rezultateve të regjistruara në vend të GPU-ve reale.
2:16 Punimi e quan këtë ëndërrim, dhe një ekzekutim real paguan për mijëra ëndërrimtarë pa kosto ekzekutimi. Fituesi kthehet online, grupi i botëve të regjistruara rritet, përsëritje. Dhe kërkesa në Shtojcën B.2 i thotë AI vetë-përmirësuese, me shkrim: redakto vetëm këtë skedar, dhe mos e zgjidh detyrën shkencore. Matura. Në detyrën e zgjidhësit Lasso, eksplorimi i fiksuar shpenzoi 550 thirrje Gemini për të arritur tre pikë gjashtë sekonda, Dream-RSI shpenzoi 317 për të arritur dy pikë nëntë, dhe të dy mundën scikit-learn.
2:46 Në KernelBench arriti të njëjtën shpejtësi bërthame me rreth dy pikë katër herë më pak gjenerata. Dhe në paketimin e rretheve shënoi dy pikë gjashtë tre pesë nëntë tetë tre, që është saktësisht, deri në gjashtë shifra dhjetore, ajo që AlphaEvolve versioni dy shënoi vitin e kaluar. Pra, X lexoi titullin: Google sapo theu vetë-përmirësimin rekursiv. Hacker News lexoi PDF-në: ta quash këtë RSI duket mashtruese. Dhe të njëjtën javë, CEO i një konkurrenti tha se cikli kishte funksionuar që nga vera dhe të gjithë duhet të ngadalësohen.
3:13 Tre fjali, të njëjtat dy fjalë, tre makina të ndryshme. Pra, të hënën, si të lexojmë punimin tjetër RSI. Një: pyesni çfarë objekti ndryshon, peshat, kodi, apo cilësimet e kërkimit; Dream-RSI ndryshon të tretën. Dy: pyesni kush është i ngrirë; këtu është koduesi, gjykatësi dhe rishkruesi, të tre. Tre: pyesni cila është njësia e numrit kryesor. Llogaritja e kursyer është optimizim; një standard që modeli nuk mund ta arrinte më parë është ngritja, dhe askush nuk e ka publikuar atë ende.
3:40 Vendimi, në thellësi: NEEDS REVIEW. Cikli është real, kursimet janë matur, dhe dy fjalët në kopertinë përshkruajnë një makinë që nuk është në punim. Nëse preferoni ta lexoni këtë sesa të më dëgjoni duke e thënë, diff-i arrin në kutinë tuaj hyrëse çdo mëngjes, falas në the daily diff dot dev, lidhja më poshtë. Më tregoni çfarë të hap tjetër në komente. Dhe ky është diff-i për sot. Unë jam Niko nga Axrisi.
4:00 Bashkohuni me përgjegjësi.
Burimet
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



