+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Hobeto egitera joateko norbere burua hobetzea, azpian

Google DeepMind-ek "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" argitaratu zuen — eta bertako kode-eredua ez da inoiz aldatzen.

Google DeepMind-ek "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" argitaratu zuen — eta bertako kode-eredua ez da inoiz aldatzen. Azpian: zer esanahi izan zuen esaldiak 60 urtez, zer benetan errepikatzen den Dream-RSI-n (bilaketa-zuhaitz grabatuen gainean "amesten" duen Python esplorazio-politika bat), eta zergatik 550 agente-deia beharrean 317 deskontu bat den, ez aireratze bat. Epaitza: BERRIKUSI BEHARRA.

Irakurri idatzizko edizioa (ingelesez) ↗

Bideo honek zer jorratzen duen

  • 1965 → 2008: I. J. Good-en "adimen-leherketa", Yudkowskyren hazien AI — bere pisuak berriro idazten dituen makina bat
  • 2025: AlphaEvolve — 48-biderkatzaile 4x4 matrizeen biderketa, Google-ren konputazioaren %0.7 berreskuratua, Gemini nukleoak %23 azkarrago
  • 2026: Dream-RSI — politika hobetzen da, kodetzailea, epailea eta berridazlea guztiak izoztuta daude; gonbidapenak "Ez ebatzi zientzia-zeregina" dio
  • X: "Googlek hobeto egitera joateko norbere burua hobetzea lortu berri du" (819 atsegin) vs HN: "hau RSI deitzea engainagarria dirudi"
  • Erabilitako zenbakiak: §4.1 Lasso 550 → 317 agente-dei, 3587 → 2931 ms; 1. taula zirkulu-pilaketa 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× belaunaldi gutxiago, 2.09× arte azkarrago; B.2 eranskina gonbidapena (guztiak goiko PDFtik)

Itzulitako transkripzioa

Jatorrizko ingelesezko narraziotik itzulia. Eskuragarri dauden audioa eta azpitituluak YouTube-k kontrolatzen ditu.

0:00 Hobeto egitera joateko norbere burua hobetzea AI batek bere burua adimentsuago bihurtzen duen ideia da, gero adimentsuago den bere burua erabiltzen du berriro egiteko, eta aste honetan Googlek paper bat argitaratu du tituluan bi hitz horiekin, non ereduaren pisuak ez diren inoiz mugitzen. Hiru zenbaki. Anthropic-eko zuzendari nagusiak dio begizta hori udaz geroztik martxan dagoela, eta hori da industria osoa moteldu nahi izateko bere arrazoia. Googlek lortu berri duela iragartzen zuen txioak zortziehun atsegin jaso zituen egun batean.

0:24 Eta paperaren beraren titularreko emaitza 317 eredu-dei da 550 beharrean, eta hori deskontu bat da, ez aireratze bat. Hiru minututan: nondik datorren esaldia, zer benetan errepikatzen den Dream-RSI-ren barruan, eta nola irakurri RSI azalean duen hurrengo papera. Hau The Daily Diff da, azpian. 1965. I. J. Good-ek, Turingekin lan egin zuen Bletchley Parkeko estatistikari batek, makina ultraadimentsu batek are makina hobeak diseina ditzakeela idatzi zuen,

0:52 adimen-leherketa deitu zion eta gizakiak inoiz egin beharko duen azken asmakizuna, baldin eta makina nahiko otzana bada kontrolatzeko modua esateko, eta hori da komaren ostean irakurtzeari uzten dioten 'baldin eta' jendea. Berrogei urtez esaldiak zehazki hori esan nahi zuen: bere burua editatzen duen sistema bat iturria edo pisuak eta adimentsuago ateratzen dena igaroaldi bakoitzean. Eliezer Yudkowskyren 2008ko saiakerak AI segurtasunaren hitz eusten duena bihurtu zuen, eta inork ez zuen makinarik hori probatzeko, eta hori da baldintza ideala definizio baterako. Gero, 2025eko maiatzean DeepMind-ek AlphaEvolve atera zuen,

1:23 kodea proposatzen duen Gemini agente bat, puntuatzen duena, irabazleak gordetzen dituena eta berriro mutatuz horiek. Lau bider lau matrize konplexu biderkatu zituen 48 urratsetan, Strassenek 1969an ezarritako errekor bat gaindituz, eta Google-ren munduko konputazioaren zero puntu zazpi ehuneko berreskuratzen du, eta Google-ren eskalan hori sofa azpian aurkitutako datu-zentro bat da. sofa azpian aurkitutako datu-zentro bat da. Gemini Gemini entrenatzen laguntzen ari zen orain, eta esaldia isil-isilik mugitu zen segurtasunetik blogak prentsa-oharretara. Dream-RSI-k kontrolagailu bat jartzen du begizta horren gainean.

1:52 Politika batek, benetako Python programa batek, erabakitzen du bilaketa-zuhaitzaren zein adar zabaltzen diren, zenbat paraleloan, eta noiz amore eman. Gemini-k kode hautagaia idazten du, eta ebaluatzaile finko batek puntuatzen du. Exekuzio bakoitzak saiatu zenaren eta puntuazioaren zuhaitz bat uzten du atzean. Zuhaitz hori erreprodukzio-simulatzaile bihurtzen da: bigarren Gemini batek, izoztuta dagoenak ere, berridazten du politika, eta politika berria grabatutako emaitzen aurka probatzen da GPU errealetan beharrean.

2:16 Paperak horri amets egitea deitzen dio, eta exekuzio erreal bakar batek milaka amestutako horietakoak ordaintzen ditu zero exekuzio-kostutan. Irabazlea berriro konektatzen da, grabatutako munduen multzoa handitzen da, errepikatu. Eta B.2 Eranskineko gonbidapenak AI hobeto egitera joateko norbere burua hobetzeko AIari esaten dio, idatziz: editatu fitxategi hau bakarrik, eta ez ebatzi zientzia-zeregina. Neurtua. Lasso ebazlearen zereginean, esplorazio finkoak 550 Gemini dei erabili zituen hiru puntu sei segundora iristeko, Dream-RSI-k 317 erabili zituen bi puntu bederatzira iristeko, eta biek scikit-learn gainditu zuten.

2:46 KernelBench-en kernel-abiadura bera lortu zuen bi puntu lau aldiz gutxiago belaunaldi gutxiagorekin. Eta zirkulu-pilaketan bi puntu sei hiru bost bederatzi zortzi hiru puntuazioa lortu zuen, hau da, zehazki, sei dezimalekin, AlphaEvolve bigarren bertsioak iaz lortu zuena. Beraz, X-k titulua irakurri zuen: Googlek hobeto egitera joateko norbere burua hobetzea lortu berri du. Hacker News-ek PDFa irakurri zuen: hau RSI deitzea engainagarria dirudi. Eta aste berean lehiakide baten zuzendari nagusiak esan zuen begizta udaz geroztik martxan zegoela eta denek moteldu beharko luketela.

3:13 Hiru esaldi, bi hitz berdinak, hiru makina ezberdin. Beraz, astelehenean, nola irakurri hurrengo RSI papera. Bat: galdetu zein objektu aldatzen den, pisuak, kodea edo bilaketa-ezarpenak; Dream-RSI-k hirugarrena aldatzen du. Bi: galdetu nor dagoen izoztuta; hemen kodetzailea, epailea eta berridazlea dira, hirurak. Hiru: galdetu titularreko zenbakiaren unitatea zer den. Aurrezki konputazionala optimizazioa da; ereduak lehen ezin zuen benchmark bat aireratzea da, eta oraindik inork ez du hori argitaratu.

3:40 Epaitza, azpian: BERRIKUSI BEHARRA. Begizta erreala da, aurrezkiak neurtuta daude, eta azalean dauden bi hitzek paperean ez dagoen makina bat deskribatzen dute. Hau irakurri nahiago baduzu niri esaten entzutea baino, diffa zure sarrera-ontzian lurreratzen da goizero, doan daily diff dot dev helbidean, esteka behean. Esan iezadazu zer ireki hurrengo iruzkinetan. Eta hori da gaurko diffa. Niko naiz Axrisitik.

4:00 Batu arduraz.

Iturriak

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Lotutako bideoak