+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Рекурсивно самоусъвършенстване, под капака

Google DeepMind публикува „Dream-RSI: Рекурсивно самоусъвършенстване чрез развиващи се светове“ — и моделът за кодиране в него никога не се променя.

Google DeepMind публикува „Dream-RSI: Рекурсивно самоусъвършенстване чрез развиващи се светове“ — и моделът за кодиране в него никога не се променя. Под капака: какво означава фразата в продължение на 60 години, какво всъщност се повтаря в Dream-RSI (политика за изследване на Python, която „сънува“ върху записани дървета за търсене) и защо 317 извиквания на агенти вместо 550 е отстъпка, а не излитане. Присъда: НЕОБХОДИМ Е ПРЕГЛЕД.

Прочетете писменото издание (английски) ↗

Какво обхваща този видеоклип

  • 1965 → 2008: „интелигентна експлозия“ на И. Дж. Гуд, изкуствен интелект на Юдковски — машина, която пренаписва собствените си тежести
  • 2025: AlphaEvolve — 48-умножение 4×4 матрично умножение, 0.7% от изчислителната мощност на Google е възстановена, ядрата на Gemini са 23% по-бързи
  • 2026: Dream-RSI — политиката се подобрява, кодерът, съдията и пренаписвачът са замразени; подканата гласи „Не решавайте научната задача“
  • X: „Google току-що разби рекурсивното самоусъвършенстване“ (819 харесвания) срещу HN: „наричането на това RSI изглежда подвеждащо“
  • Използвани числа: §4.1 Lasso 550 → 317 извиквания на агенти, 3587 → 2931 ms; Таблица 1 кръгово опаковане 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× по-малко поколения, до 2.09× по-бързо; Приложение Б.2 подкана (всички от PDF-а по-горе)

Преведен препис

Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.

0:00 Рекурсивното самоусъвършенстване е идеята, че изкуственият интелект става по-умен, след което използва по-умното си аз, за да го направи отново, и тази седмица Google публикува доклад с тези две думи в заглавието, в който тежестите на модела никога не се движат. Три числа. Главният изпълнителен директор на Anthropic казва, че този цикъл работи от лятото, което е неговата причина да забави цялата индустрия. Туитът, обявяващ, че Google току-що го е разбил, събра осемстотин харесвания за един ден.

0:24 И основният резултат от доклада е 317 извиквания на модела вместо 550, което е отстъпка, а не излитане. За три минути: откъде идва фразата, какво всъщност се повтаря вътре в Dream-RSI и как да прочетете следващия доклад с RSI на корицата. Това е The Daily Diff, под капака. 1965 г. И. Дж. Гуд, статистик от Блечли Парк, който е работил до Тюринг, пише, че една ултраинтелигентна машина може да проектира още по-добри машини,

0:52 нарича го интелигентна експлозия и последното изобретение, което човек някога ще направи, при условие че машината е достатъчно покорна, за да ни каже как да я контролираме, което е това „при условие, че“ хората спират да четат след запетаята. В продължение на четиридесет години фразата означаваше точно това: система, която редактира собствения си изходен код или тежести и става по-умна при всеки пропуск. Есето на Елиезер Юдковски от 2008 г. го направи опорна дума за безопасността на ИИ, и никой не разполагаше с машина, върху която да го тества, което е идеалното условие за дефиниция. След това през май 2025 г. DeepMind пусна AlphaEvolve,

1:23 агент на Gemini, който предлага код, получава оценка, запазва победителите и ги мутира отново. Той умножава четири на четири комплексни матрици в 48 стъпки, побеждавайки рекорд, поставен от Щрасен през 1969 г., и възстановява около нула цяло и седем процента от световната изчислителна мощност на Google, което в мащаба на Google е център за данни, намерен под дивана. Gemini вече помагаше за обучението на Gemini, а фразата тихо се премести от блогове за безопасност в прессъобщения. Dream-RSI прикрепя контролер върху този цикъл.

1:52 Политика, действителна програма на Python, решава кои разклонения на дървото за търсене да разшири, колко паралелно и кога да се откаже. Gemini пише кандидатския код, а фиксиран оценител го оценява. Всяко изпълнение оставя след себе си дърво от това, което е било опитано и какво е било оценено. Това дърво става симулатор за повторение: втори, също така замразен Gemini пренаписва политиката, а новата политика се тества спрямо записаните резултати вместо върху реални GPU-та.

2:16 Докладът нарича това сънуване, и едно реално изпълнение плаща за хиляди сънувани такива с нулева цена на изпълнение. Победителят се връща онлайн, пулът от записани светове расте, повтаря се. И подканата в Приложение Б.2 казва на самоусъвършенстващия се ИИ, писмено: редактирайте само този файл и не решавайте научната задача. Измерено. При задачата за решаване на Lasso, фиксираното изследване е използвало 550 извиквания на Gemini, за да достигне три цяло и шест секунди, Dream-RSI е използвал 317, за да достигне две цяло и девет, и двете победиха scikit-learn.

2:46 При KernelBench достигна същата скорост на ядрото с около два цяло и четири пъти по-малко поколения. А при опаковане на кръгове постигна резултат две цяло шест три пет девет осем три, което е точно, до шест десетични знака, каквото AlphaEvolve версия две постигна миналата година. Така че X прочете заглавието: Google току-що разби рекурсивното самоусъвършенстване. Hacker News прочете PDF-а: наричането на това RSI изглежда подвеждащо. И същата седмица изпълнителен директор на конкурентна фирма каза, че цикълът работи от лятото и всички трябва да забавят темпото.

3:13 Три изречения, същите две думи, три различни машини. И така, понеделник, как да прочетем следващия доклад за RSI. Едно: попитайте кой обект се променя, тежестите, кодът или настройките за търсене; Dream-RSI променя третото. Две: попитайте кой е замразен; тук това са кодерът, съдията и пренаписвачът, и тримата. Три: попитайте какво представлява водещото число като единица. Спестената изчислителна мощност е оптимизация; бенчмарк, който моделът не е могъл да достигне преди, е излитането, и никой все още не е публикувал такъв.

3:40 Присъда, под капака: необходим е преглед. Цикълът е реален, спестяванията са измерени, а двете думи на корицата описват машина, която не е в доклада. Ако предпочитате да прочетете това, отколкото да ме чуете да го казвам, „дифът“ пристига във входящата ви кутия всяка сутрин, безплатно на the daily diff dot dev, линк по-долу. Кажете ми какво да отворя следващото в коментарите. И това е „дифът“ за днес. Аз съм Нико от Axrisi.

4:00 Сливайте отговорно.

Източници

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Свързани видеоклипове