+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Рекурсивне самовдосконалення, під капотом

Google DeepMind опублікував «Dream-RSI: Рекурсивне самовдосконалення через світи, що еволюціонують» — і модель кодування в ньому ніколи не змінюється.

Google DeepMind опублікував «Dream-RSI: Рекурсивне самовдосконалення через світи, що еволюціонують» — і модель кодування в ньому ніколи не змінюється. Під капотом: що означала ця фраза протягом 60 років, що насправді циклічно відбувається в Dream-RSI (політика дослідження на Python, яка «мріє» над записаними деревами пошуку), і чому 317 викликів агента замість 550 є знижкою, а не зльотом. Вердикт: NEEDS REVIEW.

Читати письмову версію (англійською) ↗

Що охоплює це відео

  • 1965 → 2008: «вибух інтелекту» І. Дж. Гуда, стартовий ШІ Юдковського — машина, яка переписує власні ваги
  • 2025: AlphaEvolve — 48-кратне множення матриці 4×4, відновлено 0.7% обчислювальної потужності Google, ядра Gemini на 23% швидші
  • 2026: Dream-RSI — політика вдосконалюється, кодер, суддя та переписувач заморожені; підказка говорить «Не вирішуйте наукове завдання»
  • X: «Google щойно зламав рекурсивне самовдосконалення» (819 вподобань) проти HN: «називати це RSI здається оманливим»
  • Використані числа: §4.1 Lasso 550 → 317 викликів агента, 3587 → 2931 мс; Таблиця 1 пакування кіл 2.635983 = AlphaEvolveV2; §4.3 KernelBench у 2.43× / 1.79× менше поколінь, до 2.09× швидше; Додаток B.2 підказка (все з PDF вище)

Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

0:00 Рекурсивне самовдосконалення — це ідея, що ШІ робить себе розумнішим, а потім використовує розумнішу версію для повторення цього, і цього тижня Google опублікував документ з цими двома словами в назві, в якому ваги моделі ніколи не змінюються. Три числа. Генеральний директор Anthropic каже, що цей цикл працює з літа, що є його причиною сповільнити всю галузь. Твіт, що оголошував, що Google щойно розгадав це, зібрав вісімсот вподобань за день.

0:24 А головний результат самого документа — 317 викликів моделі замість 550, що є знижкою, а не зльотом. За три хвилини: звідки походить фраза, що насправді циклічно відбувається всередині Dream-RSI, і як читати наступний документ з RSI на обкладинці. Це The Daily Diff, під капотом. 1965 рік. І. Дж. Гуд, статистик Блетчлі-Парку, який працював поруч з Тюрінгом, пише, що ультраінтелектуальна машина могла б створювати ще кращі машини,

0:52 називає це вибухом інтелекту та останнім винаходом, який коли-небудь знадобиться людині, за умови, що машина досить покірна, щоб розповісти нам, як її контролювати, що є тим «за умови», після якого люди перестають читати після коми. Протягом сорока років ця фраза означала саме це: система, яка редагує власний вихідний код або ваги і стає розумнішою з кожним проходом. Есе Еліезера Юдковського 2008 року зробило це опорним словом безпеки ШІ, і ніхто не мав машини для тестування цього, що є ідеальними умовами для визначення. Потім у травні 2025 року DeepMind випустив AlphaEvolve,

1:23 агент Gemini, який пропонує код, отримує його оцінку, зберігає переможців і мутує їх знову. Він множив складні матриці чотири на чотири за 48 кроків, побивши рекорд, встановлений Штрассеном у 1969 році, і відновлює близько нуля цілих сім десятих відсотка обчислювальної потужності Google у всьому світі, що в масштабах Google є центром обробки даних, знайденим під диваном. Gemini тепер допомагав навчати Gemini, і фраза тихо перейшла з блогів про безпеку до прес-релізів. Dream-RSI встановлює контролер поверх цього циклу.

1:52 Політика, фактична програма на Python, вирішує, які гілки дерева пошуку розширювати, скільки паралельно, і коли здаватися. Gemini пише код-кандидат, а фіксований оцінювач оцінює його. Кожен запуск залишає дерево того, що було випробувано і що було оцінено. Це дерево стає симулятором повторів: другий, так само заморожений Gemini переписує політику, і нова політика тестується на записаних результатах замість на реальних графічних процесорах.

2:16 У документі це називається сновидінням, і один реальний запуск оплачує тисячі омріяних без витрат на виконання. Переможець повертається в мережу, пул записаних світів зростає, повторюється. А підказка в Додатку B.2 говорить ШІ, що самовдосконалюється, письмово: редагуйте лише цей файл і не вирішуйте наукове завдання. Виміряно. На завданні розв'язувача Lasso, фіксоване дослідження витратило 550 викликів Gemini, щоб досягти трьох цілих шести десятих секунди, Dream-RSI витратив 317, щоб досягти двох цілих дев'яти десятих, і обидва перевершили scikit-learn.

2:46 На KernelBench він досяг тієї ж швидкості ядра з приблизно у два цілих чотири десяті рази менше поколінь. А на пакуванні кіл він набрав два цілих шістсот тридцять п'ять тисяч дев'ятсот вісімдесят три, що точно, до шести знаків після коми, те, що AlphaEvolve версії два набрав минулого року. Отже, X прочитав заголовок: Google щойно зламав рекурсивне самовдосконалення. Hacker News прочитав PDF: називати це RSI здається оманливим. І того ж тижня генеральний директор конкурента сказав, що цикл працює з літа і всім слід сповільнитися.

3:13 Три речення, ті самі два слова, три різні машини. Отже, у понеділок, як читати наступний документ про RSI. Один: запитайте, який об'єкт змінюється, ваги, код чи налаштування пошуку; Dream-RSI змінює третій. Два: запитайте, хто заморожений; тут це кодер, суддя та переписувач, всі троє. Три: запитайте, що є одиницею головного числа. Збережені обчислення — це оптимізація; бенчмарк, якого модель не могла досягти раніше, — це зліт, і ніхто ще не опублікував цього.

3:40 Вердикт, під капотом: NEEDS REVIEW. Цикл реальний, економія виміряна, а два слова на обкладинці описують машину, якої немає в документі. Якщо ви волієте читати це, а не чути від мене, The Daily Diff приходить на вашу електронну пошту щоранку, безкоштовно на thedailydiff.dev, посилання нижче. Скажіть мені, що відкрити наступним у коментарях. І це The Daily Diff на сьогодні. Я Ніко з Axrisi.

4:00 Відповідально об'єднуйте.

Джерела

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Пов'язані відео