Рекурсивное самосовершенствование: под капотом
Google DeepMind опубликовал статью «Dream-RSI: Рекурсивное самосовершенствование через эволюционирующие миры» — и модель кодирования внутри неё никогда не меняется.
Google DeepMind опубликовал статью «Dream-RSI: Рекурсивное самосовершенствование через эволюционирующие миры» — и модель кодирования внутри неё никогда не меняется. Под капотом: что эта фраза означала 60 лет, что на самом деле циклично в Dream-RSI (политика исследования на Python, которая «мечтает» над записанными деревьями поиска), и почему 317 вызовов агента вместо 550 — это скидка, а не взлёт. Вердикт: NEEDS REVIEW.
Читать письменное издание (на английском) ↗
Что освещается в этом видео
- 1965 → 2008: «интеллектуальный взрыв» И. Дж. Гуда, посевной ИИ Юдковского — машина, которая переписывает свои собственные веса
- 2025: AlphaEvolve — 48-кратное умножение матриц 4×4, восстановлено 0,7% вычислительных мощностей Google, ядра Gemini на 23% быстрее
- 2026: Dream-RSI — политика улучшается, кодер, судья и переписчик заморожены; запрос гласит «Не решайте научную задачу»
- X: «Google только что взломал рекурсивное самосовершенствование» (819 лайков) против HN: «называть это RSI кажется вводящим в заблуждение»
- Использованные числа: §4.1 Lasso 550 → 317 вызовов агента, 3587 → 2931 мс; Таблица 1 упаковка кругов 2.635983 = AlphaEvolveV2; §4.3 KernelBench в 2.43× / 1.79× меньше поколений, до 2.09× быстрее; Приложение B.2 запрос (все из PDF выше)
Переведенная стенограмма
Переведено с оригинального английского повествования. Доступные аудио и субтитры контролируются YouTube.
0:00 Рекурсивное самосовершенствование — это идея о том, что ИИ делает себя умнее, затем использует более умное «я», чтобы сделать это снова, и на этой неделе Google опубликовал статью с этими двумя словами в названии, в которой веса модели никогда не движутся. Три числа. Генеральный директор Anthropic говорит, что этот цикл работает с лета, что является его причиной замедлить всю индустрию. Твит, объявляющий, что Google только что это взломал, собрал восемьсот лайков за день.
0:24 И собственный заголовок статьи — 317 вызовов модели вместо 550, что является скидкой, а не взлётом. За три минуты: откуда взялась эта фраза, что на самом деле циклично внутри Dream-RSI, и как читать следующую статью с RSI на обложке. Это The Daily Diff, под капотом. 1965 год. И. Дж. Гуд, статистик из Блетчли-Парка, работавший рядом с Тьюрингом, пишет, что сверхинтеллектуальная машина может проектировать ещё более совершенные машины,
0:52 называет это интеллектуальным взрывом и последним изобретением, которое когда-либо понадобится человеку, при условии, что машина достаточно покорна, чтобы сказать нам, как её контролировать, что является тем «при условии, что», после которого люди перестают читать. В течение сорока лет эта фраза означала именно это: система, которая редактирует свой собственный исходный код или веса и становится умнее с каждым проходом. Эссе Элиэзера Юдковского 2008 года сделало это ключевым словом безопасности ИИ, и ни у кого не было машины для тестирования, что является идеальным условием для определения. Затем в мае 2025 года DeepMind выпустил AlphaEvolve,
1:23 агент Gemini, который предлагает код, получает его оценку, сохраняет победителей и мутирует их снова. Он умножал комплексные матрицы четыре на четыре за 48 шагов, побив рекорд, установленный Штрассеном в 1969 году, и он восстанавливает около нуля целых семи десятых процента мировых вычислительных мощностей Google, что в масштабах Google — это центр обработки данных, найденный под диваном. Gemini теперь помогал обучать Gemini, и фраза тихо перешла из блогов о безопасности в пресс-релизы. Dream-RSI прикрепляет контроллер к этому циклу.
1:52 Политика, реальная программа на Python, решает, какие ветви дерева поиска расширять, сколько параллельно и когда сдаваться. Gemini пишет кандидатный код, и фиксированный оценщик его оценивает. Каждый запуск оставляет за собой дерево того, что было опробовано и как оно было оценено. Это дерево становится симулятором воспроизведения: второй, столь же замороженный Gemini переписывает политику, и новая политика тестируется по записанным результатам вместо на реальных GPU.
2:16 В статье это называется «сном», и один реальный запуск окупает тысячи «сновидческих» с нулевыми затратами на выполнение. Победитель возвращается в онлайн, пул записанных миров растёт, повторяем. И запрос в Приложении B.2 говорит самосовершенствующемуся ИИ, письменно: редактируйте только этот файл и не решайте научную задачу. Измерено. В задаче решателя Lasso фиксированное исследование потратило 550 вызовов Gemini, чтобы достичь 3,6 секунды, Dream-RSI потратил 317, чтобы достичь 2,9, и оба превзошли scikit-learn.
2:46 В KernelBench он достиг той же скорости ядра при примерно в 2,4 раза меньшем количестве поколений. И в упаковке кругов он набрал 2.635983, что точно, до шести знаков после запятой, набрала AlphaEvolve версии два в прошлом году. Итак, X прочитал заголовок: Google только что взломал рекурсивное самосовершенствование. Hacker News прочитал PDF: называть это RSI кажется вводящим в заблуждение. И на той же неделе генеральный директор конкурента сказал, что цикл работает с лета и всем следует замедлиться.
3:13 Три предложения, те же два слова, три разные машины. Итак, в понедельник, как читать следующую статью о RSI. Один: спросите, какой объект меняется, веса, код или настройки поиска; Dream-RSI меняет третий. Два: спросите, кто заморожен; здесь это кодер, судья и переписчик, все трое. Три: спросите, что представляет собой заголовочное число. Сэкономленные вычисления — это оптимизация; контрольный показатель, которого модель не могла достичь раньше, — это взлёт, и никто пока не опубликовал такового.
3:40 Вердикт, под капотом: NEEDS REVIEW. Цикл реален, сбережения измерены, и два слова на обложке описывают машину, которой нет в статье. Если вы предпочитаете прочитать это, чем услышать от меня, дайджест приходит в ваш почтовый ящик каждое утро, бесплатно на the daily diff dot dev, ссылка ниже. Скажите мне, что открыть следующим в комментариях. И это на сегодня всё. Я Нико из Axrisi.
4:00 Сливайте ответственно.
Источники
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



