Autoaperfeiçoamento recursivo, nos bastidores
A Google DeepMind publicou "Dream-RSI: Autoaperfeiçoamento Recursivo Através de Mundos em Evolução" — e o modelo de codificação em seu interior nunca muda.
A Google DeepMind publicou "Dream-RSI: Autoaperfeiçoamento Recursivo Através de Mundos em Evolução" — e o modelo de codificação em seu interior nunca muda. Nos bastidores: o que a frase significou por 60 anos, o que realmente entra em loop no Dream-RSI (uma política de exploração em Python que "sonha" sobre árvores de busca gravadas) e por que 317 chamadas de agente em vez de 550 é um desconto, não uma descolagem. Veredito: NEEDS REVIEW.
Ler a edição escrita (Inglês) ↗
O que este vídeo aborda
- 1965 → 2008: "explosão de inteligência" de I. J. Good, IA semente de Yudkowsky — uma máquina que reescreve os seus próprios pesos
- 2025: AlphaEvolve — multiplicação de matrizes 4×4 com 48 multiplicações, 0,7% do poder computacional da Google recuperado, núcleos Gemini 23% mais rápidos
- 2026: Dream-RSI — a política melhora, o codificador, o juiz e o reescritor estão todos congelados; o prompt diz "Não resolva a tarefa científica"
- X: "A Google acabou de desvendar o autoaperfeiçoamento recursivo" (819 gostos) vs HN: "chamar isto de RSI parece enganador"
- Números usados: §4.1 Lasso 550 → 317 chamadas de agente, 3587 → 2931 ms; Tabela 1 empacotamento circular 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× menos gerações, até 2.09× mais rápido; Apêndice B.2 prompt (tudo do PDF acima)
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
0:00 Autoaperfeiçoamento recursivo é a ideia de que uma IA se torna mais inteligente, depois usa o seu eu mais inteligente para o fazer novamente, e esta semana a Google publicou um artigo com essas duas palavras no título, no qual os pesos do modelo nunca se movem. Três números. O CEO da Anthropic diz que este ciclo tem estado a funcionar desde o verão, o que é a sua razão para abrandar toda a indústria. O tweet que anunciava que a Google o tinha desvendado recolheu oitocentos gostos num dia.
0:24 E o principal resultado do próprio artigo é de 317 chamadas de modelo em vez de 550, o que é um desconto, não uma descolagem. Em três minutos: de onde veio a frase, o que realmente entra em loop dentro do Dream-RSI, e como ler o próximo artigo com RSI na capa. Este é o The Daily Diff, nos bastidores. 1965. I. J. Good, um estatístico de Bletchley Park que trabalhou ao lado de Turing, escreve que uma máquina ultrainteligente poderia projetar máquinas ainda melhores,
0:52 chama-lhe uma explosão de inteligência e a última invenção que o homem alguma vez precisará fazer, desde que a máquina seja dócil o suficiente para nos dizer como a controlar, o que é o "desde que" que as pessoas param de ler depois da vírgula. Durante quarenta anos, a frase significou exatamente isso: um sistema que edita o seu próprio código-fonte ou pesos e se torna mais inteligente a cada passagem. O ensaio de 2008 de Eliezer Yudkowsky tornou-a a palavra de suporte da segurança da IA, e ninguém tinha uma máquina para testá-la, o que é a condição ideal para uma definição. Depois, em maio de 2025, a DeepMind lançou o AlphaEvolve,
1:23 um agente Gemini que propõe código, o vê pontuado, mantém os vencedores e os muta novamente. Multiplicou matrizes complexas quatro por quatro em 48 passos, batendo um recorde que Strassen estabeleceu em 1969, e recupera cerca de zero vírgula sete por cento do poder computacional mundial da Google, o que, à escala da Google, é um centro de dados encontrado debaixo do sofá. O Gemini estava agora a ajudar a treinar o Gemini, e a frase moveu-se silenciosamente de blogs de segurança para comunicados de imprensa. O Dream-RSI adiciona um controlador a este ciclo.
1:52 Uma política, um programa Python real, decide quais ramos da árvore de pesquisa expandir, quantos em paralelo e quando desistir. O Gemini escreve o código candidato e um avaliador fixo pontua-o. Cada execução deixa para trás uma árvore do que foi tentado e da sua pontuação. Essa árvore torna-se um simulador de reprodução: um segundo Gemini, igualmente congelado, reescreve a política, e a nova política é testada contra os resultados gravados em vez de em GPUs reais.
2:16 O artigo chama a isto sonhar, e uma execução real paga por milhares de execuções "sonhadas" a custo de execução zero. O vencedor volta online, o conjunto de mundos gravados cresce, repetir. E o prompt no Apêndice B.2 diz à IA autoaperfeiçoadora, por escrito: edite apenas este ficheiro e não resolva a tarefa científica. Medido. Na tarefa do resolvedor Lasso, a exploração fixa gastou 550 chamadas Gemini para atingir três vírgula seis segundos, o Dream-RSI gastou 317 para atingir dois vírgula nove, e ambos bateram o scikit-learn.
2:46 No KernelBench, atingiu a mesma velocidade de kernel com cerca de duas vírgula quatro vezes menos gerações. E no empacotamento circular, pontuou dois vírgula seis três cinco nove oito três, que é precisamente, até seis casas decimais, o que o AlphaEvolve versão dois pontuou no ano passado. Então, o X leu o título: A Google acabou de desvendar o autoaperfeiçoamento recursivo. O Hacker News leu o PDF: chamar isto de RSI parece enganador. E na mesma semana, o CEO de um concorrente disse que o ciclo estava a funcionar desde o verão e que todos deveriam abrandar.
3:13 Três frases, as mesmas duas palavras, três máquinas diferentes. Então, segunda-feira, como ler o próximo artigo sobre RSI. Um: pergunte que objeto muda, os pesos, o código ou as configurações de pesquisa; O Dream-RSI muda o terceiro. Dois: pergunte quem está congelado; aqui são o codificador, o juiz e o reescritor, todos os três. Três: pergunte qual é a unidade do número principal. Computação poupada é otimização; um benchmark que o modelo não conseguia atingir antes é a descolagem, e ninguém publicou isso ainda.
3:40 Veredito, nos bastidores: NEEDS REVIEW. O ciclo é real, as poupanças são medidas, e as duas palavras na capa descrevem uma máquina que não está no artigo. Se preferir ler isto a ouvir-me dizer, o diff chega à sua caixa de entrada todas as manhãs, gratuitamente em the daily diff dot dev, link abaixo. Diga-me o que abrir a seguir nos comentários. E este é o diff para hoje. Sou o Niko da Axrisi.
4:00 Faça a fusão responsavelmente.
Fontes
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



