Autoaperfeiçoamento recursivo, por dentro
Google DeepMind publicou "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — e o modelo de codificação dentro dele nunca muda.
Google DeepMind publicou "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — e o modelo de codificação dentro dele nunca muda. Por dentro: o que a frase significou por 60 anos, o que realmente faz um loop no Dream-RSI (uma política de exploração Python que "sonha" sobre árvores de busca gravadas), e por que 317 chamadas de agente em vez de 550 é um desconto, não uma decolagem. Veredito: NEEDS REVIEW.
Leia a edição escrita (Inglês) ↗
O que este vídeo aborda
- 1965 → 2008: a "explosão de inteligência" de I. J. Good, a IA semente de Yudkowsky — uma máquina que reescreve seus próprios pesos
- 2025: AlphaEvolve — multiplicação de matriz 4×4 com 48 multiplicações, 0,7% do poder de computação do Google recuperado, kernels Gemini 23% mais rápidos
- 2026: Dream-RSI — a política melhora, o codificador, juiz e reescritor estão todos congelados; o prompt diz "Não resolva a tarefa científica"
- X: "Google acabou de desvendar o autoaperfeiçoamento recursivo" (819 curtidas) vs HN: "chamar isso de RSI parece enganoso"
- Números usados: §4.1 Lasso 550 → 317 chamadas de agente, 3587 → 2931 ms; Tabela 1 empacotamento de círculo 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× menos gerações, até 2.09× mais rápido; Apêndice B.2 prompt (tudo do PDF acima)
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
0:00 O autoaperfeiçoamento recursivo é a ideia de que uma IA se torna mais inteligente, depois usa a si mesma mais inteligente para fazer isso de novo, e esta semana o Google publicou um artigo com essas duas palavras no título, no qual os pesos do modelo nunca se movem. Três números. O CEO da Anthropic diz que esse ciclo está funcionando desde o verão, o que é a sua razão para desacelerar toda a indústria. O tweet anunciando que o Google acabou de conseguir coletou oitocentas curtidas em um dia.
0:24 E o principal resultado do próprio artigo é 317 chamadas de modelo em vez de 550, o que é um desconto, não uma decolagem. Em três minutos: de onde veio a frase, o que realmente faz um loop dentro do Dream-RSI, e como ler o próximo artigo com RSI na capa. Este é o The Daily Diff, por dentro. 1965. I. J. Good, um estatístico de Bletchley Park que trabalhou ao lado de Turing, escreve que uma máquina ultrainteligente poderia projetar máquinas ainda melhores,
0:52 chama isso de explosão de inteligência e a última invenção que o homem precisaria fazer, desde que a máquina seja dócil o suficiente para nos dizer como controlá-la, que é o desde-que que as pessoas param de ler depois da vírgula. Por quarenta anos a frase significou exatamente isso: um sistema que edita sua própria fonte ou pesos e sai mais inteligente a cada passagem. O ensaio de 2008 de Eliezer Yudkowsky fez dela a palavra-chave da segurança da IA, e ninguém tinha uma máquina para testá-la, que é a condição ideal para uma definição. Então, em maio de 2025, a DeepMind lançou o AlphaEvolve,
1:23 um agente Gemini que propõe código, o tem avaliado, mantém os vencedores e os muta novamente. Ele multiplicou matrizes complexas quatro por quatro em 48 etapas, batendo um recorde que Strassen estabeleceu em 1969, e ele recupera cerca de zero vírgula sete por cento da computação mundial do Google, o que, na escala do Google, é um centro de dados encontrado debaixo do sofá. Gemini estava agora ajudando a treinar Gemini, e a frase saiu discretamente dos blogs de segurança para os comunicados de imprensa. O Dream-RSI adiciona um controlador em cima desse loop.
1:52 Uma política, um programa Python real, decide quais ramos da árvore de busca expandir, quantos em paralelo e quando desistir. Gemini escreve o código candidato, e um avaliador fixo o pontua. Cada execução deixa para trás uma árvore do que foi tentado e o que foi pontuado. Essa árvore se torna um simulador de replay: um segundo Gemini, igualmente congelado, reescreve a política, e a nova política é testada contra os resultados gravados em vez de em GPUs reais.
2:16 O artigo chama isso de sonhar, e uma execução real paga por milhares de execuções sonhadas com custo de execução zero. O vencedor volta online, o conjunto de mundos gravados cresce, repete. E o prompt no Apêndice B.2 diz à IA de autoaperfeiçoamento, por escrito: edite apenas este arquivo e não resolva a tarefa científica. Medido. Na tarefa do resolvedor Lasso, a exploração fixa gastou 550 chamadas Gemini para atingir três vírgula seis segundos, o Dream-RSI gastou 317 para atingir dois vírgula nove, e ambos superaram o scikit-learn.
2:46 No KernelBench ele atingiu a mesma velocidade de kernel com cerca de duas vírgula quatro vezes menos gerações. E no empacotamento de círculos ele obteve dois vírgula seis três cinco nove oito três, que é precisamente, com seis casas decimais, o que o AlphaEvolve versão dois obteve no ano passado. Então, X leu o título: Google acabou de desvendar o autoaperfeiçoamento recursivo. Hacker News leu o PDF: chamar isso de RSI parece enganoso. E na mesma semana o CEO de um concorrente disse que o ciclo estava funcionando desde o verão e que todos deveriam desacelerar.
3:13 Três frases, as mesmas duas palavras, três máquinas diferentes. Então, segunda-feira, como ler o próximo artigo sobre RSI. Um: pergunte qual objeto muda, os pesos, o código ou as configurações de busca; o Dream-RSI muda o terceiro. Dois: pergunte quem está congelado; aqui são o codificador, o juiz e o reescritor, todos os três. Três: pergunte qual é a unidade do número principal. Computação economizada é otimização; um benchmark que o modelo não conseguia atingir antes é a decolagem, e ninguém publicou isso ainda.
3:40 Veredito, por dentro: NEEDS REVIEW. O loop é real, as economias são medidas, e as duas palavras na capa descrevem uma máquina que não está no artigo. Se você preferir ler isso a me ouvir dizer, o diff chega na sua caixa de entrada todas as manhãs, gratuitamente em thedailydiff.dev, link abaixo. Diga-me o que abrir em seguida nos comentários. E esse é o diff de hoje. Sou Niko da Axrisi.
4:00 Mescle com responsabilidade.
Fontes
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



