# Auto-mellora recursiva, por debaixo do capó

Published: 2026-09-18

Google DeepMind publicou "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — e o modelo de codificación dentro del nunca cambia. Por debaixo do capó: o que significou a frase durante 60 anos, o que realmente fai un bucle en Dream-RSI (unha política de exploración Python que "soña" sobre árbores de busca rexistradas) e por que 317 chamadas de axente en lugar de 550 é un desconto, non un despegue. Veredito: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/gl/video/2026-09-18-self-improving-ai/

## Que abrangue este vídeo

- 1965 → 2008: a "explosión de intelixencia" de I. J. Good, a AI semente de Yudkowsky — unha máquina que reescribe os seus propios pesos
- 2025: AlphaEvolve — multiplicación de matriz 4×4 de 48 pasos, 0.7% do cómputo de Google recuperado, núcleos Gemini 23% máis rápidos
- 2026: Dream-RSI — a política mellora, o codificador, xuíz e reescritor están todos conxelados; o "prompt" di "Non resolvas a tarefa científica"
- X: "Google acaba de conseguir a auto-mellora recursiva" (819 Gústame) vs HN: "chamar a isto RSI parece enganoso"
- Números utilizados: §4.1 Lasso 550 → 317 chamadas de axente, 3587 → 2931 ms; Táboa 1 empaquetado de círculos 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× menos xeracións, ata 2.09× máis rápido; Apéndice B.2 prompt (todo do PDF anterior)

## Transcrición traducida

Traducido da narración orixinal en inglés. O audio e os subtítulos dispoñibles son controlados por YouTube.

0:00 A auto-mellora recursiva é a idea de que unha intelixencia artificial se fai máis intelixente, e despois usa esa versión máis intelixente para facelo de novo, e esta semana Google publicou un artigo con esas dúas palabras no título, no que os pesos do modelo nunca se moven. Tres números. O CEO de Anthropic di que este bucle estivo funcionando desde o verán, o cal é a súa razón para ralentizar toda a industria. O tuit que anunciaba que Google acababa de conseguilo recolleu oitocentos gústames nun día.

0:24 E o resultado principal do propio artigo son 317 chamadas de modelo en lugar de 550, o cal é un desconto, non un despegue. En tres minutos: de onde veu a frase, o que realmente fai un bucle dentro de Dream-RSI, e como ler o próximo artigo con RSI na portada. Isto é The Daily Diff, por debaixo do capó. 1965. I. J. Good, un estatístico de Bletchley Park que traballou xunto a Turing, escribe que unha máquina ultraintelixente podería deseñar máquinas aínda mellores,

0:52 chámalle unha explosión de intelixencia e a última invención que o home xamais necesitará facer, sempre que a máquina sexa o suficientemente dócil como para dicirnos como controlala, que é o "sempre que" que a xente deixa de ler despois da coma. Durante corenta anos a frase significou exactamente iso: un sistema que edita o seu propio código fonte ou pesos e sae máis intelixente en cada paso. O ensaio de Eliezer Yudkowsky de 2008 converteuno na palabra fundamental da seguridade da IA, e ninguén tiña unha máquina para probalo, que é a condición ideal para unha definición. Despois, en maio de 2025, DeepMind lanzou AlphaEvolve,

1:23 un axente Gemini que propón código, fai que sexa avaliado, garda os gañadores e os muta de novo. Multiplicou matrices complexas catro por catro en 48 pasos, superando un récord establecido por Strassen en 1969, e recupera aproximadamente cero coma sete por cento do cómputo mundial de Google, o que á escala de Google é un centro de datos atopado debaixo do sofá. Gemini estaba agora axudando a adestrar a Gemini, e a frase pasou discretamente dos blogs de seguridade ás notas de prensa. Dream-RSI engade un controlador enriba dese bucle.

1:52 Unha política, un programa Python real, decide que ramas da árbore de busca expandir, cantas en paralelo, e cando desistir. Gemini escribe o código candidato, e un avaliador fixo puntúao. Cada execución deixa atrás unha árbore do que se probou e a súa puntuación. Esa árbore convértese nun simulador de repetición: un segundo Gemini, igualmente conxelado, reescribe a política, e a nova política é probada contra os resultados rexistrados en lugar de en GPUs reais.

2:16 O artigo chama a isto soñar, e unha execución real paga miles de execucións soñadas a custo de execución cero. O gañador volve a estar en liña, o conxunto de mundos gravados crece, repetir. E o "prompt" no Apéndice B.2 dille á IA que se auto-mellora, por escrito: edita só este ficheiro, e non resolvas a tarefa científica. Medido. Na tarefa do resolvedor Lasso, a exploración fixa gastou 550 chamadas a Gemini para acadar tres coma seis segundos, Dream-RSI gastou 317 para acadar dous coma nove, e ambos superaron a scikit-learn.

2:46 En KernelBench acadou a mesma velocidade de núcleo con aproximadamente dúas coma catro veces menos xeracións. E no empaquetado de círculos acadou dous coma seis tres cinco nove oito tres, que é precisamente, ata seis decimais, o que a versión dous de AlphaEvolve acadou o ano pasado. Entón, X leu o título: Google acaba de conseguir a auto-mellora recursiva. Hacker News leu o PDF: chamar a isto RSI parece enganoso. E a mesma semana o CEO dun competidor dixo que o bucle estivo funcionando desde o verán e todos deberían ir máis despacio.

3:13 Tres frases, as mesmas dúas palabras, tres máquinas diferentes. Entón, luns, como ler o próximo artigo sobre RSI. Un: pregunta que obxecto cambia, os pesos, o código ou as configuracións de busca; Dream-RSI cambia o terceiro. Dous: pregunta quen está conxelado; aquí son o codificador, o xuíz e o reescritor, os tres. Tres: pregunta de que unidade é o número principal. O cómputo aforrado é optimización; un punto de referencia que o modelo non podía acadar antes é o despegue, e ninguén publicou iso aínda.

3:40 Veredito, por debaixo do capó: NEEDS REVIEW. O bucle é real, os aforros están medidos, e as dúas palabras na portada describen unha máquina que non está no artigo. Se prefires ler isto en lugar de escoitarme dicilo, The Daily Diff chega á túa caixa de entrada cada mañá, gratis en thedailydiff.dev, ligazón debaixo. Dime que abrir a continuación nos comentarios. E esa é a diferenza por hoxe. Son Niko de Axrisi.

4:00 SHIP IT con responsabilidade.

## Fontes

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
