+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Auto-mejora recursiva, bajo el capó

Google DeepMind publicó "Dream-RSI: Auto-mejora Recursiva a través de Mundos en Evolución" — y el modelo de codificación en su interior nunca cambia.

Google DeepMind publicó "Dream-RSI: Auto-mejora Recursiva a través de Mundos en Evolución" — y el modelo de codificación en su interior nunca cambia. Bajo el capó: lo que la frase significó durante 60 años, lo que realmente se repite en Dream-RSI (una política de exploración de Python que "sueña" sobre árboles de búsqueda registrados), y por qué 317 llamadas de agente en lugar de 550 es un descuento, no un despegue. Veredicto: NEEDS REVIEW.

Leer la edición escrita (inglés) ↗

Lo que cubre este video

  • 1965 → 2008: La "explosión de inteligencia" de I. J. Good, la IA semilla de Yudkowsky — una máquina que reescribe sus propios pesos
  • 2025: AlphaEvolve — multiplicación de matrices 4×4 de 48 multiplicaciones, 0.7% del cómputo de Google recuperado, núcleos Gemini 23% más rápidos
  • 2026: Dream-RSI — la política mejora, el codificador, el juez y el reescritor están todos congelados; el mensaje dice "No resuelva la tarea científica"
  • X: "Google acaba de descifrar la auto-mejora recursiva" (819 "me gusta") vs HN: "llamar a esto RSI parece engañoso"
  • Números usados: §4.1 Lasso 550 → 317 llamadas de agente, 3587 → 2931 ms; Tabla 1 empaquetamiento de círculos 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× menos generaciones, hasta 2.09× más rápido; Apéndice B.2 prompt (todo del PDF anterior)

Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles son controlados por YouTube.

0:00 La auto-mejora recursiva es la idea de que una IA se vuelve más inteligente, luego usa esa versión más inteligente de sí misma para hacerlo de nuevo, y esta semana Google publicó un artículo con esas dos palabras en el título, en el que los pesos del modelo nunca se mueven. Tres números. El CEO de Anthropic dice que este ciclo ha estado funcionando desde el verano, lo cual es su razón para frenar toda la industria. El tweet que anunciaba que Google acababa de descifrarlo recogió ochocientos "me gusta" en un día.

0:24 Y el resultado principal del propio artículo es de 317 llamadas al modelo en lugar de 550, lo cual es un descuento, no un despegue. En tres minutos: de dónde vino la frase, qué realmente se repite dentro de Dream-RSI, y cómo leer el próximo artículo con RSI en la portada. Esto es The Daily Diff, bajo el capó. 1965. I. J. Good, un estadístico de Bletchley Park que trabajó junto a Turing, escribe que una máquina ultrainteligente podría diseñar máquinas aún mejores,

0:52 lo llama una explosión de inteligencia y la última invención que el hombre necesitaría hacer, siempre que la máquina sea lo suficientemente dócil como para decirnos cómo controlarla, que es el "siempre que" que la gente deja de leer después de la coma. Durante cuarenta años, la frase significó exactamente eso: un sistema que edita su propio código fuente o pesos y se vuelve más inteligente en cada pasada. El ensayo de 2008 de Eliezer Yudkowsky lo convirtió en la palabra clave de la seguridad de la IA, y nadie tenía una máquina para probarlo, lo cual es la condición ideal para una definición. Luego, en mayo de 2025, DeepMind lanzó AlphaEvolve,

1:23 un agente Gemini que propone código, lo califica, conserva los ganadores y los muta de nuevo. Multiplicó matrices complejas de cuatro por cuatro en 48 pasos, batiendo un récord que Strassen estableció en 1969, y recupera alrededor del cero punto siete por ciento del cómputo mundial de Google, lo que a la escala de Google es un centro de datos encontrado debajo del sofá. Gemini ahora estaba ayudando a entrenar a Gemini, y la frase pasó discretamente de los blogs de seguridad a los comunicados de prensa. Dream-RSI atornilla un controlador sobre ese ciclo.

1:52 Una política, un programa real de Python, decide qué ramas del árbol de búsqueda expandir, cuántas en paralelo y cuándo rendirse. Gemini escribe el código candidato, y un evaluador fijo lo califica. Cada ejecución deja un árbol de lo que se intentó y lo que obtuvo. Ese árbol se convierte en un simulador de reproducción: un segundo Gemini, igualmente congelado, reescribe la política, y la nueva política se prueba contra los resultados registrados en lugar de en GPU reales.

2:16 El artículo llama a esto soñar, y una ejecución real paga por miles de soñadas sin costo de ejecución. El ganador vuelve a estar en línea, el grupo de mundos registrados crece, repetición. Y el prompt en el Apéndice B.2 le dice a la IA auto-mejorada, por escrito: edita solo este archivo y no resuelvas la tarea científica. Medido. En la tarea del solucionador Lasso, la exploración fija gastó 550 llamadas de Gemini para alcanzar tres punto seis segundos, Dream-RSI gastó 317 para alcanzar dos punto nueve, y ambos superaron a scikit-learn.

2:46 En KernelBench alcanzó la misma velocidad de kernel con aproximadamente dos punto cuatro veces menos generaciones. Y en el empaquetamiento de círculos obtuvo dos punto seis tres cinco nueve ocho tres, que es precisamente, con seis decimales, lo que la versión dos de AlphaEvolve obtuvo el año pasado. Así que X leyó el título: Google acaba de descifrar la auto-mejora recursiva. Hacker News leyó el PDF: llamar a esto RSI parece engañoso. Y la misma semana, el CEO de un competidor dijo que el ciclo había estado funcionando desde el verano y que todos deberían desacelerar.

3:13 Tres frases, las mismas dos palabras, tres máquinas diferentes. Entonces, el lunes, cómo leer el próximo artículo sobre RSI. Uno: pregunta qué objeto cambia, los pesos, el código o la configuración de búsqueda; Dream-RSI cambia el tercero. Dos: pregunta quién está congelado; aquí son el codificador, el juez y el reescritor, los tres. Tres: pregunta de qué unidad es el número principal. El cómputo ahorrado es optimización; un benchmark que el modelo no pudo alcanzar antes es el despegue, y nadie ha publicado eso todavía.

3:40 Veredicto, bajo el capó: NEEDS REVIEW. El ciclo es real, los ahorros se miden, y las dos palabras en la portada describen una máquina que no está en el documento. Si prefieres leer esto antes que oírme decirlo, The Daily Diff llega a tu bandeja de entrada cada mañana, gratis en thedailydiff.dev, enlace abajo. Dime qué abrir a continuación en los comentarios. Y esa es la diferencia de hoy. Soy Niko de Axrisi.

4:00 MERGE RESPONSIBLY.

Fuentes

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Videos relacionados