Auto-millora recursiva, entre bastidors
Google DeepMind va publicar "Dream-RSI: Auto-millora recursiva a través de mons en evolució" — i el model de codificació al seu interior mai canvia.
Google DeepMind va publicar "Dream-RSI: Auto-millora recursiva a través de mons en evolució" — i el model de codificació al seu interior mai canvia. Entre bastidors: què significava la frase durant 60 anys, què realment es repeteix a Dream-RSI (una política d'exploració de Python que "somiadorament" recorre arbres de cerca registrats), i per què 317 trucades d'agent en lloc de 550 és un descompte, no una enlairada. Veredicte: NEEDS REVIEW.
Llegeix l'edició escrita (anglès) ↗
Què cobreix aquest vídeo
- 1965 → 2008: l'"explosió d'intel·ligència" d'I. J. Good, l'IA llavor de Yudkowsky — una màquina que reescriu els seus propis pesos
- 2025: AlphaEvolve — multiplicació de matriu 4×4 de 48 multiplicacions, 0,7% del còmput de Google recuperat, kernels de Gemini un 23% més ràpids
- 2026: Dream-RSI — la política millora, el codificador, jutge i reescritor estan tots congelats; el "prompt" diu "No resolguis la tasca científica"
- X: "Google acaba de desxifrar l'auto-millora recursiva" (819 m'agrada) vs HN: "anomenar això RSI sembla enganyós"
- Números utilitzats: §4.1 Lasso 550 → 317 trucades d'agent, 3587 → 2931 ms; Taula 1 empaquetament de cercles 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× menys generacions, fins a 2.09× més ràpid; Apèndix B.2 prompt (tot del PDF anterior)
Transcripció traduïda
Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.
0:00 L'auto-millora recursiva és la idea que una IA es fa a si mateixa més intel·ligent, després utilitza la versió més intel·ligent per fer-ho de nou, i aquesta setmana Google va publicar un article amb aquestes dues paraules al títol, en què els pesos del model mai es mouen. Tres números. El CEO d'Anthropic diu que aquest bucle ha estat funcionant des de l'estiu, que és la seva raó per alentar tota la indústria. El tuit que anunciava que Google acabava de desxifrar-ho va recollir vuit-cents m'agrada en un dia.
0:24 I el resultat principal del mateix article és de 317 trucades del model en lloc de 550, que és un descompte, no una enlairada. En tres minuts: d'on va sortir la frase, què es repeteix realment dins de Dream-RSI, i com llegir el pròxim article amb RSI a la portada. Això és The Daily Diff, entre bastidors. 1965. I. J. Good, un estadístic de Bletchley Park que va treballar al costat de Turing, escriu que una màquina ultra-intel·ligent podria dissenyar màquines encara millors,
0:52 l'anomena una explosió d'intel·ligència i l'última invenció que l'home hauria de fer mai, sempre que la màquina sigui prou dòcil per dir-nos com controlar-la, que és el "sempre que" que la gent deixa de llegir després de la coma. Durant quaranta anys la frase significava exactament això: un sistema que edita el seu propi codi font o pesos i surt més intel·ligent a cada passada. L'assaig d'Eliezer Yudkowsky de 2008 el va convertir en la paraula clau de la seguretat de la IA, i ningú tenia una màquina per provar-ho, que és la condició ideal per a una definició. Després, el maig de 2025, DeepMind va llançar AlphaEvolve,
1:23 un agent Gemini que proposa codi, el fa puntuar, guarda els guanyadors i els muta de nou. Va multiplicar matrius complexes de quatre per quatre en 48 passos, batent un rècord que Strassen va establir el 1969, i recupera aproximadament zero coma set per cent del còmput mundial de Google, que a l'escala de Google és un centre de dades trobat sota el sofà. Gemini ara estava ajudant a entrenar Gemini, i la frase va passar tranquil·lament dels blocs de seguretat a les notes de premsa. Dream-RSI col·loca un controlador a sobre d'aquest bucle.
1:52 Una política, un programa Python real, decideix quines branques de l'arbre de cerca expandir, quantes en paral·lel, i quan rendir-se. Gemini escriu el codi candidat, i un avaluador fix el puntua. Cada execució deixa un arbre del que es va provar i el que va puntuar. Aquest arbre es converteix en un simulador de reproducció: un segon Gemini, igualment congelat, reescriu la política, i la nova política es prova contra els resultats registrats en lloc de fer-ho en GPUs reals.
2:16 L'article ho anomena "somiar", i una execució real paga per milers de les "somniades" sense cost d'execució. El guanyador torna en línia, el conjunt de mons registrats creix, repetir. I el "prompt" a l'Apèndix B.2 diu a l'IA auto-millorant, per escrit: edita només aquest fitxer, i no resolguis la tasca científica. Mesurat. En la tasca del solucionador Lasso, l'exploració fixa va gastar 550 trucades a Gemini per arribar a tres coma sis segons, Dream-RSI en va gastar 317 per arribar a dos coma nou, i ambdós van vèncer scikit-learn.
2:46 A KernelBench va aconseguir la mateixa velocitat del kernel amb aproximadament dues coma quatre vegades menys generacions. I en l'empaquetament de cercles va puntuar dos coma sis tres cinc nou vuit tres, que és precisament, amb sis decimals, el que la versió dos d'AlphaEvolve va puntuar l'any passat. Així que X va llegir el títol: Google acaba de desxifrar l'auto-millora recursiva. Hacker News va llegir el PDF: anomenar això RSI sembla enganyós. I la mateixa setmana un CEO de la competència va dir que el bucle havia estat funcionant des de l'estiu i tothom hauria d'alentar-se.
3:13 Tres frases, les mateixes dues paraules, tres màquines diferents. Així doncs, dilluns, com llegir el pròxim article d'RSI. Un: pregunta quin objecte canvia, els pesos, el codi o la configuració de cerca; Dream-RSI canvia el tercer. Dos: pregunta qui està congelat; aquí són el codificador, el jutge i el reescritor, tots tres. Tres: pregunta quina unitat és el número principal. El còmput estalviat és optimització; un "benchmark" que el model no podia assolir abans és l'enlairada, i ningú ha publicat això encara.
3:40 Veredicte, entre bastidors: NEEDS REVIEW. El bucle és real, els estalvis estan mesurats, i les dues paraules a la portada descriuen una màquina que no es troba a l'article. Si prefereixes llegir això que escoltar-me dir-ho, el "diff" arriba a la teva safata d'entrada cada matí, gratuït a the daily diff dot dev, enllaç a sota. Digues-me què obrir a continuació als comentaris. I això és el "diff" d'avui. Sóc Niko d'Axrisi.
4:00 Fusiona amb responsabilitat.
Fonts
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



