# Miglioramento ricorsivo automatico, sotto il cofano

Published: 2026-09-18

Google DeepMind ha pubblicato "Dream-RSI: Miglioramento Ricorsivo Automatico tramite Mondi in Evoluzione" — e il modello di codifica al suo interno non cambia mai. Sotto il cofano: cosa significava la frase per 60 anni, cosa effettivamente "loopa" in Dream-RSI (una politica di esplorazione Python che "sogna" su alberi di ricerca registrati), e perché 317 chiamate di agenti invece di 550 sono uno sconto, non un decollo. Verdetto: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/it/video/2026-09-18-self-improving-ai/

## Contenuto di questo video

- 1965 → 2008: "esplosione dell'intelligenza" di I. J. Good, AI "seed" di Yudkowsky — una macchina che riscrive i propri pesi
- 2025: AlphaEvolve — moltiplicazione di matrici 4×4 con 48 moltiplicazioni, recuperato lo 0,7% del calcolo di Google, kernel Gemini 23% più veloci
- 2026: Dream-RSI — la policy migliora, il programmatore, il giudice e il revisore sono tutti bloccati; il prompt dice "Non risolvere il compito scientifico"
- X: "Google ha appena risolto il miglioramento ricorsivo automatico" (819 mi piace) vs HN: "chiamare questo RSI sembra fuorviante"
- Numeri usati: §4.1 Lasso 550 → 317 chiamate di agente, 3587 → 2931 ms; Tabella 1 impacchettamento cerchi 2,635983 = AlphaEvolveV2; §4.3 KernelBench 2,43× / 1,79× meno generazioni, fino a 2,09× più veloce; Appendice B.2 prompt (tutto dal PDF sopra)

## Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

0:00 Il miglioramento ricorsivo automatico è l'idea che un'AI si renda più intelligente, quindi usi la versione più intelligente di sé stessa per farlo di nuovo, e questa settimana Google ha pubblicato un documento con quelle due parole nel titolo, in cui i pesi del modello non si muovono mai. Tre numeri. Il CEO di Anthropic dice che questo "loop" è in esecuzione dall'estate, che è la sua ragione per rallentare l'intera industria. Il tweet che annunciava che Google l'aveva appena risolto ha raccolto ottocento mi piace in un giorno.

0:24 E il risultato principale del documento è 317 chiamate del modello invece di 550, che è uno sconto, non un decollo. In tre minuti: da dove viene la frase, cosa effettivamente "loopa" all'interno di Dream-RSI, e come leggere il prossimo documento con RSI in copertina. Questo è The Daily Diff, sotto il cofano. 1965. I. J. Good, uno statistico di Bletchley Park che lavorava accanto a Turing, scrive che una macchina ultraintelligente potrebbe progettare macchine ancora migliori,

0:52 la chiama un'esplosione dell'intelligenza e l'ultima invenzione che l'uomo dovrà mai fare, a condizione che la macchina sia abbastanza docile da dirci come controllarla, che è la parte del "a condizione che" che la gente smette di leggere dopo la virgola. Per quarant'anni la frase ha significato esattamente questo: un sistema che modifica il proprio codice sorgente o i propri pesi e diventa più intelligente a ogni passaggio. Il saggio di Eliezer Yudkowsky del 2008 lo ha reso la parola chiave portante della sicurezza dell'AI, e nessuno aveva una macchina su cui testarlo, che è la condizione ideale per una definizione. Poi a maggio 2025 DeepMind ha lanciato AlphaEvolve,

1:23 un agente Gemini che propone codice, lo fa valutare, mantiene i vincitori e li muta di nuovo. Ha moltiplicato matrici complesse quattro per quattro in 48 passaggi, battendo un record stabilito da Strassen nel 1969, e recupera circa lo zero virgola sette percento del calcolo globale di Google, che alla scala di Google è un centro dati trovato sotto il divano. Gemini stava ora aiutando ad addestrare Gemini, e la frase si è tranquillamente spostata dai blog sulla sicurezza ai comunicati stampa. Dream-RSI inserisce un controller in cima a quel "loop".

1:52 Una policy, un vero e proprio programma Python, decide quali rami dell'albero di ricerca espandere, quanti in parallelo, e quando arrendersi. Gemini scrive il codice candidato, e un valutatore fisso lo valuta. Ogni esecuzione lascia un albero di ciò che è stato provato e di quanto è stato valutato. Quell'albero diventa un simulatore di "replay": un secondo Gemini, altrettanto bloccato, riscrive la policy, e la nuova policy viene testata rispetto agli esiti registrati invece che su GPU reali.

2:16 Il documento chiama questo "sognare", e una singola esecuzione reale paga per migliaia di esecuzioni "sognate" a costo di esecuzione zero. Il vincitore torna online, il pool di mondi registrati cresce, si ripete. E il prompt nell'Appendice B.2 dice all'AI auto-migliorante, per iscritto: modifica solo questo file, e non risolvere il compito scientifico. Misurato. Nel compito del risolutore Lasso, l'esplorazione fissa ha impiegato 550 chiamate Gemini per raggiungere tre virgola sei secondi, Dream-RSI ne ha impiegate 317 per raggiungere due virgola nove, ed entrambi hanno battuto scikit-learn.

2:46 Su KernelBench ha raggiunto la stessa velocità del kernel con circa due virgola quattro volte meno generazioni. E sull'impacchettamento di cerchi ha ottenuto due virgola sei tre cinque nove otto tre, che è precisamente, a sei decimali, quello che AlphaEvolve versione due ha ottenuto l'anno scorso. Quindi X ha letto il titolo: Google ha appena risolto il miglioramento ricorsivo automatico. Hacker News ha letto il PDF: chiamare questo RSI sembra fuorviante. E la stessa settimana il CEO di un concorrente ha detto che il "loop" era in esecuzione dall'estate e tutti dovrebbero rallentare.

3:13 Tre frasi, le stesse due parole, tre macchine diverse. Quindi, lunedì, come leggere il prossimo documento RSI. Uno: chiedi quale oggetto cambia, i pesi, il codice o le impostazioni di ricerca; Dream-RSI cambia il terzo. Due: chiedi chi è bloccato; qui sono il programmatore, il giudice e il revisore, tutti e tre. Tre: chiedi di cosa è l'unità del numero principale. Il calcolo risparmiato è ottimizzazione; un benchmark che il modello non poteva raggiungere prima è il decollo, e nessuno ha ancora pubblicato quello.

3:40 Verdetto, sotto il cofano: NEEDS REVIEW. Il "loop" è reale, i risparmi sono misurati, e le due parole sulla copertina descrivono una macchina che non è nel documento. Se preferisci leggere questo piuttosto che sentirmi dirlo, il "diff" arriva nella tua casella di posta ogni mattina, gratuitamente su thedailydiff.dev, link qui sotto. Dimmi cosa apriremo dopo nei commenti. E questo è il "diff" per oggi. Sono Niko di Axrisi.

4:00 Fai il merge responsabilmente.

## Fonti

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
