# L'auto-amélioration récursive, sous le capot

Published: 2026-09-18

Google DeepMind a publié « Dream-RSI : Recursive Self-Improvement through Evolving Worlds » — et le modèle de codage qu'il contient ne change jamais. Sous le capot : ce que l'expression signifiait pendant 60 ans, ce qui boucle réellement dans Dream-RSI (une politique d'exploration Python qui « rêve » sur des arbres de recherche enregistrés), et pourquoi 317 appels d'agent au lieu de 550 est une réduction, pas un décollage. Verdict : NEEDS REVIEW.

Canonical: https://thedailydiff.dev/fr/video/2026-09-18-self-improving-ai/

## Ce que couvre cette vidéo

- 1965 → 2008 : « l'explosion d'intelligence » de I. J. Good, l'IA germe de Yudkowsky — une machine qui réécrit ses propres poids
- 2025 : AlphaEvolve — multiplication de matrices 4×4 à 48 multiplications, 0,7 % de la puissance de calcul de Google récupérée, les noyaux Gemini 23 % plus rapides
- 2026 : Dream-RSI — la politique s'améliore, le codeur, le juge et le réécrivain sont tous figés ; l'invite dit « Ne résolvez pas la tâche scientifique »
- X : « Google vient de craquer l'auto-amélioration récursive » (819 likes) vs HN : « appeler cela RSI semble trompeur »
- Nombres utilisés : §4.1 Lasso 550 → 317 appels d'agent, 3587 → 2931 ms ; Tableau 1 empilement de cercles 2,635983 = AlphaEvolveV2 ; §4.3 KernelBench 2,43× / 1,79× moins de générations, jusqu'à 2,09× plus rapide ; Annexe B.2 invite (tout du PDF ci-dessus)

## Transcription traduite

Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont gérés par YouTube.

0:00 L'auto-amélioration récursive est l'idée qu'une IA se rend plus intelligente, puis utilise cette version plus intelligente pour le refaire, et cette semaine Google a publié un article avec ces deux mots dans le titre, dans lequel les poids du modèle ne bougent jamais. Trois nombres. Le PDG d'Anthropic dit que cette boucle fonctionne depuis l'été, ce qui est sa raison de ralentir toute l'industrie. Le tweet annonçant que Google venait de le craquer a recueilli huit cents likes en un jour.

0:24 Et le résultat principal de l'article est de 317 appels de modèle au lieu de 550, ce qui est une réduction, pas un décollage. En trois minutes : d'où vient l'expression, ce qui boucle réellement à l'intérieur de Dream-RSI, et comment lire le prochain article avec RSI en couverture. Ceci est The Daily Diff, sous le capot. 1965. I. J. Good, un statisticien de Bletchley Park qui travaillait aux côtés de Turing, écrit qu'une machine ultra-intelligente pourrait concevoir des machines encore meilleures,

0:52 appelle cela une explosion d'intelligence et la dernière invention que l'homme aurait jamais à faire, à condition que la machine soit assez docile pour nous dire comment la contrôler, ce qui est le « à condition que » que les gens arrêtent de lire après la virgule. Pendant quarante ans, l'expression signifiait exactement cela : un système qui modifie son propre code source ou ses poids et devient plus intelligent à chaque passage. L'essai d'Eliezer Yudkowsky de 2008 en a fait le mot porteur de la sécurité de l'IA, et personne n'avait de machine pour le tester, ce qui est la condition idéale pour une définition. Puis en mai 2025, DeepMind a lancé AlphaEvolve,

1:23 un agent Gemini qui propose du code, le fait évaluer, garde les gagnants et les mute à nouveau. Il a multiplié des matrices complexes quatre par quatre en 48 étapes, battant un record établi par Strassen en 1969, et il récupère environ zéro virgule sept pour cent de la puissance de calcul mondiale de Google, ce qui, à l'échelle de Google, est un centre de données trouvé sous le canapé. Gemini aidait maintenant à former Gemini, et l'expression est passée discrètement des blogs de sécurité aux communiqués de presse. Dream-RSI ajoute un contrôleur au-dessus de cette boucle.

1:52 Une politique, un programme Python réel, décide quelles branches de l'arbre de recherche développer, combien en parallèle, et quand abandonner. Gemini écrit le code candidat, et un évaluateur fixe le note. Chaque exécution laisse derrière elle un arbre de ce qui a été essayé et de sa note. Cet arbre devient un simulateur de relecture : un deuxième Gemini, également figé, réécrit la politique, et la nouvelle politique est testée par rapport aux résultats enregistrés au lieu de sur de vrais GPU.

2:16 Le document appelle cela le rêve, et une vraie exécution paie pour des milliers d'exécutions rêvées sans coût d'exécution. Le gagnant revient en ligne, le pool de mondes enregistrés s'agrandit, répétez. Et l'invite de l'Annexe B.2 dit à l'IA auto-améliorante, par écrit : modifiez uniquement ce fichier, et ne résolvez pas la tâche scientifique. Mesuré. Pour la tâche du solveur Lasso, l'exploration fixe a dépensé 550 appels Gemini pour atteindre trois virgule six secondes, Dream-RSI en a dépensé 317 pour atteindre deux virgule neuf, et les deux ont battu scikit-learn.

2:46 Sur KernelBench, il a atteint la même vitesse de noyau avec environ deux virgule quatre fois moins de générations. Et sur l'empilement de cercles, il a obtenu deux virgule six trois cinq neuf huit trois, ce qui est précisément, à six décimales près, ce que la version deux d'AlphaEvolve a obtenu l'année dernière. Alors X a lu le titre : Google vient de craquer l'auto-amélioration récursive. Hacker News a lu le PDF : appeler cela RSI semble trompeur. Et la même semaine, le PDG d'un concurrent a déclaré que la boucle fonctionnait depuis l'été et que tout le monde devrait ralentir.

3:13 Trois phrases, les mêmes deux mots, trois machines différentes. Alors, lundi, comment lire le prochain article sur la RSI. Un : demandez quel objet change, les poids, le code ou les paramètres de recherche ; Dream-RSI change le troisième. Deux : demandez qui est figé ; ici, c'est le codeur, le juge et le réécrivain, tous les trois. Trois : demandez quelle est l'unité du chiffre principal. Le calcul économisé est une optimisation ; une référence que le modèle ne pouvait pas atteindre auparavant est le décollage, et personne n'a encore publié cela.

3:40 Verdict, sous le capot : NEEDS REVIEW. La boucle est réelle, les économies sont mesurées, et les deux mots sur la couverture décrivent une machine qui n'est pas dans l'article. Si vous préférez lire ceci plutôt que de m'entendre le dire, le diff arrive dans votre boîte de réception chaque matin, gratuitement sur thedailydiff.dev, lien ci-dessous. Dites-moi quoi ouvrir ensuite dans les commentaires. Et c'est le diff pour aujourd'hui. Je suis Niko d'Axrisi.

4:00 Fusionnez de manière responsable.

## Sources

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
