# L'auto-amélioration récursive, les dessous de l'affaire

Published: 2026-09-18

Google DeepMind a publié « Dream-RSI: Recursive Self-Improvement through Evolving Worlds » — et le modèle de codage qu'il contient ne change jamais. Les dessous de l'affaire : ce que l'expression signifiait pendant 60 ans, ce qui est réellement mis en boucle dans Dream-RSI (une politique d'exploration Python qui « rêve » sur des arbres de recherche enregistrés), et pourquoi 317 appels d'agent au lieu de 550 est un rabais, pas un décollage. Verdict : NEEDS REVIEW.

Canonical: https://thedailydiff.dev/fr-CA/video/2026-09-18-self-improving-ai/

## Ce que cette vidéo couvre

- 1965 → 2008 : L'« explosion de l'intelligence » de I. J. Good, l'IA d'amorçage de Yudkowsky – une machine qui réécrit ses propres poids
- 2025 : AlphaEvolve — multiplication matricielle 4×4 à 48 multiplications, 0,7 % de la puissance de calcul de Google récupérée, noyaux Gemini 23 % plus rapides
- 2026 : Dream-RSI — la politique s'améliore, le codeur, le juge et le réécrivain sont tous figés ; l'invite dit « Ne résolvez pas la tâche scientifique »
- X : « Google vient de réussir l'auto-amélioration récursive » (819 mentions J'aime) vs HN : « qualifier cela d'auto-amélioration récursive semble trompeur »
- Nombres utilisés : §4.1 Lasso 550 → 317 appels d'agent, 3587 → 2931 ms ; Tableau 1 empilement de cercles 2.635983 = AlphaEvolveV2 ; §4.3 KernelBench 2.43× / 1.79× moins de générations, jusqu'à 2.09× plus rapide ; Annexe B.2 invite (tous du PDF ci-dessus)

## Transcription traduite

Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont contrôlés par YouTube.

0:00 L'auto-amélioration récursive est l'idée qu'une IA se rend plus intelligente, puis utilise cette version plus intelligente d'elle-même pour recommencer, et cette semaine Google a publié un article avec ces deux mots dans le titre, dans lequel les poids du modèle ne bougent jamais. Trois chiffres. Le PDG d'Anthropic dit que cette boucle fonctionne depuis l'été, ce qui est sa raison de ralentir toute l'industrie. Le tweet annonçant que Google venait de trouver la solution a recueilli huit cents mentions J'aime en une journée.

0:24 Et le principal résultat de l'article est de 317 appels de modèle au lieu de 550, ce qui est un rabais, pas un décollage. En trois minutes : d'où vient l'expression, ce qui est réellement mis en boucle à l'intérieur de Dream-RSI, et comment lire le prochain article avec RSI en couverture. Voici The Daily Diff, les dessous de l'affaire. 1965. I. J. Good, un statisticien de Bletchley Park qui travaillait aux côtés de Turing, écrit qu'une machine ultra-intelligente pourrait concevoir des machines encore meilleures,

0:52 appelle cela une explosion de l'intelligence et la dernière invention que l'homme aurait jamais besoin de faire, à condition que la machine soit assez docile pour nous dire comment la contrôler, ce qui est le « à condition que » que les gens arrêtent de lire après la virgule. Pendant quarante ans, l'expression a signifié exactement cela : un système qui modifie son propre code source ou ses poids et devient plus intelligent à chaque passage. L'essai d'Eliezer Yudkowsky de 2008 en a fait le mot porteur de la sécurité de l'IA, et personne n'avait de machine pour le tester, ce qui est la condition idéale pour une définition. Puis en mai 2025, DeepMind a lancé AlphaEvolve,

1:23 un agent Gemini qui propose du code, le fait évaluer, garde les gagnants et les mute à nouveau. Il a multiplié des matrices complexes quatre par quatre en 48 étapes, battant un record établi par Strassen en 1969, et il récupère environ zéro virgule sept pour cent de la puissance de calcul mondiale de Google, ce qui, à l'échelle de Google, est un centre de données trouvé sous le canapé. Gemini aidait maintenant à entraîner Gemini, et l'expression est passée discrètement des blogs sur la sécurité aux communiqués de presse. Dream-RSI fixe un contrôleur au-dessus de cette boucle.

1:52 Une politique, un vrai programme Python, décide quelles branches de l'arbre de recherche développer, combien en parallèle, et quand abandonner. Gemini écrit le code candidat, et un évaluateur fixe le note. Chaque exécution laisse derrière elle un arbre de ce qui a été tenté et de ce qu'il a noté. Cet arbre devient un simulateur de relecture : un second Gemini, également figé, réécrit la politique, et la nouvelle politique est testée par rapport aux résultats enregistrés au lieu de sur de vrais GPU.

2:16 Le document appelle cela rêver, et une seule exécution réelle paie pour des milliers de celles « rêvées » à un coût d'exécution nul. Le gagnant est remis en ligne, le bassin de mondes enregistrés s'agrandit, et on répète. Et l'invite de l'Annexe B.2 dit à l'IA auto-amélioratrice, par écrit : ne modifiez que ce fichier, et ne résolvez pas la tâche scientifique. Mesuré. Sur la tâche du solveur Lasso, l'exploration fixe a passé 550 appels Gemini pour atteindre trois virgule six secondes, Dream-RSI en a passé 317 pour atteindre deux virgule neuf, et les deux ont battu scikit-learn.

2:46 Sur KernelBench, il a atteint la même vitesse de noyau avec environ deux virgule quatre fois moins de générations. Et sur l'empilement de cercles, il a obtenu deux virgule six trois cinq neuf huit trois, ce qui est précisément, à six décimales près, ce que AlphaEvolve version deux a obtenu l'année dernière. Donc X a lu le titre : Google vient de réussir l'auto-amélioration récursive. Hacker News a lu le PDF : qualifier cela de RSI semble trompeur. Et la même semaine, le PDG d'un concurrent a déclaré que la boucle fonctionnait depuis l'été et que tout le monde devrait ralentir.

3:13 Trois phrases, les deux mêmes mots, trois machines différentes. Alors, lundi, comment lire le prochain document sur l'ISR. Un : demandez quel objet change, les poids, le code ou les paramètres de recherche ; Dream-RSI change le troisième. Deux : demandez qui est figé ; ici, c'est le codeur, le juge et le réécrivain, tous les trois. Trois : demandez quelle est l'unité du chiffre principal. La puissance de calcul économisée est une optimisation ; un point de référence que le modèle ne pouvait pas atteindre auparavant est le décollage, et personne n'a encore publié celui-là.

3:40 Verdict, les dessous de l'affaire : NEEDS REVIEW. La boucle est réelle, les économies sont mesurées, et les deux mots sur la couverture décrivent une machine qui n'est pas dans le document. Si vous préférez lire ceci plutôt que de m'entendre le dire, la différence arrive dans votre boîte de réception chaque matin, gratuitement sur thedailydiff.dev, lien ci-dessous. Dites-moi ce que je dois ouvrir ensuite dans les commentaires. Et c'est la différence pour aujourd'hui. Je suis Niko d'Axrisi.

4:00 Fusionnez de manière responsable.

## Sources

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
