# Recursieve zelfverbetering, onder de motorkap

Published: 2026-09-18

Google DeepMind publiceerde "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — en het coderingsmodel erin verandert nooit. Onder de motorkap: wat de zin 60 jaar lang betekende, wat er daadwerkelijk in Dream-RSI loopt (een Python exploratiebeleid dat "droomt" over opgenomen zoekbomen), en waarom 317 agentoproepen in plaats van 550 een korting is, geen doorbraak. Oordeel: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/nl/video/2026-09-18-self-improving-ai/

## Wat deze video behandelt

- 1965 → 2008: I. J. Good's "intelligentie-explosie", Yudkowsky's zaad-AI — een machine die zijn eigen gewichten herschrijft
- 2025: AlphaEvolve — 48-vermenigvuldiging 4×4 matrixvermenigvuldiging, 0,7% van Googles computervermogen teruggewonnen, Gemini-kernels 23% sneller
- 2026: Dream-RSI — het beleid verbetert, de programmeur, beoordelaar en herschrijver zijn allemaal bevroren; de prompt zegt "Los de wetenschappelijke taak niet op"
- X: "Google heeft zojuist recursieve zelfverbetering gekraakt" (819 vind-ik-leuks) vs HN: "dit RSI noemen lijkt misleidend"
- Gebruikte getallen: §4.1 Lasso 550 → 317 agentoproepen, 3587 → 2931 ms; Tabel 1 cirkelpakking 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× minder generaties, tot 2.09× sneller; Bijlage B.2 prompt (alles uit de bovenstaande PDF)

## Vertaald transcript

Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.

0:00 Recursieve zelfverbetering is het idee dat een AI zichzelf slimmer maakt, vervolgens de slimmere versie gebruikt om het opnieuw te doen, en deze week publiceerde Google een paper met die twee woorden in de titel, waarin de gewichten van het model nooit veranderen. Drie getallen. De CEO van Anthropic zegt dat deze lus al sinds de zomer loopt, wat zijn reden is om de hele industrie te vertragen. De tweet die aankondigde dat Google het zojuist gekraakt had, verzamelde achthonderd likes op één dag.

0:24 En het eigen kopresultaat van het paper is 317 modeloproepen in plaats van 550, wat een korting is, geen doorbraak. In drie minuten: waar de uitdrukking vandaan kwam, wat er daadwerkelijk in Dream-RSI loopt, en hoe het volgende paper met RSI op de voorkant te lezen. Dit is The Daily Diff, onder de motorkap. 1965. I. J. Good, een statisticus van Bletchley Park die naast Turing werkte, schrijft dat een ultra-intelligente machine nog betere machines zou kunnen ontwerpen,

0:52 noemt het een intelligentie-explosie en de laatste uitvinding die de mens ooit hoeft te doen, mits de machine volgzaam genoeg is om ons te vertellen hoe we haar moeten besturen, wat het 'mits'-gedeelte is dat mensen na de komma niet meer lezen. Veertig jaar lang betekende de uitdrukking precies dat: een systeem dat zijn eigen bron of gewichten bewerkt en bij elke doorgang slimmer wordt. Eliezer Yudkowsky's essay uit 2008 maakte het het dragende woord van AI- veiligheid, en niemand had een machine om het op te testen, wat de ideale voorwaarde is voor een definitie. Toen, in mei 2025, leverde DeepMind AlphaEvolve,

1:23 een Gemini-agent die code voorstelt, deze laat scoren, de winnaars behoudt en deze opnieuw muteert. Het vermenigvuldigde vier-bij-vier complexe matrices in 48 stappen, waarbij een record van Strassen uit 1969 werd verslagen, en het recupereert ongeveer nul komma zeven procent van Googles wereldwijde computervermogen, wat op Googles schaal een datacenter is dat onder de bank is gevonden. Gemini hielp nu Gemini te trainen, en de uitdrukking verplaatste zich geruisloos van veiligheids- blogs naar persberichten. Dream-RSI bevestigt een controller bovenop die lus.

1:52 Een beleid, een daadwerkelijk Python-programma, beslist welke takken van de zoekboom moeten worden uitgebreid, hoeveel parallel, en wanneer op te geven. Gemini schrijft de kandidaatcode, en een vaste evaluator scoort deze. Elke run laat een boom achter van wat er geprobeerd werd en wat het scoorde. Die boom wordt een replay-simulator: een tweede, eveneens bevroren Gemini herschrijft het beleid, en het nieuwe beleid wordt getest tegen de opgenomen uitkomsten in plaats van op echte GPU's.

2:16 Het paper noemt dit dromen, en één echte run betaalt voor duizenden gedroomde runs zonder uitvoeringskosten. De winnaar gaat weer online, de pool van opgenomen werelden groeit, herhaal. En de prompt in Bijlage B.2 vertelt de zelfverbeterende AI, schriftelijk: bewerk alleen dit ene bestand, en los de wetenschappelijke taak niet op. Gemeten. Bij de Lasso-oplosserstaak gebruikte vaste exploratie 550 Gemini-oproepen om drie komma zes seconden te bereiken, Dream-RSI gebruikte 317 om twee komma negen te bereiken, en beide versloegen scikit-learn.

2:46 Op KernelBench bereikte het dezelfde kernelsnelheid met ongeveer twee komma vier keer minder generaties. En op cirkelpakking scoorde het twee komma zes drie vijf negen acht drie, wat precies, tot op zes decimalen, wat AlphaEvolve versie twee vorig jaar scoorde. Dus X las de titel: Google heeft zojuist recursieve zelfverbetering gekraakt. Hacker News las de PDF: dit RSI noemen lijkt misleidend. En in dezelfde week zei de CEO van een concurrent dat de lus al sinds de zomer liep en iedereen moest vertragen.

3:13 Drie zinnen, dezelfde twee woorden, drie verschillende machines. Dus, maandag, hoe het volgende RSI-paper te lezen. Eén: vraag welk object verandert, de gewichten, de code, of de zoekinstellingen; Dream-RSI verandert de derde. Twee: vraag wie er bevroren is; hier zijn het de programmeur, de rechter en de herschrijver, alle drie. Drie: vraag wat het kopnummer is als eenheid van. Bespaarde rekentijd is optimalisatie; een benchmark die het model voorheen niet kon bereiken is de doorbraak, en niemand heeft die nog gepubliceerd.

3:40 Oordeel, onder de motorkap: moet worden beoordeeld. De lus is echt, de besparingen zijn gemeten, en de twee woorden op de voorkant beschrijven een machine die niet in het paper staat. Als je dit liever leest dan mij het hoort zeggen, dan komt de diff elke ochtend gratis in je inbox op the daily diff dot dev, link hieronder. Vertel me in de reacties wat ik hierna moet openen. En dat is de diff voor vandaag. Ik ben Niko van Axrisi.

4:00 Voeg verantwoordelijk samen.

## Bronnen

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
