# Rekursiewe selfverbetering, agter die skerms

Published: 2026-09-18

Google DeepMind het "Dream-RSI: Rekursiewe Selfverbetering deur Ewoluerende Wêrelde" gepubliseer — en die koderingsmodel daarin verander nooit. Agter die skerms: wat die frase vir 60 jaar beteken het, wat werklik in Dream-RSI loop (’n Python-eksplorasiebeleid wat oor opgeneemde soekbome "droom"), en waarom 317 agentoproepe in plaas van 550 ’n afslag is, nie ’n opstyg nie. Uitspraak: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/af/video/2026-09-18-self-improving-ai/

## Wat hierdie video dek

- 1965 → 2008: I. J. Good se "intelligensie-ontploffing", Yudkowsky se saad-KI — ’n masjien wat sy eie gewigte herskryf
- 2025: AlphaEvolve — 48-vermenigvuldiging 4×4 matriksvermenigvuldiging, 0.7% van Google se rekenkrag herwin, Gemini-kernels 23% vinniger
- 2026: Dream-RSI — die beleid verbeter, die kodeerder, beoordelaar en herskrywer is almal gevries; die aanwysing sê "Moenie die wetenskaplike taak oplos nie"
- X: "Google het pas rekursiewe selfverbetering geknak" (819 laaiks) vs HN: "om dit RSI te noem, lyk misleidend"
- Getalle gebruik: §4.1 Lasso 550 → 317 agentoproepe, 3587 → 2931 ms; Tabel 1 sirkelpakking 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× minder generasies, tot 2.09× vinniger; Bylae B.2 aanwysing (alles uit die bogenoemde PDF)

## Vertaalde transkripsie

Vertaal uit die oorspronklike Engelse vertelling. Beskikbare klank en onderskrifte word deur YouTube beheer.

0:00 Rekursiewe selfverbetering is die idee dat ’n KI homself slimmer maak, en dan die slimmer self gebruik om dit weer te doen, en hierdie week het Google ’n vraestel gepubliseer met daardie twee woorde in die titel, waarin die model se gewigte nooit beweeg nie. Drie getalle. Anthropic se uitvoerende hoof sê hierdie lus loop al sedert die somer, wat sy rede is om die hele bedryf te vertraag. Die twiet wat aankondig dat Google dit pas geknak het, het agthonderd laaiks versamel in ’n dag.

0:24 En die vraestel se eie opskrifresultaat is 317 modeloproepe in plaas van 550, wat ’n afslag is, nie ’n opstyg nie. In drie minute: waar die frase vandaan kom, wat werklik binne Dream-RSI lus, en hoe om die volgende vraestel met RSI op die omslag te lees. Dit is The Daily Diff, agter die skerms. 1965. I. J. Good, ’n Bletchley Park-statistieken wat langs Turing gewerk het, skryf dat ’n ultra-intelligente masjien selfs beter masjiene kan ontwerp,

0:52 noem dit ’n intelligensie-ontploffing en die laaste uitvinding wat die mens ooit hoef te maak, mits die masjien gehoorsaam genoeg is om ons te vertel hoe om dit te beheer, wat die mits-mense is wat ophou lees na die komma. Vir veertig jaar het die frase presies dit beteken: ’n stelsel wat sy eie bron of gewigte redigeer en slimmer uitkom elke deurgang. Eliezer Yudkowsky se 2008-opstel het dit die draende woord van KI- veiligheid gemaak, en niemand het ’n masjien gehad om dit op te toets nie, wat die ideale toestand is vir ’n definisie. Toe in Mei 2025 het DeepMind AlphaEvolve verskeep,

1:23 ’n Gemini-agent wat kode voorstel, dit laat punte kry, die wenners behou en hulle weer muteer. Dit het vier-by-vier komplekse matrikse in 48 stappe vermenigvuldig, en ’n rekord wat Strassen in 1969 opgestel het, oortref, en dit herwin ongeveer nul komma sewe persent van Google se wêreldwye rekenkrag, wat op Google se skaal ’n datasentrum is wat onder die bank gevind word. Gemini het nou gehelp om Gemini op te lei, en die frase het stilweg van veiligheids- blogs na persverklarings verskuif. Dream-RSI bout ’n beheerder bo-op daardie lus.

1:52 ’n Beleid, ’n werklike Python-program, besluit watter takke van die soekboom om uit te brei, hoeveel parallel, en wanneer om op te gee. Gemini skryf die kandidaatkode, en ’n vaste evalueerder gee dit punte. Elke loop laat ’n boom agter van wat probeer is en wat dit behaal het. Daardie boom word ’n herhaling-simulator: ’n tweede, ewe gevriesde Gemini herskryf die beleid, en die nuwe beleid word getoets teen die opgeneemde uitkomste in plaas van op regte GPU's.

2:16 Die vraestel noem dit droom, en een werklike loop betaal vir duisende gedroomde enes teen nul uitvoeringskoste. Die wenner gaan terug aanlyn, die poel van opgeneemde wêrelde groei, herhaal. En die aanwysing in Bylae B.2 vertel die selfverbeterende KI, skriftelik: redigeer slegs hierdie een lêer, en moenie die wetenskaplike taak oplos nie. Gemeet. Op die Lasso-oplosserstaak het vaste eksplorasie 550 Gemini-oproepe bestee om drie punt ses sekondes te bereik, Dream-RSI het 317 bestee om twee punt nege te bereik, en albei het scikit-learn oortref.

2:46 Op KernelBench het dit dieselfde kernspoed bereik met ongeveer twee punt vier keer minder generasies. En op sirkelpakking het dit twee punt ses drie vyf nege agt drie behaal, wat presies, tot ses desimale, is wat AlphaEvolve weergawe twee verlede jaar behaal het. Dus het X die titel gelees: Google het pas rekursiewe selfverbetering geknak. Hacker News het die PDF gelees: om dit RSI te noem, lyk misleidend. En dieselfde week het ’n mededinger se uitvoerende hoof gesê die lus loop al sedert die somer en almal moet stadiger gaan.

3:13 Drie sinne, dieselfde twee woorde, drie verskillende masjiene. So, Maandag, hoe om die volgende RSI-vraestel te lees. Een: vra watter voorwerp verander, die gewigte, die kode, of die soekinstellings; Dream-RSI verander die derde. Twee: vra wie gevries is; hier is dit die kodeerder, die beoordelaar en die herskrywer, al drie. Drie: vra wat die opskrifnommer ’n eenheid van is. Bespaarde rekenkrag is optimering; ’n maatstaf wat die model nie voorheen kon bereik nie, is die opstyg, en niemand het dit nog gepubliseer nie.

3:40 Uitspraak, agter die skerms: needs review. Die lus is werklik, die besparings is gemeet, en die twee woorde op die omslag beskryf ’n masjien wat nie in die vraestel is nie. As jy dit liewer wil lees as om my dit te hoor sê, land die diff elke oggend in jou inkassie, gratis by the daily diff dot dev, skakel hieronder. Vertel my wat om volgende in die kommentaar oop te maak. En dit is die verskil vir vandag. Ek is Niko van Axrisi.

4:00 Voeg verantwoordelik saam.

## Bronne

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
