# Rekursiv selvforbedring, under motorhjelmen

Published: 2026-09-18

Google DeepMind udgav "Dream-RSI: Rekursiv selvforbedring gennem udviklende verdener" — og den kodeudviklingsmodel, der er inde i den, ændrer sig aldrig. Under motorhjelmen: hvad udtrykket har betydet i 60 år, hvad der faktisk looper i Dream-RSI (en Python-udforskningspolitik, der "drømmer" over optagede søgetræer), og hvorfor 317 agentkald i stedet for 550 er en rabat, ikke en opstart. Dom: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/da/video/2026-09-18-self-improving-ai/

## Hvad denne video dækker

- 1965 → 2008: I. J. Goods "intelligenseksplosion", Yudkowskys seed AI — en maskine der omskriver sine egne vægte
- 2025: AlphaEvolve — 48-multiplikation 4×4 matrixmultiplikation, 0,7% af Googles computerkraft genvundet, Gemini-kerner 23% hurtigere
- 2026: Dream-RSI — politikken forbedres, koderen, dommeren og omskriveren er alle frosne; prompten siger "Løs ikke den videnskabelige opgave"
- X: "Google har lige knækket rekursiv selvforbedring" (819 likes) vs HN: "at kalde dette RSI virker misvisende"
- Brugte tal: §4.1 Lasso 550 → 317 agentkald, 3587 → 2931 ms; Tabel 1 cirkelpakning 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× færre generationer, op til 2.09× hurtigere; Appendiks B.2 prompt (alt fra PDF'en ovenfor)

## Oversat udskrift

Oversat fra den originale engelske fortælling. Tilgængelig lyd og undertekster styres af YouTube.

0:00 Rekursiv selvforbedring er idéen om, at en AI gør sig selv klogere, og derefter bruger den klogere udgave til at gøre det igen, og i denne uge offentliggjorde Google et papir med disse to ord i titlen, hvori modellens vægte aldrig bevæger sig. Tre tal. Anthropic's CEO siger, at denne loop har kørt siden sommer, hvilket er hans grund til at sætte hele branchen ned i fart. Tweetet, der annoncerede, at Google lige har knækket det, samlede otte hundrede likes på en dag.

0:24 Og papirets eget hovedresultat er 317 modelkald i stedet for 550, hvilket er en rabat, ikke en opstart. På tre minutter: hvor udtrykket kom fra, hvad der faktisk looper inde i Dream-RSI, og hvordan man læser det næste papir med RSI på forsiden. Dette er The Daily Diff, under motorhjelmen. 1965. I. J. Good, en Bletchley Park statistiker, der arbejdede ved siden af Turing, skriver, at en ultra-intelligent maskine kunne designe endnu bedre maskiner,

0:52 kalder det en intelligenseksplosion og den sidste opfindelse mennesket nogensinde behøver at lave, forudsat at maskinen er føjelig nok til at fortælle os, hvordan vi skal kontrollere den, hvilket er det 'forudsat-at' folk stopper med at læse efter kommaet. I fyrre år betød udtrykket præcis det: et system, der redigerer sin egen kildekode eller vægte og bliver klogere for hver gennemgang. Eliezer Yudkowskys essay fra 2008 gjorde det til bærebjælken for AI sikkerhed, og ingen havde en maskine at teste det på, hvilket er den ideelle betingelse for en definition. Derefter, i maj 2025, sendte DeepMind AlphaEvolve,

1:23 en Gemini-agent, der foreslår kode, får den bedømt, beholder vinderne og muterer dem igen. Den multiplicerede fire-gange-fire komplekse matricer i 48 trin, og slog en rekord, Strassen satte i 1969, og den genvinder omkring nul komma syv procent af Googles verdensomspændende computerkraft, hvilket i Googles skala er et datacenter fundet under sofaen. Gemini hjalp nu med at træne Gemini, og udtrykket flyttede stille og roligt fra sikkerheds- blogs til pressemeddelelser. Dream-RSI monterer en controller oven på den loop.

1:52 En politik, et faktisk Python-program, beslutter hvilke grene af søgetræet der skal udvides, hvor mange parallelt, og hvornår man skal give op. Gemini skriver den kandidatkode, og en fast evaluator scorer den. Hver kørsel efterlader et træ over, hvad der blev prøvet, og hvad det scorede. Dette træ bliver en replay-simulator: en anden, lige så frossen Gemini omskriver politikken, og den nye politik testes mod de optagede resultater i stedet for på rigtige GPU'er.

2:16 Papiret kalder dette at drømme, og en rigtig kørsel betaler for tusindvis af drømte uden eksekveringsomkostninger. Vinderen går tilbage online, puljen af optagede verdener vokser, gentag. Og prompten i appendiks B.2 fortæller den selvforbedrende AI, skriftligt: rediger kun denne ene fil, og løs ikke den videnskabelige opgave. Målt. På Lasso-solver-opgaven brugte fast udforskning 550 Gemini-kald til at nå 3,6 sekunder, Dream-RSI brugte 317 til at nå 2,9, og begge slog scikit-learn.

2:46 På KernelBench nåede den samme kernehastighed med cirka 2,4 gange færre generationer. Og på cirkelpakning scorede den 2,6359 83, hvilket præcis, med seks decimaler, er hvad AlphaEvolve version to scorede sidste år. Så X læste titlen: Google har lige knækket rekursiv selvforbedring. Hacker News læste PDF'en: at kalde dette RSI virker misvisende. Og samme uge sagde en konkurrents CEO, at loop'en havde kørt siden sommer og alle burde sætte farten ned.

3:13 Tre sætninger, de samme to ord, tre forskellige maskiner. Så, mandag, hvordan man læser det næste RSI-papir. Én: spørg hvilket objekt der ændrer sig, vægtene, koden eller søgeindstillingerne; Dream-RSI ændrer den tredje. To: spørg hvem der er frossen; her er det koderen, dommeren og omskriveren, alle tre. Tre: spørg hvad overskriftstallet er en enhed for. Gemt computerkraft er optimering; et benchmark modellen ikke kunne nå før er opstarten, og ingen har udgivet den endnu.

3:40 Dom, under motorhjelmen: NEEDS REVIEW. Loop'en er ægte, besparelserne er målt, og de to ord på forsiden beskriver en maskine, der ikke er i papiret. Hvis du hellere vil læse dette end høre mig sige det, lander the diff i din indbakke hver morgen, gratis på the daily diff dot dev, link nedenfor. Fortæl mig, hvad jeg skal åbne op næste gang i kommentarerne. Og det var diff'en for i dag. Jeg er Niko fra Axrisi.

4:00 Sammenfør ansvarligt.

## Kilder

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
