Rekursiv selvforbedring, under panseret
Google DeepMind publiserte "Dream-RSI: Rekursiv selvforbedring gjennom utviklende verdener" – og kodingsmodellen inni den endres aldri.
Google DeepMind publiserte "Dream-RSI: Rekursiv selvforbedring gjennom utviklende verdener" – og kodingsmodellen inni den endres aldri. Under panseret: hva uttrykket har betydd i 60 år, hva som faktisk looper i Dream-RSI (en Python-utforskningspolicy som "drømmer" over innspilte søketrær), og hvorfor 317 agentkall i stedet for 550 er en rabatt, ikke en takeoff. Dom: NEEDS REVIEW.
Les den skriftlige utgaven (engelsk) ↗
Hva denne videoen dekker
- 1965 → 2008: I. J. Goods "intelligenseksplosjon", Yudkowskys seed AI – en maskin som omskriver sine egne vekter
- 2025: AlphaEvolve – 48-multiplikasjon 4×4 matrise multiplikasjon, 0,7 % av Googles datakraft gjenvunnet, Gemini-kjerner 23 % raskere
- 2026: Dream-RSI – policyen forbedres, koderen, dommeren og omskriveren er alle frosne; instruksjonen sier "Ikke løs den vitenskapelige oppgaven"
- X: "Google har nettopp knekt rekursiv selvforbedring" (819 likerklikk) vs HN: "å kalle dette RSI virker misvisende"
- Brukte tall: §4.1 Lasso 550 → 317 agentkall, 3587 → 2931 ms; Tabell 1 sirkelpakking 2,635983 = AlphaEvolveV2; §4.3 KernelBench 2,43× / 1,79× færre generasjoner, opptil 2,09× raskere; Appendix B.2 instruksjon (alt fra PDF-en ovenfor)
Oversatt transkripsjon
Oversatt fra den originale engelske fortellingen. Tilgjengelig lyd og undertekster kontrolleres av YouTube.
0:00 Rekursiv selvforbedring er ideen om at en AI gjør seg selv smartere, og deretter bruker den smartere versjonen til å gjøre det igjen, og denne uken publiserte Google en artikkel med disse to ordene i tittelen, hvor modellens vekter aldri beveger seg. Tre tall. Anthropic's administrerende direktør sier at denne loopen har kjørt siden sommeren, som er hans grunn til å bremse hele bransjen. Tweeten som kunngjorde at Google nettopp hadde knekt det, samlet åtte hundre likerklikk på en dag.
0:24 Og papirets eget hovedresultat er 317 modellkall i stedet for 550, som er en rabatt, ikke en takeoff. På tre minutter: hvor uttrykket kom fra, hva som faktisk looper inne i Dream-RSI, og hvordan man leser den neste artikkelen med RSI på omslaget. Dette er The Daily Diff, under panseret. 1965. I. J. Good, en statistiker fra Bletchley Park som jobbet ved siden av Turing, skriver at en ultraintelligent maskin kunne designe enda bedre maskiner,
0:52 kaller det en intelligenseksplosjon og den siste oppfinnelsen mennesket noensinne trenger å gjøre, forutsatt at maskinen er føyelig nok til å fortelle oss hvordan vi skal kontrollere den, som er den forutsatt-at folk slutter å lese etter kommaet. I førti år betydde uttrykket nøyaktig det: et system som redigerer sin egen kildekode eller vekter og kommer ut smartere for hver gjennomkjøring. Eliezer Yudkowskys essay fra 2008 gjorde det til bærebjelken i AI-sikkerhet, og ingen hadde en maskin å teste det på, noe som er den ideelle betingelsen for en definisjon. Så i mai 2025 lanserte DeepMind AlphaEvolve,
1:23 en Gemini-agent som foreslår kode, får den vurdert, beholder vinnerne og muterer dem igjen. Den multipliserte fire-gangen-fire komplekse matriser i 48 trinn, og slo en rekord Strassen satte i 1969, og den gjenoppretter omtrent null komma syv prosent av Googles verdensomspennende datakraft, som i Googles skala er et datasenter funnet under sofaen. Gemini hjalp nå til med å trene Gemini, og uttrykket flyttet stille fra sikkerhetsblogger til pressemeldinger. Dream-RSI fester en kontroller på toppen av den loopen.
1:52 En policy, et faktisk Python-program, bestemmer hvilke grener av søketreet som skal utvides, hvor mange parallelt, og når man skal gi opp. Gemini skriver kandidatkoden, og en fast evaluator vurderer den. Hver kjøring etterlater seg et tre av hva som ble prøvd og hva det scoret. Det treet blir en avspillingssimulator: en annen, like frosset Gemini omskriver policyen, og den nye policyen testes mot de innspilte resultatene i stedet for på ekte GPU-er.
2:16 Artikkelen kaller dette drømming, og én ekte kjøring betaler for tusenvis av drømte kjøringer til null utførelseskostnad. Vinneren går tilbake på nett, poolen av innspilte verdener vokser, gjenta. Og instruksjonen i Appendix B.2 forteller den selvforbedrende AI-en, skriftlig: rediger bare denne ene filen, og ikke løs den vitenskapelige oppgaven. Målt. På Lasso-løseroppgaven brukte fast utforskning 550 Gemini-kall for å nå tre komma seks sekunder, Dream-RSI brukte 317 for å nå to komma ni, og begge slo scikit-learn.
2:46 På KernelBench oppnådde den samme kjernehastighet med omtrent to komma fire ganger færre generasjoner. Og på sirkelpakking scoret den to komma seks tre fem ni åtte tre, som er nøyaktig, til seks desimaler, hva AlphaEvolve versjon to scoret i fjor. Så X leste tittelen: Google har nettopp knekt rekursiv selvforbedring. Hacker News leste PDF-en: å kalle dette RSI virker misvisende. Og samme uke sa en konkurrents administrerende direktør at loopen hadde kjørt siden sommeren og alle burde bremse ned.
3:13 Tre setninger, de samme to ordene, tre forskjellige maskiner. Så, mandag, hvordan lese den neste RSI-artikkelen. Én: spør hvilket objekt som endres, vektene, koden eller søkeinnstillingene; Dream-RSI endrer den tredje. To: spør hvem som er frosset; her er det koderen, dommeren og omskriveren, alle tre. Tre: spør hva hovedtallet er en enhet av. Spart datakraft er optimering; en benchmark modellen ikke kunne nå før er takeoff, og ingen har publisert den ennå.
3:40 Dom, under panseret: NEEDS REVIEW. Loopen er reell, besparelsene er målt, og de to ordene på omslaget beskriver en maskin som ikke er i artikkelen. Hvis du heller vil lese dette enn å høre meg si det, lander the diff i innboksen din hver morgen, gratis på thedailydiff.dev, lenke nedenfor. Fortell meg hva jeg skal åpne neste gang i kommentarene. Og det er the diff for i dag. Jeg er Niko fra Axrisi.
4:00 Slå sammen ansvarlig.
Kilder
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



