+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Rekurzivno samopoboljšanje, ispod haube

Google DeepMind objavio je "Dream-RSI: Rekurzivno samopoboljšanje kroz evoluirajuće svjetove" — a unutar njega se model kodiranja nikada ne mijenja.

Google DeepMind objavio je "Dream-RSI: Rekurzivno samopoboljšanje kroz evoluirajuće svjetove" — a unutar njega se model kodiranja nikada ne mijenja. Ispod haube: što je fraza značila 60 godina, što se zapravo petlja u Dream-RSI (Python politika istraživanja koja "sanja" preko snimljenih stabala pretraživanja) i zašto je 317 poziva agenta umjesto 550 popust, a ne uzlet. Presuda: POTREBAN PREGLED.

Pročitajte pisano izdanje (engleski) ↗

Što ovaj video pokriva

  • 1965. → 2008.: I. J. Goodova "eksplozija inteligencije", Yudkowskyjev temeljni AI — stroj koji prepisuje vlastite težine
  • 2025.: AlphaEvolve — 48-struko množenje matrica 4×4, 0.7% Googleove računalne snage oporavljeno, Gemini jezgre 23% brže
  • 2026.: Dream-RSI — politika se poboljšava, koder, sudac i prepisivač su svi zamrznuti; uputa kaže "Ne rješavaj znanstveni zadatak"
  • X: "Google je upravo riješio rekurzivno samopoboljšanje" (819 lajkova) vs HN: "nazivati ovo RSI-jem čini se pogrešno"
  • Korišteni brojevi: §4.1 Lasso 550 → 317 poziva agenta, 3587 → 2931 ms; Tablica 1 kružno pakiranje 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× manje generacija, do 2.09× brže; Dodatak B.2 uputa (sve iz gornjeg PDF-a)

Prevedeni transkript

Prevedeno iz izvornog engleskog pripovijedanja. Dostupni zvuk i titlovi kontroliraju se putem YouTubea.

0:00 Rekurzivno samopoboljšanje je ideja da se AI sam čini pametnijim, zatim koristi pametnijeg sebe da to učini ponovno, a ovog je tjedna Google objavio rad s te dvije riječi u naslovu, u kojem se težine modela nikada ne pomjeraju. Tri broja. Izvršni direktor Anthropic-a kaže da se ova petlja vrti od ljeta, što je njegov razlog da uspori cijelu industriju. Tweet koji objavljuje da je Google to upravo riješio skupio je osam stotina lajkova u danu.

0:24 A glavni rezultat samog rada je 317 poziva modela umjesto 550, što je popust, a ne uzlet. U tri minute: odakle je fraza došla, što se zapravo petlja unutar Dream-RSI-ja, i kako čitati sljedeći rad s RSI-jem na naslovnici. Ovo je The Daily Diff, ispod haube. 1965. I. J. Good, statističar iz Bletchley Parka koji je radio pored Turinga, piše da bi ultrainteligentni stroj mogao dizajnirati još bolje strojeve,

0:52 naziva to eksplozijom inteligencije i posljednjim izumom koji čovjek ikada treba napraviti, pod uvjetom da je stroj dovoljno poslušan da nam kaže kako ga kontrolirati, što je ono 'pod uvjetom da' što ljudi prestaju čitati nakon zareza. Četrdeset godina fraza je značila upravo to: sustav koji uređuje vlastiti izvor ili težine i postaje pametniji sa svakim prolaskom. Eliezer Yudkowskyjev esej iz 2008. učinio ju je nosećom riječi AI sigurnosti, i nitko nije imao stroj na kojem bi je testirao, što je idealan uvjet za definiciju. Zatim je u svibnju 2025. DeepMind isporučio AlphaEvolve,

1:23 Gemini agent koji predlaže kod, dobiva ocjenu, zadržava pobjednike i mutira ih ponovno. Množio je četiri puta četiri složene matrice u 48 koraka, pobijedivši rekord koji je Strassen postavio 1969., i oporavlja oko nula točka sedam posto Googleove računalne snage širom svijeta, što je na Googleovoj razini podatkovni centar pronađen ispod kauča. Gemini je sada pomagao trenirati Gemini, a fraza se tiho preselila iz sigurnosnih blogova u priopćenja za javnost. Dream-RSI pričvršćuje kontroler na vrh te petlje.

1:52 Politika, stvarni Python program, odlučuje koje grane stabla pretraživanja će proširiti, koliko paralelno, i kada odustati. Gemini piše kandidatski kod, a fiksni evaluator ga ocjenjuje. Svako izvođenje ostavlja za sobom stablo onoga što je pokušano i kako je ocijenjeno. To stablo postaje simulator ponavljanja: drugi, jednako zamrznuti Gemini prepisuje politiku, a nova politika se testira protiv snimljenih ishoda umjesto na stvarnim GPU-ovima.

2:16 Rad to naziva sanjanjem, a jedno stvarno izvođenje plaća za tisuće sanjanih bez troškova izvršenja. Pobjednik se vraća na internet, bazen snimljenih svjetova raste, ponovi. I uputa u Dodatku B.2 govori AI-u koji se sam poboljšava, u pisanom obliku: uredi samo ovu datoteku i ne rješavaj znanstveni zadatak. Izmjereno. Na zadatku Lasso rješavača, fiksno istraživanje je potrošilo 550 Gemini poziva da bi dosegnulo tri točka šest sekundi, Dream-RSI je potrošio 317 da bi dosegnuo dvije točka devet, i oboje su pobijedili scikit-learn.

2:46 Na KernelBenchu je dosegao istu brzinu jezgre s oko dva točka četiri puta manje generacija. A na pakiranju krugova postigao je dva točka šest tri pet devet osam tri, što je precizno, na šest decimala, ono što je AlphaEvolve verzija dva postigla prošle godine. Dakle, X je pročitao naslov: Google je upravo riješio rekurzivno samopoboljšanje. Hacker News je pročitao PDF: nazivati ovo RSI-jem čini se pogrešno. I istog tjedna izvršni direktor konkurenta rekao je da se petlja vrti od ljeta i da bi svi trebali usporiti.

3:13 Tri rečenice, iste dvije riječi, tri različita stroja. Dakle, ponedjeljak, kako čitati sljedeći RSI rad. Jedan: pitajte koji se objekt mijenja, težine, kod ili postavke pretraživanja; Dream-RSI mijenja treće. Dva: pitajte tko je zamrznut; ovdje su to koder, sudac i prepisivač, sva trojica. Tri: pitajte čega je jedinica glavni broj. Ušteđena računalna snaga je optimizacija; mjerilo koje model prije nije mogao doseći je uzlet, i nitko to još nije objavio.

3:40 Presuda, ispod haube: POTREBAN PREGLED. Petlja je stvarna, uštede su izmjerene, a dvije riječi na naslovnici opisuju stroj koji nije u radu. Ako ovo radije čitate nego čujete, diff vam stiže u inbox svako jutro, besplatno na the daily diff dot dev, link ispod. Recite mi što da sljedeće otvorim u komentarima. I to je diff za danas. Ja sam Niko iz Axrisija.

4:00 Spojite odgovorno.

Izvori

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Povezani videozapisi