Rekurzívne samozdokonaľovanie, pod pokrievkou
Google DeepMind publikoval "Dream-RSI: Rekurzívne samovylepšovanie cez vyvíjajúce sa svety" – a kódovací model v ňom sa nikdy nemení.
Google DeepMind publikoval "Dream-RSI: Rekurzívne samovylepšovanie cez vyvíjajúce sa svety" – a kódovací model v ňom sa nikdy nemení. Pod pokrievkou: čo táto fráza znamenala 60 rokov, čo sa v Dream-RSI skutočne opakuje (politika prieskumu v Pythone, ktorá "sníva" nad zaznamenanými vyhľadávacími stromami) a prečo je 317 volaní agenta namiesto 550 zľava, nie vzlet. Verdikt: NEEDS REVIEW.
Prečítajte si písanú edíciu (anglicky) ↗
Čo toto video pokrýva
- 1965 → 2008: „Explózia inteligencie“ od I. J. Gooda, seed AI od Yudkowského — stroj, ktorý prepisuje vlastné váhy
- 2025: AlphaEvolve — 48-násobné násobenie matice 4×4, 0,7 % výpočtového výkonu Google vrátených, Gemini jadrá o 23 % rýchlejšie
- 2026: Dream-RSI — politika sa zlepšuje, koder, posudzovateľ a prepisovač sú zmrazení; výzva hovorí „Neriešte vedeckú úlohu“
- X: „Google práve prelomil rekurzívne samovylepšovanie“ (819 lajkov) vs HN: „nazývať to RSI sa zdá zavádzajúce“
- Použité čísla: §4.1 Lasso 550 → 317 volaní agenta, 3587 → 2931 ms; Tabuľka 1 kruhové balenie 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× menej generácií, až 2.09× rýchlejšie; Príloha B.2 výzva (všetko z vyššie uvedeného PDF)
Preložený prepis
Preložené z pôvodného anglického rozprávania. Dostupný zvuk a titulky sú kontrolované službou YouTube.
0:00 Rekurzívne samovylepšovanie je myšlienka, že AI sa sama stane múdrejšou, potom použije múdrejšie ja, aby to urobila znova, a tento týždeň Google publikoval článok s týmito dvoma slovami v názve, v ktorom sa váhy modelu nikdy nepohybujú. Tri čísla. Generálny riaditeľ Anthropicu hovorí, že táto slučka beží od leta, čo je jeho dôvod na spomalenie celého odvetvia. Tweet oznamujúci, že Google to práve prelúskol, nazbieral osemsto lajkov za deň.
0:24 A vlastný hlavný výsledok článku je 317 volaní modelu namiesto 550, čo je zľava, nie vzlet. Za tri minúty: odkiaľ táto fráza pochádza, čo sa skutočne opakuje vnútri Dream-RSI a ako čítať ďalší článok s RSI na obálke. Toto je The Daily Diff, pod pokrievkou. 1965. I. J. Good, štatistik z Bletchley Parku, ktorý pracoval vedľa Turinga, píše, že ultra-inteligentný stroj by mohol navrhnúť ešte lepšie stroje,
0:52 nazýva to explóziou inteligencie a posledným vynálezom, ktorý človek kedy bude potrebovať, za predpokladu, že stroj je dostatočne poslušný, aby nám povedal, ako ho ovládať, čo je to 'za predpokladu, že' ľudia prestanú čítať po čiarke. Po štyridsať rokov táto fráza znamenala presne to: systém, ktorý upravuje vlastný zdroj alebo váhy a po každom prechode je múdrejší. Esej Eliezer Yudkowského z roku 2008 z nej urobila kľúčové slovo bezpečnosti AI, a nikto nemal stroj na testovanie, čo je ideálna podmienka pre definíciu. Potom v máji 2025 DeepMind vydal AlphaEvolve,
1:23 agenta Gemini, ktorý navrhuje kód, nechá ho ohodnotiť, ponechá víťazov a mutuje ich znova. Násobil komplexné matice štyri krát štyri v 48 krokoch, prekonal rekord, ktorý Strassen stanovil v roku 1969, a získava späť asi nula celá sedem desatín percenta celosvetového výpočtového výkonu Google, čo v rozsahu Google je dátové centrum nájdené pod pohovkou. Gemini teraz pomáhalo trénovať Gemini, a fráza sa potichu presunula z blogov o bezpečnosti do tlačových správ. Dream-RSI pripája k tejto slučke ovládač.
1:52 Politika, skutočný program v Pythone, rozhoduje, ktoré vetvy vyhľadávacieho stromu rozšíriť, koľko ich bude paralelne a kedy sa vzdať. Gemini píše kandidátsky kód a pevný hodnotiteľ ho boduje. Každý beh zanecháva strom toho, čo bolo vyskúšané a aké skóre dosiahlo. Tento strom sa stáva simulátorom prehrávania: druhý, rovnako zmrazený Gemini prepisuje politiku a nová politika sa testuje proti zaznamenaným výsledkom namiesto na skutočných GPU.
2:16 Článok to nazýva snívaním a jeden skutočný beh zaplatí za tisíce vysnívaných s nulovými nákladmi na vykonanie. Víťaz sa vracia online, skupina zaznamenaných svetov rastie, opakovať. A výzva v Dodatku B.2 hovorí samovylepšujúcej sa AI, písomne: upravte len tento jeden súbor a neriešte vedeckú úlohu. Zmerané. Pri úlohe riešiča Lasso, pevný prieskum spotreboval 550 volaní Gemini na dosiahnutie troch celých šesť desatín sekundy, Dream-RSI spotreboval 317 na dosiahnutie dvoch celých deväť desatín, a oba prekonali scikit-learn.
2:46 Na KernelBench dosiahol rovnakú rýchlosť jadra s približne dvoma celými štyri desatiny menej generácií. A pri balení kruhov dosiahol skóre dve celé šesť tri päť deväť osem tri, čo je presne, na šesť desatinných miest, to, čo AlphaEvolve verzia dva dosiahol minulý rok. Takže X si prečítal titul: Google práve prelomil rekurzívne samovylepšovanie. Hacker News si prečítal PDF: nazývať to RSI sa zdá zavádzajúce. A v ten istý týždeň generálny riaditeľ konkurenta povedal, že slučka beží od leta a všetci by mali spomaliť.
3:13 Tri vety, tie isté dve slová, tri rôzne stroje. Takže, pondelok, ako čítať ďalší RSI článok. Jedna: spýtajte sa, ktorý objekt sa mení, váhy, kód alebo nastavenia vyhľadávania; Dream-RSI mení tretí. Dva: spýtajte sa, kto je zamrznutý; tu je to koder, sudca a prepisovač, všetci traja. Tri: spýtajte sa, čo je jednotkou hlavného čísla. Ušetrený výpočtový výkon je optimalizácia; benchmark, ktorý model predtým nedosiahol, je vzlet, a to zatiaľ nikto nepublikoval.
3:40 Verdikt, pod pokrievkou: NEEDS REVIEW. Slučka je reálna, úspory sú merané a dve slová na obálke popisujú stroj, ktorý v článku nie je. Ak si to radšej prečítate, než aby ste ma počuli hovoriť, diff vám príde do schránky každé ráno, zadarmo na the daily diff dot dev, odkaz nižšie. Povedzte mi v komentároch, čo mám otvoriť nabudúce. A to je dnešný diff. Som Niko z Axrisi.
4:00 Spojte zodpovedne.
Zdroje
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



