# Rekurzivno samopoboljšanje, ispod haube

Published: 2026-09-18

Google DeepMind objavio je "Dream-RSI: Rekurzivno samopoboljšanje kroz svetove koji se razvijaju" — a model kodiranja unutar njega nikada se ne menja. Ispod haube: šta je fraza značila 60 godina, šta se zapravo ponavlja u Dream-RSI (Python strategija istraživanja koja "sanja" preko zabeleženih stabala pretrage) i zašto je 317 poziva agenta umesto 550 popust, a ne poletanje. Presuda: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/sr-Latn/video/2026-09-18-self-improving-ai/

## Šta ovaj video pokriva

- 1965 → 2008: „eksplozija inteligencije“ I. J. Gooda, seed AI Judkowskog — mašina koja prepisuje sopstvene težine
- 2025: AlphaEvolve — 48-multiplikaciona 4×4 matrična množenja, 0,7% Google-ovog računarskog kapaciteta oporavljeno, Gemini jezgra 23% brža
- 2026: Dream-RSI — politika se poboljšava, koder, sudija i prepravljač su zamrznuti; upit kaže „Ne rešavajte naučni zadatak“
- X: „Google je upravo razbio rekurzivno samopoboljšanje“ (819 sviđanja) vs HN: „nazivati ovo RSI izgleda obmanjujuće“
- Korišćeni brojevi: §4.1 Lasso 550 → 317 poziva agenta, 3587 → 2931 ms; Tabela 1 kružno pakovanje 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× manje generacija, do 2.09× brže; Dodatak B.2 upit (sve iz PDF-a iznad)

## Preveden transkript

Prevedeno sa originalne engleske naracije. Dostupan audio i titlovi kontrolisani su od strane YouTube-a.

0:00 Rekurzivno samopoboljšanje je ideja da veštačka inteligencija čini sebe pametnijom, zatim koristi pametniju sebe da to ponovi, a ove nedelje je Google objavio rad sa te dve reči u naslovu, u kojem se težine modela nikada ne pomeraju. Tri broja. CEO Anthropic-a kaže da se ova petlja vrti od leta, što je njegov razlog da uspori celu industriju. Tviter objava koja najavljuje da je Google upravo to rešio prikupila je osamsto sviđanja za jedan dan.

0:24 A glavni rezultat samog rada je 317 poziva modela umesto 550, što je popust, a ne poletanje. Za tri minuta: odakle je fraza došla, šta se zapravo ponavlja unutar Dream-RSI, i kako čitati sledeći rad sa RSI na naslovnoj strani. Ovo je The Daily Diff, ispod haube. 1965. I. J. Good, statističar iz Bletchley Parka koji je radio pored Tjuringa, piše da bi ultrainteligentna mašina mogla da dizajnira još bolje mašine,

0:52 naziva to eksplozijom inteligencije i poslednjim izumom koji će čovek ikada morati da napravi, pod uslovom da je mašina dovoljno poslušna da nam kaže kako da je kontrolišemo, što je ono „pod uslovom da“ ljudi prestanu da čitaju nakon zareza. Četrdeset godina fraza je značila upravo to: sistem koji uređuje sopstveni izvorni kod ili težine i postaje pametniji svakim prolazom. Esej Eliezera Yudkowskog iz 2008. godine učinio ju je ključnom reči AI bezbednosti, i niko nije imao mašinu na kojoj bi je testirao, što je idealan uslov za definiciju. Zatim je u maju 2025. DeepMind isporučio AlphaEvolve,

1:23 Gemini agenta koji predlaže kod, dobija ocene, zadržava pobednike i ponovo ih mutira. Množio je kompleksne matrice četiri puta četiri u 48 koraka, oborivši Strassenov rekord postavljen 1969. godine, i oporavlja oko nula tačka sedam procenata Google-ovog globalnog računarskog kapaciteta, što je na Google-ovoj skali data centar pronađen ispod sofe. Gemini je sada pomagao u obuci Gemini-ja, i fraza se tiho preselila iz blogova o bezbednosti u saopštenja za štampu. Dream-RSI dodaje kontroler na vrh te petlje.

1:52 Politika, stvarni Python program, odlučuje koje grane stabla pretrage da proširi, koliko paralelno, i kada da odustane. Gemini piše kandidatski kod, a fiksni evaluator ga ocenjuje. Svako pokretanje ostavlja iza sebe stablo onoga što je pokušano i kakvu je ocenu dobilo. To stablo postaje simulator ponavljanja: drugi, podjednako zamrznuti Gemini prepisuje politiku, a nova politika se testira protiv zabeleženih ishoda umesto na pravim GPU-ovima.

2:16 Rad to naziva sanjanjem, i jedno stvarno pokretanje plaća hiljade zamišljenih pokretanja bez troškova izvršenja. Pobednik se vraća na mrežu, bazen zabeleženih svetova raste, ponovi. A upit u Dodatku B.2 govori AI-ju koji se samopoboljšava, pismeno: uredite samo ovu datoteku i ne rešavajte naučni zadatak. Izmereno. Na zadatku rešavača Lasso, fiksno istraživanje je potrošilo 550 Gemini poziva da bi doseglo tri tačke šest sekundi, Dream-RSI je potrošio 317 da bi dosegao dve tačke devet, i oba su pobedila scikit-learn.

2:46 Na KernelBench-u je dostigao istu brzinu jezgra sa oko dva tačke četiri puta manje generacija. A na pakovanju krugova je postigao dva tačke šest tri pet devet osam tri, što je precizno, na šest decimala, ono što je AlphaEvolve verzija dva postigla prošle godine. Tako je X pročitao naslov: Google je upravo razbio rekurzivno samopoboljšanje. Hacker News je pročitao PDF: nazivati ovo RSI čini se obmanjujućim. I iste nedelje CEO konkurenta je rekao da se petlja vrti od leta i da bi svi trebalo da uspore.

3:13 Tri rečenice, iste dve reči, tri različite mašine. Dakle, ponedeljak, kako čitati sledeći RSI rad. Jedno: pitajte koji se objekat menja, težine, kod ili postavke pretrage; Dream-RSI menja treće. Dva: pitajte ko je zamrznut; ovde su to koder, sudija i prepravljač, sva tri. Tri: pitajte šta je naslovni broj jedinica. Ušteda računara je optimizacija; benchmark koji model ranije nije mogao da dostigne je poletanje, i niko to još nije objavio.

3:40 Presuda, ispod haube: NEEDS REVIEW. Petlja je stvarna, uštede su izmerene, a dve reči na naslovnici opisuju mašinu koja nije u radu. Ako biste ovo radije pročitali nego čuli kako ga ja izgovaram, diff stiže u vaše sanduče svakog jutra, besplatno na the daily diff dot dev, link ispod. Recite mi šta da sledeće otvorim u komentarima. I to je diff za danas. Ja sam Niko iz Axrisi.

4:00 Spojite odgovorno.

## Izvori

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
