# Rekurzivno samopoboljšanje, ispod haube

Published: 2026-09-18

Google DeepMind je objavio "Dream-RSI: Rekurzivno samopoboljšanje kroz svjetove koji se razvijaju" — a kodni model unutra se nikada ne mijenja. Ispod haube: što je fraza značila 60 godina, što se zapravo vrti u Dream-RSI-ju (politika istraživanja u Pythonu koja "sanja" preko snimljenih stabala pretraživanja) i zašto je 317 poziva agenta umjesto 550 popust, a ne uzlet. Presuda: POTREBAN PREGLED.

Canonical: https://thedailydiff.dev/bs/video/2026-09-18-self-improving-ai/

## Šta ovaj video pokriva

- 1965 → 2008: I. J. Goodova "eksplozija inteligencije", Yudkowskyjev seed AI — mašina koja prepravlja vlastite težine
- 2025: AlphaEvolve — 48-struko množenje 4×4 matrične množenja, 0,7% Googleovog izračuna oporavljeno, Gemini jezgre 23% brže
- 2026: Dream-RSI — politika se poboljšava, koder, sudija i prepisivač su zamrznuti; uputa kaže "Ne rješavaj naučni zadatak"
- X: "Google je upravo riješio rekurzivno samopoboljšanje" (819 lajkova) vs HN: "nazvati ovo RSI-jem čini se obmanjujućim"
- Korišteni brojevi: §4.1 Lasso 550 → 317 poziva agenta, 3587 → 2931 ms; Tabela 1 pakiranje kruga 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× manje generacija, do 2.09× brže; Dodatak B.2 uputa (sve iz gornjeg PDF-a)

## Prevedeni transkript

Prevedeno iz originalne engleske naracije. Dostupan zvuk i titlovi kontroliše YouTube.

0:00 Rekurzivno samopoboljšanje je ideja da AI sam sebe čini pametnijim, zatim koristi pametnije sebe da to ponovi, a ove sedmice je Google objavio rad s te dvije riječi u naslovu, u kojem se težine modela nikada ne pomjeraju. Tri broja. Izvršni direktor Anthropic-a kaže da se ova petlja vrti od ljeta, što je njegov razlog da uspori cijelu industriju. Tweet koji najavljuje da je Google upravo to riješio skupio je osam stotina lajkova u jednom danu.

0:24 A vlastiti glavni rezultat rada je 317 poziva modela umjesto 550, što je popust, a ne uzlet. U tri minute: odakle fraza, što se zapravo vrti unutar Dream-RSI-ja i kako čitati sljedeći rad s RSI-jem na naslovnici. Ovo je The Daily Diff, ispod haube. 1965. I. J. Good, statističar iz Bletchley Parka koji je radio pored Turinga, piše da ultrainteligentna mašina može dizajnirati još bolje mašine,

0:52 naziva to eksplozijom inteligencije i posljednjim izumom koji čovjek ikada treba napraviti, pod uvjetom da je mašina dovoljno poslušna da nam kaže kako je kontrolisati, što je ono što ljudi prestaju čitati nakon zareza. Četrdeset godina fraza je značila upravo to: sistem koji sam uređuje vlastiti izvor ili težine i izlazi pametniji sa svakim prolazom. Eliézer Yudkowskyjev esej iz 2008. učinio ga je nosivom riječi sigurnosti AI-ja, i niko nije imao mašinu na kojoj bi to testirao, što je idealan uvjet za definiciju. Zatim je u maju 2025. DeepMind isporučio AlphaEvolve,

1:23 Gemini agenta koji predlaže kod, dobiva ocjenu, zadržava pobjednike i mutira ih ponovo. Pomnožio je četiri puta četiri kompleksne matrice u 48 koraka, pobijedivši rekord koji je Strassen postavio 1969. godine, i oporavlja oko nula tačka sedam posto Googleove svjetske računarske snage, što je na Googleovoj skali data centar pronađen ispod kauča. Gemini je sada pomagao u obuci Geminija, a fraza se tiho premjestila iz sigurnosnih blogova u saopštenja za javnost. Dream-RSI dodaje kontroler na vrh te petlje.

1:52 Politika, stvarni Python program, odlučuje koje grane stabla pretraživanja će proširiti, koliko paralelno i kada odustati. Gemini piše kandidatski kod, a fiksni evaluator ga ocjenjuje. Svako pokretanje ostavlja iza sebe stablo onoga što je pokušano i što je ocijenjeno. To stablo postaje simulator ponavljanja: drugi, jednako zamrznuti Gemini prepisuje politiku, a nova politika se testira protiv snimljenih rezultata umjesto na stvarnim GPU-ovima.

2:16 Rad to naziva sanjanjem, a jedno stvarno pokretanje plaća hiljade sanjanih bez troškova izvršenja. Pobjednik se vraća online, skup snimljenih svjetova raste, ponovi. A uputa u Dodatku B.2 govori AI-ju koji se samopoboljšava, pismeno: uredi samo ovu jednu datoteku i ne rješavaj naučni zadatak. Izmjereno. Na zadatku rješavanja Lasso, fiksno istraživanje je potrošilo 550 Gemini poziva da bi doseglo tri tačke šest sekundi, Dream-RSI je potrošio 317 da bi dosegao dvije tačke devet, i oba su pobijedila scikit-learn.

2:46 Na KernelBench-u je postigao istu brzinu jezgre sa oko dva tačka četiri puta manje generacija. A na pakiranju kruga postigao je dvije tačke šest tri pet devet osam tri, što je precizno, na šest decimala, ono što je AlphaEvolve verzija dva postigla prošle godine. Tako je X pročitao naslov: Google je upravo riješio rekurzivno samopoboljšanje. Hacker News je pročitao PDF: nazvati ovo RSI-jem čini se obmanjujućim. A iste sedmice izvršni direktor konkurenta je rekao da se petlja vrti od ljeta i da bi svi trebali usporiti.

3:13 Tri rečenice, iste dvije riječi, tri različite mašine. Dakle, ponedjeljak, kako čitati sljedeći RSI rad. Jedan: pitajte koji se objekt mijenja, težine, kod ili postavke pretraživanja; Dream-RSI mijenja treće. Dva: pitajte ko je zamrznut; ovdje su to koder, sudac i prepisivač, sva tri. Tri: pitajte što je naslovni broj jedinica. Ušteđeni izračun je optimizacija; mjerilo koje model prije nije mogao dostići je uzlet, a niko to još nije objavio.

3:40 Presuda, ispod haube: potreban pregled. Petlja je stvarna, uštede su izmjerene, a dvije riječi na naslovnici opisuju mašinu koja nije u radu. Ako ovo radije čitate nego da me slušate, diff stiže u vaš inbox svako jutro, besplatno na the daily diff dot dev, link ispod. Recite mi što da sljedeće otvorim u komentarima. I to je diff za danas. Ja sam Niko iz Axrisija.

4:00 Spoji odgovorno.

## Izvori

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
