# Рекурзивно самопобољшање, испод хаубе

Published: 2026-09-18

Google DeepMind је објавио "Dream-RSI: Рекурзивно самопобољшање кроз еволуирајуће светове" — а модел кодирања у њему се никада не мења. Испод хаубе: шта је фраза значила 60 година, шта се заправо понавља у Dream-RSI (Python политика истраживања која "сања" над снимљеним стаблима претраге) и зашто је 317 позива агента уместо 550 попуст, а не полетање. Пресуда: ПОТРЕБНА ПРОВЕРА.

Canonical: https://thedailydiff.dev/sr/video/2026-09-18-self-improving-ai/

## Шта овај видео покрива

- 1965 → 2008: И. Џ. Гудова "интелигентна експлозија", Јудковскијева основна вештачка интелигенција — машина која преписује сопствене тежине
- 2025: AlphaEvolve — 48-струко множење матрица 4×4, 0,7% Гоогле-ове рачунарске снаге опорављено, Gemini кернели 23% бржи
- 2026: Dream-RSI — политика се побољшава, кодер, судија и преписивач су замрзнути; упутство каже "Не решавај научни задатак"
- X: "Google је управо провалио рекурзивно самопобољшање" (819 лајкова) наспрам HN: "називати ово RSI-јем изгледа обмањујуће"
- Коришћени бројеви: §4.1 Ласо 550 → 317 позива агента, 3587 → 2931 мс; Табела 1 паковање кругова 2.635983 = AlphaEvolveV2; §4.3 КернелБенцх 2.43× / 1.79× мање генерација, до 2.09× брже; Додатак Б.2 упутство (све из горњег PDF-а)

## Преведени транскрипт

Преведено са оригиналне енглеске нарације. Доступни аудио и титлови контролисани су од стране YouTube-а.

0:00 Рекурзивно самопобољшање је идеја да вештачка интелигенција чини себе паметнијом, затим користи паметније себе да то поново уради, и ове недеље је Гугл објавио рад са те две речи у наслову, у коме се тежине модела никада не померају. Три броја. Извршни директор Anthropic-а каже да ова петља ради од лета, што је његов разлог да успори целу индустрију. Твит који најављује да је Гугл управо то провалио прикупио је осамсто лајкова за један дан.

0:24 А главни резултат самог рада је 317 позива модела уместо 550, што је попуст, а не полетање. За три минута: одакле фраза потиче, шта се заправо понавља унутар Dream-RSI-ја, и како читати следећи рад са RSI-јем на насловници. Ово је The Daily Diff, испод хаубе. 1965. И. Џ. Гуд, статистичар из Блетчли Парка који је радио поред Тјуринга, пише да ултраинтелигентна машина може дизајнирати још боље машине,

0:52 назива то експлозијом интелигенције и последњим изумом који човек икада треба да направи, под условом да је машина довољно покорна да нам каже како да је контролишемо, што је оно што људи престају да читају после запете. Четрдесет година фраза је значила управо то: систем који уређује сопствени извор или тежине и постаје паметнији сваким проласком. Есеј Елиезера Јудковског из 2008. учинио је то кључном речју безбедности вештачке интелигенције, и нико није имао машину на којој би то тестирао, што је идеално стање за дефиницију. Затим је у мају 2025. DeepMind објавио AlphaEvolve,

1:23 Gemini агента који предлаже код, добија оцену, задржава победнике и мутира их поново. Множио је четири-по-четири комплексне матрице у 48 корака, победивши рекорд који је поставио Штрасен 1969. године, и опоравља око нула тачка седам посто Гугловог светског рачунарства, што на Гугловој скали је дата центар пронађен испод софе. Gemini је сада помагао у обуци Gemini-ја, и фраза се тихо преселила из безбедносних блогова у саопштења за штампу. Dream-RSI поставља контролер на врх те петље.

1:52 Политика, стварни Python програм, одлучује које гране стабла претраге да прошири, колико паралелно, и када да одустане. Gemini пише кандидатски код, а фиксни евалуатор га оцењује. Свако покретање оставља за собом стабло онога што је покушано и како је оцењено. То стабло постаје симулатор репродукције: други, једнако замрзнути Gemini преписује политику, а нова политика се тестира према снимљеним исходима уместо на стварним графичким процесорима.

2:16 Рад ово назива сањањем, и једно стварно покретање плаћа хиљаде сањаних покретања без трошкова извршавања. Победник се враћа на мрежу, базен снимљених светова расте, понављајте. А упутство у Додатку Б.2 говори вештачкој интелигенцији која се самопобољшава, писмено: уреди само ову датотеку, и не решавај научни задатак. Измерено. На задатку Lasso солвера, фиксна истрага је потрошила 550 Gemini позива да достигне три тачка шест секунди, Dream-RSI је потрошио 317 да достигне две тачка девет, и оба су победила scikit-learn.

2:46 На KernelBench-у је достигао исту брзину кернела са око два тачка четири пута мање генерација. А на паковању кругова постигао је два тачка шест три пет девет осам три, што је прецизно, на шест децимала, оно што је AlphaEvolve верзија два постигла прошле године. Дакле, X је прочитао наслов: Google је управо провалио рекурзивно самопобољшање. Hacker News је прочитао PDF: називање овог RSI-јем изгледа обмањујуће. И исте недеље је извршни директор конкурента рекао да петља ради од лета и да сви треба да успоре.

3:13 Три реченице, исте две речи, три различите машине. Дакле, понедељак, како читати следећи RSI рад. Један: питајте који објекат се мења, тежине, код или подешавања претраге; Dream-RSI мења трећи. Два: питајте ко је замрзнут; овде су то кодер, судија и преписивач, сва тројица. Три: питајте шта је главни број јединица. Уштеда рачунара је оптимизација; репер који модел претходно није могао да достигне је полетање, и нико то још није објавио.

3:40 Пресуда, испод хаубе: потребна провера. Петља је стварна, уштеде су измерене, а две речи на насловници описују машину која није у раду. Ако бисте радије ово прочитали него да чујете како ја то говорим, разлика вам стиже у инбокс сваког јутра, бесплатно на the daily diff dot dev, линк испод. Реците ми шта да следеће отворим у коментарима. И то је разлика за данас. Ја сам Нико из Axrisi-ја.

4:00 Спајајте одговорно.

## Извори

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
