# Рекурзивно само-подобрување, под хауба

Published: 2026-09-18

Google DeepMind објави „Dream-RSI: Рекурзивно само-подобрување преку еволуирачки светови“ — а моделот за кодирање во него никогаш не се менува. Под хауба: што значела фразата 60 години, што всушност се врти во Dream-RSI (политика за истражување на Python која „сонува“ над снимени дрвја за пребарување), и зошто 317 повици до агентот наместо 550 е попуст, а не полетување. Пресуда: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/mk/video/2026-09-18-self-improving-ai/

## Што покрива ова видео

- 1965 → 2008: „Експлозија на интелигенција“ на И. Џ. Гуд, вештачка интелигенција за семе на Јудковски — машина што ги препишува сопствените тежини
- 2025: AlphaEvolve — 48-кратно множење на 4×4 матрица, 0,7% од пресметките на Google се обновени, кернелите на Gemini 23% побрзи
- 2026: Dream-RSI — политиката се подобрува, кодерот, судијата и препишувачот се замрзнати; барањето вели „Не ја решавај научната задача“
- X: „Google штотуку го проби рекурзивното само-подобрување“ (819 лајкови) наспроти HN: „нарекувањето на ова RSI изгледа погрешно“
- Употребени броеви: §4.1 Lasso 550 → 317 повици до агентот, 3587 → 2931 ms; Табела 1 пакување кругови 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× помалку генерации, до 2.09× побрзо; Додаток B.2 барање (сите од горенаведениот PDF)

## Преведен транскрипт

Преведено од оригиналната англиска нарација. Достапното аудио и наслови се контролирани од YouTube.

0:00 Рекурзивното само-подобрување е идеја дека вештачката интелигенција се прави себеси попаметна, потоа го користи попаметното јас за да го направи тоа повторно, а оваа недела Google објави труд со тие два збора во насловот, во кој тежините на моделот никогаш не се менуваат. Три броја. Извршниот директор на Anthropic вели дека оваа јамка работи од летото, што е негова причина да ја забави целата индустрија. Твитот со кој се објавува дека Google штотуку го проби, собра осумстотини лајкови за еден ден.

0:24 А главниот резултат на трудот е 317 повици до моделот наместо 550, што е попуст, а не полетување. За три минути: од каде потекнува фразата, што всушност се врти внатре во Dream-RSI, и како да го прочитате следниот труд со RSI на насловната страница. Ова е The Daily Diff, под хауба. 1965. И. Џ. Гуд, статистичар од Блечли Парк кој работел до Тјуринг, пишува дека ултраинтелигентна машина би можела да дизајнира уште подобри машини,

0:52 ја нарекува експлозија на интелигенција и последен изум што човекот некогаш треба да го направи, под услов машината да биде доволно послушна за да ни каже како да ја контролираме, што е под-услов што луѓето престануваат да го читаат по запирката. Четириесет години фразата значела токму тоа: систем кој го уредува сопствениот изворен код или тежини и излегува попаметен при секое поминување. Есејот на Елиезер Јудковски од 2008 година го направи клучен збор за безбедноста на вештачката интелигенција, и никој немаше машина на која да го тестира, што е идеална состојба за дефиниција. Потоа, во мај 2025 година DeepMind го испорача AlphaEvolve,

1:23 агент на Gemini кој предлага код, добива оценка, ги задржува победниците и ги мутира повторно. Помножи четири-по-четири комплексни матрици во 48 чекори, соборувајќи го рекордот што го постави Штрасен во 1969 година, и обновува околу нула точка седум проценти од светските компјутерски ресурси на Google, што на скалата на Google е дата центар пронајден под каучот. Gemini сега помагаше во обуката на Gemini, и фразата тивко се пресели од блоговите за безбедност во соопштенија за печатот. Dream-RSI додава контролер на врвот на таа јамка.

1:52 Политика, вистинска програма на Python, одлучува кои гранки од дрвото за пребарување да се прошират, колку паралелно, и кога да се откаже. Gemini го пишува кодот на кандидатот, а фиксен евалуатор го оценува. Секое извршување остава зад себе дрво од она што беше пробано и колку е оценето. Тоа дрво станува симулатор за повторување: втор, исто така замрзнат Gemini ја препишува политиката, и новата политика се тестира според снимените исходи наместо на вистински GPU-а.

2:16 Трудот ова го нарекува сонување, и едно вистинско извршување плаќа за илјадници сонувани без трошоци за извршување. Победникот се враќа онлајн, базенот на снимени светови расте, повторувај. А барањето во Додаток Б.2 ѝ кажува на само-подобрувачката вештачка интелигенција, во писмена форма: уредете ја само оваа датотека и не ја решавајте научната задача. Измерено. На задачата за решавање на Lasso, фиксното истражување потроши 550 повици до Gemini за да достигне три точка шест секунди, Dream-RSI потроши 317 за да достигне две точка девет, и двете го надминаа scikit-learn.

2:46 На KernelBench достигна иста брзина на кернелот со околу два точка четири пати помалку генерации. А на пакување кругови постигна два точка шест три пет девет осум три, што е прецизно, до шест децимали, она што AlphaEvolve верзија два го постигна минатата година. Значи X го прочита насловот: Google штотуку го проби рекурзивното само-подобрување. Hacker News го прочита PDF-от: нарекувањето на ова RSI изгледа погрешно. И истата недела извршниот директор на конкурент рече дека јамката работи од летото и сите треба да забават.

3:13 Три реченици, истите два збора, три различни машини. Значи, понеделник, како да се прочита следниот труд за RSI. Еден: прашајте кој објект се менува, тежините, кодот или поставките за пребарување; Dream-RSI ја менува третата. Два: прашајте кој е замрзнат; овде тоа се кодерот, судијата и препишувачот, сите тројца. Три: прашајте која е единицата на главниот број. Заштедените компјутерски ресурси се оптимизација; репер што моделот не можеше да го достигне претходно е полетувањето, и никој сè уште не го објавил тоа.

3:40 Пресуда, под хауба: потребно е прегледување. Јамката е реална, заштедите се измерени, а двата збора на насловната страница опишуваат машина што не е во трудот. Ако повеќе сакате да го прочитате ова отколку да ме слушнете како го кажувам, „diff“ пристигнува во вашето сандаче секое утро, бесплатно на the daily diff dot dev, линк подолу. Кажете ми што следно да отворам во коментарите. И тоа е „diff“-от за денес. Јас сум Нико од Axrisi.

4:00 Спојувајте одговорно.

## Извори

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
