# Рекурсивно самоусъвършенстване, под капака

Published: 2026-09-18

Google DeepMind публикува „Dream-RSI: Рекурсивно самоусъвършенстване чрез развиващи се светове“ — и моделът за кодиране в него никога не се променя. Под капака: какво означава фразата в продължение на 60 години, какво всъщност се повтаря в Dream-RSI (политика за изследване на Python, която „сънува“ върху записани дървета за търсене) и защо 317 извиквания на агенти вместо 550 е отстъпка, а не излитане. Присъда: НЕОБХОДИМ Е ПРЕГЛЕД.

Canonical: https://thedailydiff.dev/bg/video/2026-09-18-self-improving-ai/

## Какво обхваща този видеоклип

- 1965 → 2008: „интелигентна експлозия“ на И. Дж. Гуд, изкуствен интелект на Юдковски — машина, която пренаписва собствените си тежести
- 2025: AlphaEvolve — 48-умножение 4×4 матрично умножение, 0.7% от изчислителната мощност на Google е възстановена, ядрата на Gemini са 23% по-бързи
- 2026: Dream-RSI — политиката се подобрява, кодерът, съдията и пренаписвачът са замразени; подканата гласи „Не решавайте научната задача“
- X: „Google току-що разби рекурсивното самоусъвършенстване“ (819 харесвания) срещу HN: „наричането на това RSI изглежда подвеждащо“
- Използвани числа: §4.1 Lasso 550 → 317 извиквания на агенти, 3587 → 2931 ms; Таблица 1 кръгово опаковане 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× по-малко поколения, до 2.09× по-бързо; Приложение Б.2 подкана (всички от PDF-а по-горе)

## Преведен препис

Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.

0:00 Рекурсивното самоусъвършенстване е идеята, че изкуственият интелект става по-умен, след което използва по-умното си аз, за да го направи отново, и тази седмица Google публикува доклад с тези две думи в заглавието, в който тежестите на модела никога не се движат. Три числа. Главният изпълнителен директор на Anthropic казва, че този цикъл работи от лятото, което е неговата причина да забави цялата индустрия. Туитът, обявяващ, че Google току-що го е разбил, събра осемстотин харесвания за един ден.

0:24 И основният резултат от доклада е 317 извиквания на модела вместо 550, което е отстъпка, а не излитане. За три минути: откъде идва фразата, какво всъщност се повтаря вътре в Dream-RSI и как да прочетете следващия доклад с RSI на корицата. Това е The Daily Diff, под капака. 1965 г. И. Дж. Гуд, статистик от Блечли Парк, който е работил до Тюринг, пише, че една ултраинтелигентна машина може да проектира още по-добри машини,

0:52 нарича го интелигентна експлозия и последното изобретение, което човек някога ще направи, при условие че машината е достатъчно покорна, за да ни каже как да я контролираме, което е това „при условие, че“ хората спират да четат след запетаята. В продължение на четиридесет години фразата означаваше точно това: система, която редактира собствения си изходен код или тежести и става по-умна при всеки пропуск. Есето на Елиезер Юдковски от 2008 г. го направи опорна дума за безопасността на ИИ, и никой не разполагаше с машина, върху която да го тества, което е идеалното условие за дефиниция. След това през май 2025 г. DeepMind пусна AlphaEvolve,

1:23 агент на Gemini, който предлага код, получава оценка, запазва победителите и ги мутира отново. Той умножава четири на четири комплексни матрици в 48 стъпки, побеждавайки рекорд, поставен от Щрасен през 1969 г., и възстановява около нула цяло и седем процента от световната изчислителна мощност на Google, което в мащаба на Google е център за данни, намерен под дивана. Gemini вече помагаше за обучението на Gemini, а фразата тихо се премести от блогове за безопасност в прессъобщения. Dream-RSI прикрепя контролер върху този цикъл.

1:52 Политика, действителна програма на Python, решава кои разклонения на дървото за търсене да разшири, колко паралелно и кога да се откаже. Gemini пише кандидатския код, а фиксиран оценител го оценява. Всяко изпълнение оставя след себе си дърво от това, което е било опитано и какво е било оценено. Това дърво става симулатор за повторение: втори, също така замразен Gemini пренаписва политиката, а новата политика се тества спрямо записаните резултати вместо върху реални GPU-та.

2:16 Докладът нарича това сънуване, и едно реално изпълнение плаща за хиляди сънувани такива с нулева цена на изпълнение. Победителят се връща онлайн, пулът от записани светове расте, повтаря се. И подканата в Приложение Б.2 казва на самоусъвършенстващия се ИИ, писмено: редактирайте само този файл и не решавайте научната задача. Измерено. При задачата за решаване на Lasso, фиксираното изследване е използвало 550 извиквания на Gemini, за да достигне три цяло и шест секунди, Dream-RSI е използвал 317, за да достигне две цяло и девет, и двете победиха scikit-learn.

2:46 При KernelBench достигна същата скорост на ядрото с около два цяло и четири пъти по-малко поколения. А при опаковане на кръгове постигна резултат две цяло шест три пет девет осем три, което е точно, до шест десетични знака, каквото AlphaEvolve версия две постигна миналата година. Така че X прочете заглавието: Google току-що разби рекурсивното самоусъвършенстване. Hacker News прочете PDF-а: наричането на това RSI изглежда подвеждащо. И същата седмица изпълнителен директор на конкурентна фирма каза, че цикълът работи от лятото и всички трябва да забавят темпото.

3:13 Три изречения, същите две думи, три различни машини. И така, понеделник, как да прочетем следващия доклад за RSI. Едно: попитайте кой обект се променя, тежестите, кодът или настройките за търсене; Dream-RSI променя третото. Две: попитайте кой е замразен; тук това са кодерът, съдията и пренаписвачът, и тримата. Три: попитайте какво представлява водещото число като единица. Спестената изчислителна мощност е оптимизация; бенчмарк, който моделът не е могъл да достигне преди, е излитането, и никой все още не е публикувал такъв.

3:40 Присъда, под капака: необходим е преглед. Цикълът е реален, спестяванията са измерени, а двете думи на корицата описват машина, която не е в доклада. Ако предпочитате да прочетете това, отколкото да ме чуете да го казвам, „дифът“ пристига във входящата ви кутия всяка сутрин, безплатно на the daily diff dot dev, линк по-долу. Кажете ми какво да отворя следващото в коментарите. И това е „дифът“ за днес. Аз съм Нико от Axrisi.

4:00 Сливайте отговорно.

## Източници

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
