# Рекурсивне самовдосконалення, під капотом

Published: 2026-09-18

Google DeepMind опублікував «Dream-RSI: Рекурсивне самовдосконалення через світи, що еволюціонують» — і модель кодування в ньому ніколи не змінюється. Під капотом: що означала ця фраза протягом 60 років, що насправді циклічно відбувається в Dream-RSI (політика дослідження на Python, яка «мріє» над записаними деревами пошуку), і чому 317 викликів агента замість 550 є знижкою, а не зльотом. Вердикт: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/uk/video/2026-09-18-self-improving-ai/

## Що охоплює це відео

- 1965 → 2008: «вибух інтелекту» І. Дж. Гуда, стартовий ШІ Юдковського — машина, яка переписує власні ваги
- 2025: AlphaEvolve — 48-кратне множення матриці 4×4, відновлено 0.7% обчислювальної потужності Google, ядра Gemini на 23% швидші
- 2026: Dream-RSI — політика вдосконалюється, кодер, суддя та переписувач заморожені; підказка говорить «Не вирішуйте наукове завдання»
- X: «Google щойно зламав рекурсивне самовдосконалення» (819 вподобань) проти HN: «називати це RSI здається оманливим»
- Використані числа: §4.1 Lasso 550 → 317 викликів агента, 3587 → 2931 мс; Таблиця 1 пакування кіл 2.635983 = AlphaEvolveV2; §4.3 KernelBench у 2.43× / 1.79× менше поколінь, до 2.09× швидше; Додаток B.2 підказка (все з PDF вище)

## Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

0:00 Рекурсивне самовдосконалення — це ідея, що ШІ робить себе розумнішим, а потім використовує розумнішу версію для повторення цього, і цього тижня Google опублікував документ з цими двома словами в назві, в якому ваги моделі ніколи не змінюються. Три числа. Генеральний директор Anthropic каже, що цей цикл працює з літа, що є його причиною сповільнити всю галузь. Твіт, що оголошував, що Google щойно розгадав це, зібрав вісімсот вподобань за день.

0:24 А головний результат самого документа — 317 викликів моделі замість 550, що є знижкою, а не зльотом. За три хвилини: звідки походить фраза, що насправді циклічно відбувається всередині Dream-RSI, і як читати наступний документ з RSI на обкладинці. Це The Daily Diff, під капотом. 1965 рік. І. Дж. Гуд, статистик Блетчлі-Парку, який працював поруч з Тюрінгом, пише, що ультраінтелектуальна машина могла б створювати ще кращі машини,

0:52 називає це вибухом інтелекту та останнім винаходом, який коли-небудь знадобиться людині, за умови, що машина досить покірна, щоб розповісти нам, як її контролювати, що є тим «за умови», після якого люди перестають читати після коми. Протягом сорока років ця фраза означала саме це: система, яка редагує власний вихідний код або ваги і стає розумнішою з кожним проходом. Есе Еліезера Юдковського 2008 року зробило це опорним словом безпеки ШІ, і ніхто не мав машини для тестування цього, що є ідеальними умовами для визначення. Потім у травні 2025 року DeepMind випустив AlphaEvolve,

1:23 агент Gemini, який пропонує код, отримує його оцінку, зберігає переможців і мутує їх знову. Він множив складні матриці чотири на чотири за 48 кроків, побивши рекорд, встановлений Штрассеном у 1969 році, і відновлює близько нуля цілих сім десятих відсотка обчислювальної потужності Google у всьому світі, що в масштабах Google є центром обробки даних, знайденим під диваном. Gemini тепер допомагав навчати Gemini, і фраза тихо перейшла з блогів про безпеку до прес-релізів. Dream-RSI встановлює контролер поверх цього циклу.

1:52 Політика, фактична програма на Python, вирішує, які гілки дерева пошуку розширювати, скільки паралельно, і коли здаватися. Gemini пише код-кандидат, а фіксований оцінювач оцінює його. Кожен запуск залишає дерево того, що було випробувано і що було оцінено. Це дерево стає симулятором повторів: другий, так само заморожений Gemini переписує політику, і нова політика тестується на записаних результатах замість на реальних графічних процесорах.

2:16 У документі це називається сновидінням, і один реальний запуск оплачує тисячі омріяних без витрат на виконання. Переможець повертається в мережу, пул записаних світів зростає, повторюється. А підказка в Додатку B.2 говорить ШІ, що самовдосконалюється, письмово: редагуйте лише цей файл і не вирішуйте наукове завдання. Виміряно. На завданні розв'язувача Lasso, фіксоване дослідження витратило 550 викликів Gemini, щоб досягти трьох цілих шести десятих секунди, Dream-RSI витратив 317, щоб досягти двох цілих дев'яти десятих, і обидва перевершили scikit-learn.

2:46 На KernelBench він досяг тієї ж швидкості ядра з приблизно у два цілих чотири десяті рази менше поколінь. А на пакуванні кіл він набрав два цілих шістсот тридцять п'ять тисяч дев'ятсот вісімдесят три, що точно, до шести знаків після коми, те, що AlphaEvolve версії два набрав минулого року. Отже, X прочитав заголовок: Google щойно зламав рекурсивне самовдосконалення. Hacker News прочитав PDF: називати це RSI здається оманливим. І того ж тижня генеральний директор конкурента сказав, що цикл працює з літа і всім слід сповільнитися.

3:13 Три речення, ті самі два слова, три різні машини. Отже, у понеділок, як читати наступний документ про RSI. Один: запитайте, який об'єкт змінюється, ваги, код чи налаштування пошуку; Dream-RSI змінює третій. Два: запитайте, хто заморожений; тут це кодер, суддя та переписувач, всі троє. Три: запитайте, що є одиницею головного числа. Збережені обчислення — це оптимізація; бенчмарк, якого модель не могла досягти раніше, — це зліт, і ніхто ще не опублікував цього.

3:40 Вердикт, під капотом: NEEDS REVIEW. Цикл реальний, економія виміряна, а два слова на обкладинці описують машину, якої немає в документі. Якщо ви волієте читати це, а не чути від мене, The Daily Diff приходить на вашу електронну пошту щоранку, безкоштовно на thedailydiff.dev, посилання нижче. Скажіть мені, що відкрити наступним у коментарях. І це The Daily Diff на сьогодні. Я Ніко з Axrisi.

4:00 Відповідально об'єднуйте.

## Джерела

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
