# Рэкурсіўнае самаўдасканаленне: што пад капотам

Published: 2026-09-18

Google DeepMind апублікаваў "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — і мадэль кадавання ўнутры яе ніколі не мяняецца. Што пад капотам: што фраза азначала 60 гадоў, што насамрэч цыклічна ў Dream-RSI (палітыка даследавання Python, якая "марыць" над запісанымі дрэвамі пошуку), і чаму 317 выклікаў агента замест 550 — гэта зніжка, а не ўзлёт. Вердыкт: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/be/video/2026-09-18-self-improving-ai/

## Што ахоплівае гэта відэа

- 1965 → 2008: «выбух інтэлекту» І. Дж. Гуда, «насенны штучны інтэлект» Юдкоўскага — машына, якая перапісвае ўласныя вагі
- 2025: AlphaEvolve — 48-кратнае множанне матрыцы 4×4, 0,7% вылічальнай магутнасці Google адноўлена, ядры Gemini на 23% хутчэй
- 2026: Dream-RSI — палітыка паляпшаецца, кодар, суддзя і перапісвальнік замарожаныя; падказка абвяшчае "Не вырашайце навуковую задачу"
- X: "Google толькі што ўзламаў рэкурсіўнае самаўдасканаленне" (819 падабаек) супраць HN: "называць гэта RSI здаецца памылковым"
- Выкарыстаныя лічбы: §4.1 Lasso 550 → 317 выклікаў агента, 3587 → 2931 мс; Табліца 1 упакоўка колаў 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× менш пакаленняў, да 2.09× хутчэй; Дадатак B.2 падказка (усё з PDF вышэй)

## Перакладзеная стэнаграма

Перакладзена з арыгінальнай англійскай агучкі. Даступнае аўдыя і субтытры кантралююцца YouTube.

0:00 Рэкурсіўнае самаўдасканаленне — гэта ідэя, што штучны інтэлект робіць сябе разумнейшым, потым выкарыстоўвае больш разумную версію сябе, каб зрабіць гэта зноў, і на гэтым тыдні Google апублікаваў дакумент з гэтымі двума словамі ў назве, у якім вагі мадэлі ніколі не змяняюцца. Тры лічбы. Генеральны дырэктар Anthropic кажа, што гэты цыкл працуе з лета, што з'яўляецца яго прычынай для запаволення ўсёй індустрыі. Твіт, які абвяшчаў, што Google толькі што ўзламаў гэта, сабраў восемсот падабаек за дзень.

0:24 І галоўны вынік самога дакумента — 317 выклікаў мадэлі замест 550, што з'яўляецца зніжкай, а не ўзлётам. За тры хвіліны: адкуль узялася фраза, што насамрэч цыклічна ўнутры Dream-RSI і як чытаць наступны дакумент з RSI на вокладцы. Гэта The Daily Diff, што пад капотам. 1965. І. Дж. Гуд, статыстык з Блетчлі-Парку, які працаваў побач з Цьюрынгам, піша, што звышінтэлектуальная машына магла б распрацоўваць яшчэ лепшыя машыны,

0:52 называе гэта выбухам інтэлекту і апошнім вынаходствам, якое калі-небудзь спатрэбіцца чалавеку, пры ўмове, што машына будзе досыць паслухмянай, каб расказаць нам, як яе кантраляваць, што і ёсць тое "пры ўмове, што" людзі перастаюць чытаць пасля коскі. На працягу сарака гадоў фраза азначала менавіта гэта: сістэму, якая рэдагуе ўласны зыходны код або вагі і становіцца разумнейшай з кожным праходам. Эсэ Эліэзера Юдкоўскага 2008 года зрабіла гэта апорным словам бяспекі штучнага інтэлекту, і ні ў каго не было машыны, каб праверыць гэта, што з'яўляецца ідэальным станам для вызначэння. Затым у маі 2025 года DeepMind выпусціла AlphaEvolve,

1:23 агента Gemini, які прапануе код, атрымлівае ацэнку, захоўвае пераможцаў і мутуе іх зноў. Ён памножыў складаныя матрыцы чатыры на чатыры за 48 крокаў, пераўзыходзячы рэкорд, усталяваны Штрасэнам у 1969 годзе, і ён аднаўляе каля нуля цэлых сем дзясятых працэнта сусветнай вылічальнай магутнасці Google, што ў маштабах Google з'яўляецца цэнтрам апрацоўкі дадзеных, знойдзеным пад канапай. Gemini цяпер дапамагаў трэніраваць Gemini, і фраза ціха перайшла з блогаў па бяспецы у прэс-рэлізы. Dream-RSI накладвае кантролер на гэты цыкл.

1:52 Палітыка, фактычная праграма Python, вырашае, якія галіны дрэва пошуку разгортваць, колькі паралельна і калі здавацца. Gemini піша код кандыдата, а фіксаваны ацэньвальнік выстаўляе яму балы. Кожны запуск пакідае за сабой дрэва таго, што было паспрабавана і як было ацэнена. Гэтае дрэва становіцца сімулятарам прайгравання: другі, аднолькава замарожаны Gemini перапісвае палітыку, і новая палітыка правяраецца на запісаных выніках замест на рэальных GPU.

2:16 Дакумент называе гэта марамі, і адзін рэальны запуск акупляе тысячы выдуманых пры нулявых выдатках на выкананне. Пераможца вяртаецца ў сетку, пул запісаных светаў расце, паўтор. І падказка ў Дадатку B.2 кажа штучнаму інтэлекту, які самаўдасканальваецца, пісьмова: рэдагаваць толькі гэты файл і не вырашаць навуковую задачу. Вымерана. У задачы Lasso solver фіксаванае даследаванне выдаткавала 550 выклікаў Gemini, каб дасягнуць трох цэлых шасці дзясятых секунды, Dream-RSI выдаткавала 317, каб дасягнуць двух цэлых дзевяці дзясятых, і абодва пераўзышлі scikit-learn.

2:46 На KernelBench ён дасягнуў той жа хуткасці ядра прыкладна ў два цэлыя чатыры дзясятых разы менш пакаленняў. А пры ўпакоўцы колаў ён набраў два цэлыя шэсцьсот трыццаць пяць тысяч дзевяцьсот восемдзесят тры, што дакладна, да шасці дзесятковых знакаў, як AlphaEvolve версіі два набраў у мінулым годзе. Такім чынам, X прачытаў назву: Google толькі што ўзламаў рэкурсіўнае самаўдасканаленне. Hacker News прачытаў PDF: называць гэта RSI здаецца памылковым. І ў той жа тыдзень генеральны дырэктар канкурэнта сказаў, што цыкл працуе з лета і ўсім трэба запаволіцца.

3:13 Тры сказы, тыя ж два словы, тры розныя машыны. Такім чынам, у панядзелак, як чытаць наступны дакумент пра RSI. Адзін: спытайце, які аб'ект змяняецца, вагі, код або налады пошуку; Dream-RSI змяняе трэці. Два: спытайце, хто замарожаны; тут гэта кодар, суддзя і перапісвальнік, усе трое. Тры: спытайце, што з'яўляецца адзінкай галоўнай лічбы. Захаваныя вылічэнні — гэта аптымізацыя; эталон, які мадэль не магла дасягнуць раней, — гэта узлёт, і ніхто яшчэ не апублікаваў гэтага.

3:40 Вердыкт, што пад капотам: NEEDS REVIEW. Цыкл рэальны, эканомія вымерана, і два словы на вокладцы апісваюць машыну, якой няма ў дакуменце. Калі вы хочаце прачытаць гэта, а не пачуць ад мяне, The Daily Diff трапляе ў вашу паштовую скрыню кожную раніцу, бясплатна на daily diff dot dev, спасылка ніжэй. Скажыце мне, што адкрыць наступным у каментарах. І гэта на сённяшні дзень. Я Ніка з Axrisi.

4:00 Merge responsibly.

## Крыніцы

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
