Rekurencyjne samodoskonalenie, od podszewki
Google DeepMind opublikowało „Dream-RSI: Rekurencyjne Samodoskonalenie poprzez Ewoluujące Światy” — a model kodujący w nim nigdy się nie zmienia.
Google DeepMind opublikowało „Dream-RSI: Rekurencyjne Samodoskonalenie poprzez Ewoluujące Światy” — a model kodujący w nim nigdy się nie zmienia. Od podszewki: co to wyrażenie oznaczało przez 60 lat, co faktycznie zapętla się w Dream-RSI (zasada eksploracji w Pythonie, która „śni” nad zarejestrowanymi drzewami wyszukiwania) i dlaczego 317 wywołań agenta zamiast 550 to zniżka, a nie start. Werdykt: NEEDS REVIEW.
Przeczytaj wydanie pisemne (angielski) ↗
Co obejmuje ten film
- 1965 → 2008: „eksplozja inteligencji” I. J. Gooda, sztuczna inteligencja zalążkowa Yudkowsky’ego — maszyna, która przepisuje własne wagi
- 2025: AlphaEvolve — 48-krotne mnożenie macierzy 4×4, odzyskano 0,7% mocy obliczeniowej Google, jądra Gemini 23% szybsze
- 2026: Dream-RSI — zasada się poprawia, koder, sędzia i przepisywacz są zamrożeni; instrukcja mówi „Nie rozwiązuj zadania naukowego”
- X: „Google właśnie rozpracowało rekurencyjne samodoskonalenie” (819 polubień) kontra HN: „nazywanie tego RSI wydaje się mylące”
- Użyte liczby: §4.1 Lasso 550 → 317 wywołań agenta, 3587 → 2931 ms; Tabela 1 pakowanie okręgów 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× mniej generacji, do 2.09× szybciej; Załącznik B.2 instrukcja (wszystko z powyższego PDF-a)
Przetłumaczona transkrypcja
Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.
0:00 Rekurencyjne samodoskonalenie to idea, że sztuczna inteligencja czyni się mądrzejszą, a następnie używa swojego mądrzejszego ja, aby to powtórzyć, i w tym tygodniu Google opublikowało artykuł z tymi dwoma słowami w tytule, w którym wagi modelu nigdy się nie zmieniają. Trzy liczby. Dyrektor generalny Anthropic twierdzi, że ta pętla działa od lata, co jest jego powodem do spowolnienia całej branży. Tweet ogłaszający, że Google właśnie to rozpracowało, zebrał osiemset polubień w jeden dzień.
0:24 A własny nagłówkowy wynik artykułu to 317 wywołań modelu zamiast 550, co jest zniżką, a nie startem. W trzy minuty: skąd wzięło się to wyrażenie, co faktycznie zapętla się w Dream-RSI i jak czytać następny artykuł z RSI na okładce. To jest The Daily Diff, od podszewki. 1965. I. J. Good, statystyk z Bletchley Park, który pracował obok Turinga, pisze, że ultrainteligentna maszyna mogłaby projektować jeszcze lepsze maszyny,
0:52 nazywa to eksplozją inteligencji i ostatnim wynalazkiem, jakiego człowiek kiedykolwiek potrzebowałby, pod warunkiem, że maszyna jest wystarczająco posłuszna, aby powiedzieć nam, jak ją kontrolować, co jest tym „pod warunkiem, że”, po którym ludzie przestają czytać. Przez czterdzieści lat to wyrażenie oznaczało dokładnie to: system, który edytuje swój własny kod źródłowy lub wagi i staje się mądrzejszy z każdym przejściem. Esej Eliezera Yudkowsky’ego z 2008 roku uczynił to kluczowym słowem w kwestii bezpieczeństwa AI, a nikt nie miał maszyny, na której mógłby to przetestować, co jest idealnym warunkiem dla definicji. Potem w maju 2025 roku DeepMind wprowadziło AlphaEvolve,
1:23 agenta Gemini, który proponuje kod, ocenia go, zachowuje zwycięzców i ponownie ich mutuje. Mnożył macierze zespolone cztery na cztery w 48 krokach, bijąc rekord Strassena z 1969 roku, i odzyskuje około zera przecinek siedem procent globalnej mocy obliczeniowej Google, co w skali Google jest centrum danych znalezionym pod kanapą. Gemini pomagało teraz trenować Gemini, a wyrażenie cicho przeniosło się z blogów o bezpieczeństwie do komunikatów prasowych. Dream-RSI dokłada kontroler do tej pętli.
1:52 Zasada, rzeczywisty program w Pythonie, decyduje które gałęzie drzewa wyszukiwania należy rozszerzyć, ile równolegle i kiedy się poddać. Gemini pisze kod kandydujący, a stały ewaluator go ocenia. Każde uruchomienie pozostawia drzewo tego, co zostało wypróbowane i co zostało ocenione. To drzewo staje się symulatorem powtórek: drugi, równie zamrożony Gemini, przepisuje zasadę, a nowa zasada jest testowana na zarejestrowanych wynikach zamiast na prawdziwych GPU.
2:16 Artykuł nazywa to śnieniem, a jedno rzeczywiste uruchomienie opłaca tysiące wyśnionych za zerowy koszt wykonania. Zwycięzca wraca online, pula zarejestrowanych światów rośnie, powtarzaj. A instrukcja w Załączniku B.2 mówi samodoskonalącej się sztucznej inteligencji, na piśmie: edytuj tylko ten jeden plik i nie rozwiązuj zadania naukowego. Zmierzono. W zadaniu solwera Lasso, stała eksploracja zużyła 550 wywołań Gemini, aby osiągnąć trzy przecinek sześć sekundy, Dream-RSI zużyło 317, aby osiągnąć dwa przecinek dziewięć, i oba pobiły scikit-learn.
2:46 Na KernelBench osiągnęło tę samą szybkość jądra z około dwa przecinek cztery razy mniej generacji. A w pakowaniu okręgów osiągnęło wynik dwa przecinek sześć trzy pięć dziewięć osiem trzy, co jest dokładnie, do sześciu miejsc po przecinku, tym, co AlphaEvolve wersja druga osiągnęła w zeszłym roku. Więc X przeczytało tytuł: Google właśnie rozpracowało rekurencyjne samodoskonalenie. Hacker News przeczytało PDF: nazywanie tego RSI wydaje się mylące. A w tym samym tygodniu dyrektor generalny konkurenta powiedział, że pętla działa od lata i wszyscy powinni zwolnić.
3:13 Trzy zdania, te same dwa słowa, trzy różne maszyny. Więc, w poniedziałek, jak czytać następny artykuł o RSI. Po pierwsze: zapytaj, jaki obiekt się zmienia, wagi, kod, czy ustawienia wyszukiwania; Dream-RSI zmienia to trzecie. Po drugie: zapytaj, kto jest zamrożony; tutaj to koder, sędzia i przepisywacz, wszyscy trzej. Po trzecie: zapytaj, czego jednostką jest liczba nagłówkowa. Oszczędność mocy obliczeniowej to optymalizacja; benchmark, którego model nie mógł wcześniej osiągnąć, to start, a nikt jeszcze tego nie opublikował.
3:40 Werdykt, od podszewki: NEEDS REVIEW. Pętla jest prawdziwa, oszczędności są mierzone, a dwa słowa na okładce opisują maszynę, której nie ma w artykule. Jeśli wolisz to przeczytać, niż usłyszeć ode mnie, diff ląduje w Twojej skrzynce odbiorczej każdego ranka, za darmo na the daily diff dot dev, link poniżej. Powiedz mi, co otworzyć następnym razem w komentarzach. I to tyle na dziś. Jestem Niko z Axrisi.
4:00 Łącz odpowiedzialnie.
Źródła
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



