Peningkatan diri rekursif, di sebalik tabir
Google DeepMind menerbitkan "Dream-RSI: Peningkatan Diri Rekursif melalui Dunia Berevolusi" — dan model pengekodan di dalamnya tidak pernah berubah.
Google DeepMind menerbitkan "Dream-RSI: Peningkatan Diri Rekursif melalui Dunia Berevolusi" — dan model pengekodan di dalamnya tidak pernah berubah. Di sebalik tabir: apa maksud frasa itu selama 60 tahun, apa yang sebenarnya berulang dalam Dream-RSI (dasar penerokaan Python yang "mengimpikan" pohon carian yang direkodkan), dan mengapa 317 panggilan agen dan bukannya 550 adalah diskaun, bukan permulaan. Keputusan: NEEDS REVIEW.
Baca edisi bertulis (Bahasa Inggeris) ↗
Apa yang diliputi video ini
- 1965 → 2008: "ledakan kecerdasan" I. J. Good, AI benih Yudkowsky — sebuah mesin yang menulis semula beratnya sendiri
- 2025: AlphaEvolve — pendaraban matriks 4×4 dengan 48 pendaraban, 0.7% daripada komputasi Google dipulihkan, kernel Gemini 23% lebih cepat
- 2026: Dream-RSI — polisi bertambah baik, pengekod, hakim dan penulis semula semuanya dibekukan; arahan mengatakan "Jangan selesaikan tugas saintifik"
- X: "Google baru sahaja memecahkan peningkatan diri rekursif" (819 suka) vs HN: "memanggil ini RSI nampaknya mengelirukan"
- Nombor yang digunakan: §4.1 Lasso 550 → 317 panggilan agen, 3587 → 2931 ms; Jadual 1 pembungkusan bulatan 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× generasi lebih sedikit, sehingga 2.09× lebih cepat; Lampiran B.2 arahan (semuanya dari PDF di atas)
Transkrip terjemahan
Diterjemahkan daripada penceritaan asal Bahasa Inggeris. Audio dan kapsyen yang tersedia dikawal oleh YouTube.
0:00 Peningkatan diri rekursif adalah idea bahawa AI menjadikan dirinya lebih pintar, kemudian menggunakan diri yang lebih pintar itu untuk melakukannya lagi, dan minggu ini Google menerbitkan kertas dengan dua perkataan itu dalam tajuk, di mana berat model tidak pernah bergerak. Tiga nombor. CEO Anthropic mengatakan gelung ini telah berjalan sejak musim panas, yang merupakan alasannya untuk memperlahankan seluruh industri. Tweet yang mengumumkan bahawa Google baru sahaja memecahkannya mengumpul lapan ratus suka dalam sehari.
0:24 Dan hasil utama kertas itu sendiri adalah 317 panggilan model dan bukannya 550, yang merupakan diskaun, bukan permulaan. Dalam tiga minit: dari mana frasa itu berasal, apa yang sebenarnya berulang di dalam Dream-RSI, dan bagaimana membaca kertas seterusnya dengan RSI di kulit muka. Ini adalah The Daily Diff, di sebalik tabir. 1965. I. J. Good, seorang ahli statistik Bletchley Park yang bekerja di sebelah Turing, menulis bahawa sebuah mesin ultracerdas boleh mereka bentuk mesin yang lebih baik lagi,
0:52 memanggilnya ledakan kecerdasan dan ciptaan terakhir yang pernah diperlukan manusia, dengan syarat mesin itu cukup jinak untuk memberitahu kita bagaimana mengawalnya, yang merupakan bahagian 'dengan syarat' yang orang berhenti membaca selepas koma. Selama empat puluh tahun frasa itu bermaksud tepat seperti itu: sistem yang mengedit sendiri sumber atau beratnya dan menjadi lebih pintar setiap kali berlalu. Esei Eliezer Yudkowsky pada 2008 menjadikannya perkataan yang penting dalam AI keselamatan, dan tiada siapa yang mempunyai mesin untuk mengujinya, yang merupakan keadaan ideal untuk satu definisi. Kemudian pada Mei 2025 DeepMind menghantar AlphaEvolve,
1:23 ejen Gemini yang mencadangkan kod, mendapat markah, menyimpan pemenang dan mengubahnya lagi. Ia mendarab matriks kompleks empat-kali-empat dalam 48 langkah, mengalahkan rekod Strassen yang dicatat pada 1969, dan ia memulihkan kira-kira sifar point tujuh peratus daripada komputasi Google di seluruh dunia, yang pada skala Google adalah pusat data yang dijumpai di bawah sofa. Gemini kini membantu melatih Gemini, dan frasa itu secara senyap-senyap beralih dari keselamatan blog ke siaran akhbar. Dream-RSI memasang pengawal di atas gelung itu.
1:52 Sebuah polisi, sebuah program Python sebenar, memutuskan cawangan-cawangan pohon carian yang perlu dikembangkan, berapa banyak secara selari, dan bila untuk menyerah. Gemini menulis kod calon, dan penilai tetap memberikannya markah. Setiap larian meninggalkan jejak tentang apa yang telah dicuba dan markahnya. Pohon itu menjadi simulator ulang tayang: Gemini kedua, yang juga dibekukan, menulis semula polisi itu, dan polisi baru diuji terhadap hasil yang direkodkan dan bukannya pada GPU sebenar.
2:16 Kertas itu memanggil ini bermimpi, dan satu larian sebenar membayar untuk ribuan yang diimpikan tanpa kos pelaksanaan. Pemenang kembali dalam talian, kumpulan dunia yang direkodkan bertambah, ulang. Dan arahan dalam Lampiran B.2 memberitahu AI yang memperbaiki diri, secara bertulis: edit hanya satu fail ini, dan jangan selesaikan tugas saintifik. Diukur. Dalam tugas penyelesai Lasso, penerokaan tetap menghabiskan 550 panggilan Gemini untuk mencapai tiga perpuluhan enam saat, Dream-RSI menghabiskan 317 untuk mencapai dua perpuluhan sembilan, dan kedua-duanya mengalahkan scikit-learn.
2:46 Pada KernelBench ia mencapai kelajuan kernel yang sama dengan kira-kira dua perpuluhan empat kali generasi yang lebih sedikit. Dan pada pembungkusan bulatan ia mencetak dua perpuluhan enam tiga lima sembilan lapan tiga, yang tepat, hingga enam tempat perpuluhan, apa yang AlphaEvolve versi dua dicatat tahun lepas. Jadi X membaca tajuk: Google baru sahaja memecahkan peningkatan diri rekursif. Hacker News membaca PDF: memanggil ini RSI nampaknya mengelirukan. Dan pada minggu yang sama, CEO pesaing mengatakan gelung itu telah berjalan sejak musim panas dan semua orang harus memperlahankan diri.
3:13 Tiga ayat, dua perkataan yang sama, tiga mesin yang berbeza. Jadi, Isnin, bagaimana membaca kertas RSI yang seterusnya. Satu: tanya objek apa yang berubah, berat, kod, atau tetapan carian; Dream-RSI mengubah yang ketiga. Dua: tanya siapa yang dibekukan; di sini ia adalah pengekod, hakim dan penulis semula, kesemua tiga. Tiga: tanya apa nombor utama itu unitnya. Komputasi yang dijimatkan adalah pengoptimuman; penanda aras yang tidak dapat dicapai oleh model sebelum ini adalah permulaan, dan tiada siapa yang menerbitkan itu lagi.
3:40 Keputusan, di sebalik tabir: NEEDS REVIEW. Gelung itu nyata, penjimatan diukur, dan dua perkataan di kulit muka menggambarkan mesin yang tidak ada dalam kertas itu. Jika anda lebih suka membaca ini daripada mendengar saya mengatakannya, diff akan sampai ke peti masuk anda setiap pagi, percuma di the daily diff dot dev, pautan di bawah. Beritahu saya apa yang perlu dibuka seterusnya dalam komen. Dan itu perbezaan untuk hari ini. Saya Niko dari Axrisi.
4:00 Gabungkan dengan bertanggungjawab.
Sumber
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



