# Perbaikan diri rekursif, di balik layar

Published: 2026-09-18

Google DeepMind menerbitkan "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — dan model pengkodean di dalamnya tidak pernah berubah. Di balik layar: apa arti frasa tersebut selama 60 tahun, apa yang sebenarnya berulang dalam Dream-RSI (kebijakan eksplorasi Python yang "bermimpi" di atas pohon pencarian yang direkam), dan mengapa 317 panggilan agen daripada 550 adalah diskon, bukan lepas landas. Putusan: PERLU DITINJAU.

Canonical: https://thedailydiff.dev/id/video/2026-09-18-self-improving-ai/

## Isi video ini

- 1965 → 2008: 'Ledakan kecerdasan' I. J. Good, AI benih Yudkowsky — mesin yang menulis ulang bobotnya sendiri
- 2025: AlphaEvolve — perkalian matriks 4×4 dengan 48 perkalian, 0,7% komputasi Google dipulihkan, kernel Gemini 23% lebih cepat
- 2026: Dream-RSI — kebijakan meningkat, koder, penilai, dan penulis ulang semuanya dibekukan; petunjuknya mengatakan "Jangan selesaikan tugas ilmiah"
- X: "Google baru saja memecahkan perbaikan diri rekursif" (819 suka) vs HN: "menyebut ini RSI tampaknya menyesatkan"
- Angka yang digunakan: §4.1 Lasso 550 → 317 panggilan agen, 3587 → 2931 ms; Tabel 1 pengepakan lingkaran 2,635983 = AlphaEvolveV2; §4.3 KernelBench 2,43× / 1,79× generasi lebih sedikit, hingga 2,09× lebih cepat; Lampiran B.2 prompt (semua dari PDF di atas)

## Transkrip terjemahan

Diterjemahkan dari narasi asli bahasa Inggris. Audio dan teks tersedia yang dikontrol oleh YouTube.

0:00 Perbaikan diri rekursif adalah gagasan bahwa AI menjadikan dirinya lebih pintar, kemudian menggunakan diri yang lebih pintar untuk melakukannya lagi, dan minggu ini Google menerbitkan makalah dengan dua kata tersebut di judulnya, di mana bobot model tidak pernah bergerak. Tiga angka. CEO Anthropic mengatakan loop ini telah berjalan sejak musim panas, yang merupakan alasannya untuk memperlambat seluruh industri. Tweet yang mengumumkan bahwa Google baru saja memecahkannya mengumpulkan delapan ratus suka dalam sehari.

0:24 Dan hasil utama makalah itu sendiri adalah 317 panggilan model daripada 550, yang merupakan diskon, bukan lepas landas. Dalam tiga menit: dari mana frasa itu berasal, apa yang sebenarnya berulang di dalam Dream-RSI, dan bagaimana membaca makalah selanjutnya dengan RSI di sampulnya. Ini adalah The Daily Diff, di balik layar. 1965. I. J. Good, seorang ahli statistik Bletchley Park yang bekerja di sebelah Turing, menulis bahwa mesin ultra-cerdas dapat merancang mesin yang lebih baik lagi,

0:52 menyebutnya ledakan kecerdasan dan penemuan terakhir yang perlu dibuat manusia, asalkan mesin itu cukup jinak untuk memberi tahu kita cara mengendalikannya, yaitu 'asalkan' orang-orang berhenti membaca setelah koma. Selama empat puluh tahun frasa itu berarti persis seperti itu: sebuah sistem yang mengedit sumber atau bobotnya sendiri dan menjadi lebih pintar setiap putaran. Esai Eliezer Yudkowsky tahun 2008 menjadikannya kata kunci pendukung keselamatan AI, dan tidak ada yang memiliki mesin untuk mengujinya, yang merupakan kondisi ideal untuk sebuah definisi. Kemudian pada Mei 2025 DeepMind mengirimkan AlphaEvolve,

1:23 agen Gemini yang mengusulkan kode, dinilai, menyimpan pemenang, dan memutasinya lagi. Itu mengalikan matriks kompleks empat kali empat dalam 48 langkah, mengalahkan rekor yang ditetapkan Strassen pada tahun 1969, dan itu memulihkan sekitar nol koma tujuh persen dari komputasi Google di seluruh dunia, yang pada skala Google adalah sebuah pusat data yang ditemukan di bawah sofa. Gemini sekarang membantu melatih Gemini, dan frasa itu diam-diam pindah dari blog keselamatan ke siaran pers. Dream-RSI memasang pengontrol di atas loop itu.

1:52 Sebuah kebijakan, program Python yang sebenarnya, memutuskan cabang-cabang mana dari pohon pencarian yang akan diperluas, berapa banyak secara paralel, dan kapan harus menyerah. Gemini menulis kode kandidat, dan evaluator tetap menilainya. Setiap eksekusi meninggalkan jejak pohon dari apa yang telah dicoba dan berapa nilainya. Pohon itu menjadi simulator putar ulang: Gemini kedua, yang juga dibekukan, menulis ulang kebijakan tersebut, dan kebijakan baru diuji terhadap hasil yang direkam alih-alih pada GPU nyata.

2:16 Makalah ini menyebutnya bermimpi, dan satu eksekusi nyata membayar ribuan eksekusi yang diimpikan dengan biaya eksekusi nol. Pemenang kembali online, kumpulan dunia yang direkam tumbuh, ulang. Dan prompt di Lampiran B.2 memberi tahu AI yang melakukan perbaikan diri, secara tertulis: edit hanya file ini, dan jangan selesaikan tugas ilmiah. Terukur. Pada tugas pemecah Lasso, eksplorasi tetap menghabiskan 550 panggilan Gemini untuk mencapai 3,6 detik, Dream-RSI menghabiskan 317 untuk mencapai 2,9 detik, dan keduanya mengalahkan scikit-learn.

2:46 Pada KernelBench, ia mencapai kecepatan kernel yang sama dengan sekitar 2,4 kali generasi lebih sedikit. Dan pada pengepakan lingkaran, ia mencetak 2,6359 83, yang persis, hingga enam desimal, skor AlphaEvolve versi 2 tahun lalu. Jadi X membaca judulnya: Google baru saja memecahkan perbaikan diri rekursif. Hacker News membaca PDF: menyebut ini RSI tampaknya menyesatkan. Dan pada minggu yang sama, CEO pesaing mengatakan loop telah berjalan sejak musim panas dan semua orang harus melambat.

3:13 Tiga kalimat, dua kata yang sama, tiga mesin yang berbeda. Jadi, Senin, bagaimana membaca makalah RSI berikutnya. Satu: tanyakan objek apa yang berubah, bobot, kode, atau pengaturan pencarian; Dream-RSI mengubah yang ketiga. Dua: tanyakan siapa yang dibekukan; di sini adalah koder, penilai, dan penulis ulang, ketiganya. Tiga: tanyakan apa satuan dari angka utama. Komputasi yang dihemat adalah optimisasi; tolok ukur yang tidak dapat dicapai model sebelumnya adalah lepas landas, dan belum ada yang menerbitkan yang itu.

3:40 Putusan, di balik layar: perlu ditinjau. Loop itu nyata, penghematannya terukur, dan dua kata di sampulnya menggambarkan mesin yang tidak ada dalam makalah. Jika Anda lebih suka membaca ini daripada mendengar saya mengatakannya, diff akan masuk ke kotak masuk Anda setiap pagi, gratis di the daily diff dot dev, tautan di bawah. Beri tahu saya apa yang harus dibuka selanjutnya di komentar. Dan itulah perbedaan untuk hari ini. Saya Niko dari Axrisi.

4:00 Gabungkan dengan bertanggung jawab.

## Sumber

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
