# 遞迴自我改進，內部揭秘

Published: 2026-09-18

Google DeepMind 發佈了「Dream-RSI：透過演化世界進行遞迴自我改進」— 其中使用的編碼模型從未改變。內部揭秘：這個詞語在過去 60 年的含義是什麼，Dream-RSI 中實際循環的是什麼（一個在記錄的搜尋樹上「夢想」的 Python 探索策略），以及為什麼 317 次代理呼叫而非 550 次是折扣而非飛躍。判決：NEEDS REVIEW。

Canonical: https://thedailydiff.dev/zh-TW/video/2026-09-18-self-improving-ai/

## 本影片重點

- 1965 → 2008：I. J. Good 的「智慧爆炸」、Yudkowsky 的種子 AI — 一種能重寫自身權重的機器
- 2025：AlphaEvolve — 48 次乘法的 4×4 矩陣乘法，回收 Google 運算量的 0.7%，Gemini 核心速度提高 23%
- 2026：Dream-RSI — 策略改進，編碼器、評判器和重寫器都已凍結；提示寫著「不要解決科學任務」
- X：「Google 剛剛攻克了遞迴自我改進」（819 個讚）對比 HN：「稱之為 RSI 似乎有誤導性」
- 使用的數字：§4.1 Lasso 550 → 317 次代理呼叫，3587 → 2931 毫秒；表格 1 圓形填充 2.635983 = AlphaEvolveV2；§4.3 KernelBench 2.43× / 1.79× 更少的生成，最高 2.09× 更快；附錄 B.2 提示（均來自上方的 PDF）

## 翻譯文字稿

譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。

0:00 遞迴自我改進是指 AI 讓自己變得更聰明， 然後使用更聰明的自己再次執行此操作，而本週 Google 發佈了一篇 標題中帶有這兩個詞的論文，其中模型的權重從未 移動。三個數字。 Anthropic 的執行長表示，這個循環自夏天以來一直在運行， 這就是他要求整個行業放慢速度的原因。 宣布 Google 剛剛攻克它的推文一天內就獲得了八百個讚。 一天內。

0:24 而這篇論文本身的主要結果是 317 次模型呼叫而非 550 次， 這是一個折扣，而不是飛躍。 三分鐘內：這個詞語的來源，Dream-RSI 內部實際循環的是什麼， 以及如何閱讀下一篇封面上有 RSI 的論文。 這是 The Daily Diff，內部揭秘。 1965 年。I. J. Good，一位在圖靈身旁工作的布萊切利園統計學家， 寫道，一台超智慧機器可以設計出更好的機器，

0:52 稱之為智慧爆炸和人類所需作的最後一項發明， 前提是機器要足夠溫順，能告訴我們如何控制它， 這就是那些「前提是」的人在逗號後就停止閱讀的原因。 四十多年來，這個詞語的含義正是如此：一個編輯自身 原始碼或權重，並在每次迭代中變得更聰明的系統。 Eliezer Yudkowsky 2008 年的論文使其成為 AI 安全性的支撐詞，而當時沒有機器可以測試它，這是一個理想的定義條件。 然後在 2025 年 5 月，DeepMind 推出了 AlphaEvolve，

1:23 一個 Gemini 代理，它提出程式碼，獲得評分，保留獲勝者並再次變異 它們。它在 48 步內完成了四乘四複數矩陣的乘法， 打破了 Strassen 在 1969 年創下的紀錄，並且它回收了 Google 全球運算量的約零 點七百分比，以 Google 的規模來看，這就像在沙發底下發現了一個資料中心。 沙發底下找到的資料中心。 Gemini 現在正在幫助訓練 Gemini，這個詞語悄悄地從安全 部落格轉移到新聞稿中。 Dream-RSI 在該循環之上附加了一個控制器。

1:52 一個策略，一個實際的 Python 程式，決定 要擴展搜尋樹的哪些分支， 多少個並行，以及何時放棄。 Gemini 撰寫候選程式碼，然後一個固定的評估器對其進行評分。 每次運行都會留下一個記錄了嘗試過什麼和得分多少的樹狀結構。 該樹狀結構成為一個重播模擬器：第二個同樣被凍結的 Gemini 重寫 策略，並且新策略是根據記錄的結果進行測試，而不是 在真實 GPU 上進行測試。

2:16 論文稱之為夢想，一次真實運行可以支付數千次夢想的成本， 零執行成本。 獲勝者重新上線，記錄世界池不斷增長， 重複。附錄 B.2 中的提示明確告訴自我改進的 AI： 只編輯此文件，不要解決科學任務。 測量結果。在 Lasso 解算器任務中，固定探索耗費 550 次 Gemini 呼叫，達到 三點六秒；Dream-RSI 耗費 317 次，達到兩點九秒， 兩者都擊敗了 scikit-learn。

2:46 在 KernelBench 上，它以大約兩點四倍更少的生成次數，達到了相同的核心速度。 而圓形填充則獲得了兩點六三五九八三的分數，這與 AlphaEvolve 第二版去年 所得分數精確到小數點後六位完全一致。 去年得到的分數。 所以 X 讀了標題：Google 剛剛攻克了遞迴自我改進。 Hacker News 讀了 PDF：稱之為 RSI 似乎有誤導性。 同一週，一位競爭對手的執行長表示，該循環自夏天以來一直在運行， 每個人都應該放慢速度。

3:13 三句話，同樣的兩個詞，三種不同的機器。 所以，星期一，如何閱讀下一篇 RSI 論文。 一：詢問什麼物件會改變，是權重、程式碼還是搜尋設定； Dream-RSI 改變了第三個。 二：詢問誰是凍結的；這裡是指編碼器、評判器和重寫器， 全部三者。三：詢問標題數字的單位是什麼。 節省的運算是優化；模型之前無法達到的基準是 起飛，而目前還沒有人發佈過。

3:40 判決，內部揭秘：需要審查。 循環是真實的，節省是可測量的，而封面上的兩個詞 描述的機器並不在論文中。 如果你寧願閱讀這份內容而不是聽我說，The Daily Diff 會在每個早晨 免費發送到你的收件箱，網址是 thedailydiff.dev，連結在下方。 在評論中告訴我接下來要揭示什麼。 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。

4:00 負責任地合併。

## 來源

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
