# 遞歸式自我改進：底層解密

Published: 2026-09-18

Google DeepMind 發佈了《Dream-RSI：透過演化世界實現遞歸式自我改進》——而其中的編碼模型從未改變。底層解密：這個詞語在過去 60 年的含義是什麼，Dream-RSI 中實際循環的是什麼（一個在記錄搜尋樹上「夢想」的 Python 探索策略），以及為什麼 317 次代理呼叫而非 550 次是折扣，而非突破性進展。結論：NEEDS REVIEW。

Canonical: https://thedailydiff.dev/zh-HK/video/2026-09-18-self-improving-ai/

## 本影片涵蓋的內容

- 1965 → 2008：I. J. Good 的「智能爆炸」，Yudkowsky 的種子 AI——一個能重寫自身權重的機器
- 2025：AlphaEvolve——48 次乘法 4×4 矩陣乘法，恢復了 Google 0.7% 的運算，Gemini 核心速度提升 23%
- 2026：Dream-RSI——策略改進，編碼器、判斷者和重寫器均被凍結；提示寫著「不要解決科學任務」
- X：「Google 剛剛突破了遞歸式自我改進」（819 個讚）與 HN：「稱其為 RSI 似乎有誤導性」
- 使用數字：§4.1 Lasso 550 → 317 次代理呼叫，3587 → 2931 毫秒；表 1 圓堆疊 2.635983 = AlphaEvolveV2；§4.3 KernelBench 減少 2.43 倍 / 1.79 倍世代，速度提升高達 2.09 倍；附錄 B.2 提示（均來自上方的 PDF）

## 翻譯的文字記錄

從英文原文旁白翻譯。可用的音頻和字幕由 YouTube 控制。

0:00 遞歸式自我改進是指人工智能讓自己變得更聰明， 然後利用更聰明的自己再次執行此操作，而本週 Google 發佈了 一篇標題中帶有這兩個詞的論文，其中模型的權重從未 改變。三個數字。 Anthropic 的 CEO 表示這個循環從夏天就已經開始運行， 這也是他要求整個行業放慢速度的原因。 宣布 Google 剛突破這項技術的推文在一天內收集了八百個讚。 一天之內。

0:24 而這篇論文自身的頭條結果是 317 次模型呼叫而非 550 次， 這是一個折扣，而不是突破性進展。 在三分鐘內：這個詞語的來源，Dream-RSI 內部實際循環的是什麼， 以及如何閱讀下一篇封面印有 RSI 的論文。 這是 The Daily Diff，底層解密。 1965 年。I. J. Good，一位曾在圖靈身邊工作的布萊切利園統計學家， 寫道，一台超智能機器可以設計出更好的機器，

0:52 他稱之為智能爆炸和人類可能需要的最後一項發明， 前提是機器足夠溫順，能告訴我們如何控制它， 而這是那些在逗號後停止閱讀的人的「前提」。 四十年間，這個詞語的確切含義是：一個編輯自身 源代碼或權重並在每次迭代後變得更聰明的系統。 Eliezer Yudkowsky 2008 年的論文使其成為人工智能 安全的核心詞語，而且當時沒有機器可以測試，這是一個定義的理想條件。 然後在 2025 年 5 月 DeepMind 發佈了 AlphaEvolve，

1:23 一個 Gemini 代理，它提出程式碼，獲得評分，保留獲勝者並再次 變異它們。它在 48 步中乘了四乘四的複雜矩陣， 打破了 Strassen 在 1969 年創下的紀錄，並恢復了 Google 全球運算的約 零點七個百分點，以 Google 的規模來看，這就像在沙發下找到一個數據中心。 沙發下找到一個數據中心。 Gemini 現在正在幫助訓練 Gemini，這個詞語也悄悄地從安全 博客轉移到新聞稿中。 Dream-RSI 在該循環之上附加了一個控制器。

1:52 一個策略，一個實際的 Python 程式，決定 要擴展搜尋樹的哪些分支， 多少個並行，以及何時放棄。 Gemini 編寫候選程式碼，一個固定的評估器對其進行評分。 每次運行都會留下一棵嘗試過什麼以及得分如何的樹。 這棵樹成為一個重播模擬器：第二個同樣凍結的 Gemini 重寫 策略，新策略根據記錄的結果而非在真實 GPU 上進行測試。 而非在真實 GPU 上進行測試。

2:16 這篇論文將此稱為「夢想」，一次真實運行可以支付數千次夢想運行的 零執行成本。 獲勝者重新上線，記錄世界池不斷增長， 重複。附錄 B.2 中的提示以書面形式告知自我改進 AI， 書面寫道：只編輯這個文件，不要解決科學任務。 已測量。在 Lasso 求解器任務上，固定探索花費了 550 次 Gemini 呼叫才 達到 3.6 秒，Dream-RSI 花費 317 次達到 2.9 秒， 兩者都擊敗了 scikit-learn。

2:46 在 KernelBench 上，它以約 2.4 倍的世代數達到了相同的核心速度。 更少的世代數。在圓堆疊上，它得分為 2.635983，這精確到六位小數， 與 AlphaEvolve 第二版 去年得分相同。 所以 X 讀了標題：Google 剛突破了遞歸式自我改進。 Hacker News 讀了 PDF：稱其為 RSI 似乎有誤導性。 而同一週，一家競爭對手的 CEO 說這個循環從夏天就已經開始運行 每個人都應該放慢速度。

3:13 三句話，同樣的兩個詞，三種不同的機器。 那麼，週一，如何閱讀下一篇 RSI 論文。 第一：詢問哪個物件發生變化，是權重、代碼還是搜尋設定； Dream-RSI 改變了第三項。 第二：詢問誰被凍結了；在這裡是編碼器、判斷者和重寫器， 全部三個。第三：詢問頭條數字的單位是什麼。 節省的計算是優化；模型以前無法達到的基準是 突破性進展，但還沒有人發佈過這樣的成果。

3:40 結論，底層解密：NEEDS REVIEW。 循環是真實的，節省的成本也已測量，封面上的兩個詞 描述的機器並未出現在論文中。 如果您寧願閱讀此內容而不是聽我說，那麼每天早上都會將差異發送到您的收件箱， 在 dailydiff.dev 免費獲取，連結如下。 在評論中告訴我接下來要打開什麼。 這就是今天的差異。 我是 Axrisi 的 Niko。

4:00 負責任地合併。

## 來源

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
