+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

遞迴自我改進,內部揭秘

Google DeepMind 發佈了「Dream-RSI:透過演化世界進行遞迴自我改進」— 其中使用的編碼模型從未改變。

Google DeepMind 發佈了「Dream-RSI:透過演化世界進行遞迴自我改進」— 其中使用的編碼模型從未改變。內部揭秘:這個詞語在過去 60 年的含義是什麼,Dream-RSI 中實際循環的是什麼(一個在記錄的搜尋樹上「夢想」的 Python 探索策略),以及為什麼 317 次代理呼叫而非 550 次是折扣而非飛躍。判決:NEEDS REVIEW。

閱讀書面版(英文) ↗

本影片重點

  • 1965 → 2008:I. J. Good 的「智慧爆炸」、Yudkowsky 的種子 AI — 一種能重寫自身權重的機器
  • 2025:AlphaEvolve — 48 次乘法的 4×4 矩陣乘法,回收 Google 運算量的 0.7%,Gemini 核心速度提高 23%
  • 2026:Dream-RSI — 策略改進,編碼器、評判器和重寫器都已凍結;提示寫著「不要解決科學任務」
  • X:「Google 剛剛攻克了遞迴自我改進」(819 個讚)對比 HN:「稱之為 RSI 似乎有誤導性」
  • 使用的數字:§4.1 Lasso 550 → 317 次代理呼叫,3587 → 2931 毫秒;表格 1 圓形填充 2.635983 = AlphaEvolveV2;§4.3 KernelBench 2.43× / 1.79× 更少的生成,最高 2.09× 更快;附錄 B.2 提示(均來自上方的 PDF)

翻譯文字稿

譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。

0:00 遞迴自我改進是指 AI 讓自己變得更聰明, 然後使用更聰明的自己再次執行此操作,而本週 Google 發佈了一篇 標題中帶有這兩個詞的論文,其中模型的權重從未 移動。三個數字。 Anthropic 的執行長表示,這個循環自夏天以來一直在運行, 這就是他要求整個行業放慢速度的原因。 宣布 Google 剛剛攻克它的推文一天內就獲得了八百個讚。 一天內。

0:24 而這篇論文本身的主要結果是 317 次模型呼叫而非 550 次, 這是一個折扣,而不是飛躍。 三分鐘內:這個詞語的來源,Dream-RSI 內部實際循環的是什麼, 以及如何閱讀下一篇封面上有 RSI 的論文。 這是 The Daily Diff,內部揭秘。 1965 年。I. J. Good,一位在圖靈身旁工作的布萊切利園統計學家, 寫道,一台超智慧機器可以設計出更好的機器,

0:52 稱之為智慧爆炸和人類所需作的最後一項發明, 前提是機器要足夠溫順,能告訴我們如何控制它, 這就是那些「前提是」的人在逗號後就停止閱讀的原因。 四十多年來,這個詞語的含義正是如此:一個編輯自身 原始碼或權重,並在每次迭代中變得更聰明的系統。 Eliezer Yudkowsky 2008 年的論文使其成為 AI 安全性的支撐詞,而當時沒有機器可以測試它,這是一個理想的定義條件。 然後在 2025 年 5 月,DeepMind 推出了 AlphaEvolve,

1:23 一個 Gemini 代理,它提出程式碼,獲得評分,保留獲勝者並再次變異 它們。它在 48 步內完成了四乘四複數矩陣的乘法, 打破了 Strassen 在 1969 年創下的紀錄,並且它回收了 Google 全球運算量的約零 點七百分比,以 Google 的規模來看,這就像在沙發底下發現了一個資料中心。 沙發底下找到的資料中心。 Gemini 現在正在幫助訓練 Gemini,這個詞語悄悄地從安全 部落格轉移到新聞稿中。 Dream-RSI 在該循環之上附加了一個控制器。

1:52 一個策略,一個實際的 Python 程式,決定 要擴展搜尋樹的哪些分支, 多少個並行,以及何時放棄。 Gemini 撰寫候選程式碼,然後一個固定的評估器對其進行評分。 每次運行都會留下一個記錄了嘗試過什麼和得分多少的樹狀結構。 該樹狀結構成為一個重播模擬器:第二個同樣被凍結的 Gemini 重寫 策略,並且新策略是根據記錄的結果進行測試,而不是 在真實 GPU 上進行測試。

2:16 論文稱之為夢想,一次真實運行可以支付數千次夢想的成本, 零執行成本。 獲勝者重新上線,記錄世界池不斷增長, 重複。附錄 B.2 中的提示明確告訴自我改進的 AI: 只編輯此文件,不要解決科學任務。 測量結果。在 Lasso 解算器任務中,固定探索耗費 550 次 Gemini 呼叫,達到 三點六秒;Dream-RSI 耗費 317 次,達到兩點九秒, 兩者都擊敗了 scikit-learn。

2:46 在 KernelBench 上,它以大約兩點四倍更少的生成次數,達到了相同的核心速度。 而圓形填充則獲得了兩點六三五九八三的分數,這與 AlphaEvolve 第二版去年 所得分數精確到小數點後六位完全一致。 去年得到的分數。 所以 X 讀了標題:Google 剛剛攻克了遞迴自我改進。 Hacker News 讀了 PDF:稱之為 RSI 似乎有誤導性。 同一週,一位競爭對手的執行長表示,該循環自夏天以來一直在運行, 每個人都應該放慢速度。

3:13 三句話,同樣的兩個詞,三種不同的機器。 所以,星期一,如何閱讀下一篇 RSI 論文。 一:詢問什麼物件會改變,是權重、程式碼還是搜尋設定; Dream-RSI 改變了第三個。 二:詢問誰是凍結的;這裡是指編碼器、評判器和重寫器, 全部三者。三:詢問標題數字的單位是什麼。 節省的運算是優化;模型之前無法達到的基準是 起飛,而目前還沒有人發佈過。

3:40 判決,內部揭秘:需要審查。 循環是真實的,節省是可測量的,而封面上的兩個詞 描述的機器並不在論文中。 如果你寧願閱讀這份內容而不是聽我說,The Daily Diff 會在每個早晨 免費發送到你的收件箱,網址是 thedailydiff.dev,連結在下方。 在評論中告訴我接下來要揭示什麼。 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。

4:00 負責任地合併。

來源

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

相關影片

under-the-hood · zh-TW · 2026年9月24日

SAML,內部構造:信件中的簽章

SAML 讓您登入幾乎所有工作應用程式,其簽章存在於它簽署的 XML 內部。深入探討:應用程式、瀏覽器和身分提供者之間的登入過程,斷言的樣子,為什麼規範化必須在每個位元組上達成一致,以及為什麼從 2012 年到 2025 年,相同的錯誤類別不斷重現。受 Trail of Bits 的「SAML:糟糕設計的碎形」(在 Hacker News 上獲得 312 點) 啟發。

3:02 ↗
under-the-hood · zh-TW · 2026年9月23日

模型終止運作的幕後故事

AI 模型並非「死亡」——它會收到一個終止日期,隔天早上,您的 API 呼叫會回傳 404:「該模型已棄用,請點此了解更多。」幕後故事:四種狀態的流程(活躍 → 舊版 → 棄用 → 退役),通知期限(OpenAI:一般模型 ≥ 6 個月/3 個月,預覽版約 2 週;Anthropic ≥ 60 天),開發者會遇到的問題(響亮的 404、無聲的評估漂移、Claude 4.7+ 溫度參數導致的新 40

3:15 ↗
under-the-hood · zh-TW · 2026年9月19日

通行密鑰,幕後原理

通行密鑰是您的裝置發明、從不向您顯示,並拒絕交給任何人的密碼——包括您自己。幕後原理:WebAuthn 儀式(每個網站一組金鑰對、挑戰、簽名)、瀏覽器寫入以杜絕網路釣魚的唯一欄位(來源)、裝置綁定與同步金鑰、AAGUID,以及為何「無法被網路釣魚」和「無法被移動」是相同的特性——這正是 Hacker News 上「我不喜歡通行密鑰」(616 點)所真正關注的問題。結論:NEEDS REVIEW——

3:12 ↗