# 递归式自我改进，幕后揭秘

Published: 2026-09-18

Google DeepMind 发布了“Dream-RSI：通过演化世界实现递归式自我改进”——其内部的编码模型从未改变。幕后揭秘：这个短语在过去 60 年的含义是什么，Dream-RSI 中实际循环的是什么（一种在记录的搜索树上“梦想”的 Python 探索策略），以及为什么 317 次代理调用而非 550 次是折扣，而不是起飞。判决：NEEDS REVIEW。

Canonical: https://thedailydiff.dev/zh-CN/video/2026-09-18-self-improving-ai/

## 本视频涵盖的内容

- 1965 → 2008：I. J. Good 的“智能爆炸”，Yudkowsky 的种子 AI——一台重写自身权重的机器
- 2025：AlphaEvolve——48 乘法 4×4 矩阵乘法，恢复了 Google 计算的 0.7%，Gemini 内核速度提高 23%
- 2026：Dream-RSI——策略改进，编码器、判断器和重写器都已冻结；提示语是“不要解决科学任务”
- X：“Google 刚刚攻克了递归式自我改进”（819 个赞）VS HN：“称其为 RSI 似乎具有误导性”
- 使用数字：§4.1 Lasso 550 → 317 次代理调用，3587 → 2931 毫秒；表 1 圆形填充 2.635983 = AlphaEvolveV2；§4.3 KernelBench 减少了 2.43 倍 / 1.79 倍的生成次数，速度提高了 2.09 倍；附录 B.2 提示（均来自上述 PDF）

## 翻译的文字记录

译自英文原版旁白。可用音频和字幕由 YouTube 控制。

0:00 递归式自我改进是一种理念，即 AI 使自己变得更聪明， 然后利用更聪明的自己再次进行改进，本周 Google 发表了一篇 标题中包含这两个词的论文，其中模型的权重从未改变。 三个数字。 Anthropic 的 CEO 表示这个循环从夏天就开始运行了， 这也是他放缓整个行业发展的原因。 宣布 Google 刚刚攻克了这一难题的推文在一天内获得了八百个赞。 一天之内。

0:24 而论文本身的标题结果是 317 次模型调用而非 550 次， 这是一个折扣，而不是起飞。 三分钟内：这个短语的由来，Dream-RSI 内部实际循环的是什么， 以及如何阅读下一篇封面印有 RSI 的论文。 这里是 The Daily Diff，幕后揭秘。 1965 年。I. J. 古德，一位在布莱切利园与图灵共事的统计学家， 写道，一个超智能机器可以设计出更好的机器，

0:52 称之为智能爆炸，是人类有史以来最后一次发明， 前提是机器足够温顺，能够告诉我们如何控制它， 而人们在逗号之后就停止阅读了。 四十年来，这个短语的含义就是：一个系统编辑自己的 源代码或权重，并且每次迭代都变得更聪明。 埃利泽·尤德科夫斯基 2008 年的论文使其成为 AI 安全的支撑词，当时没有人有机器可以测试它，这是 定义。然后在 2025 年 5 月，DeepMind 发布了 AlphaEvolve，

1:23 一个 Gemini 代理，它提出代码，对其进行评分，保留获胜者并对其进行变异。 它在 48 个步骤中完成了四乘四复数矩阵的乘法， 打破了 Strassen 在 1969 年创下的记录，并回收了 Google 全球计算的约零点 七个百分点，这在 Google 的规模下，相当于 在沙发底下找到一个数据中心。 Gemini 正在帮助训练 Gemini，这个短语也悄然从安全 博客进入了新闻稿。 Dream-RSI 在该循环之上安装了一个控制器。

1:52 一个策略，一个真实的 Python 程序，决定 要扩展搜索树的哪些分支， 有多少个并行，以及何时放弃。 Gemini 编写候选代码，一个固定的评估器对其进行评分。 每次运行都会留下一个记录了尝试过什么以及分数如何的树。 这棵树变成了一个回放模拟器：第二个同样冻结的 Gemini 重写 策略，新策略根据记录的结果进行测试，而不是 在真实的 GPU 上。

2:16 论文称之为梦想，一次真实的运行可以支付数千次梦想的 运行，零执行成本。 获胜者重新上线，记录的世界池不断增长， 重复。附录 B.2 中的提示告诉自我改进的 AI， 书面指示：只编辑这一个文件，不要解决科学任务。 测量。在 Lasso 求解器任务上，固定探索花费了 550 次 Gemini 调用才达到 3.6 秒，Dream-RSI 花费了 317 次才达到 2.9 秒， 两者都击败了 scikit-learn。

2:46 在 KernelBench 上，它以大约 2.4 倍的生成次数达到了相同的内核速度。 更少的代。在圆形填充方面，它的得分为 2.635983，这精确到小数点后六位， 这正是 AlphaEvolve 第二版去年取得的成绩。 去年取得了成绩。 所以 X 读了标题：Google 刚刚攻克了递归式自我改进。 Hacker News 阅读了 PDF：称其为 RSI 似乎具有误导性。 而同一周，一位竞争对手的 CEO 表示，这个循环从夏天就开始运行了， 所有人都应该放慢速度。

3:13 三句话，同样的两个词，三台不同的机器。 那么，周一，如何阅读下一篇 RSI 论文。 一：问哪个对象改变了，是权重、代码还是搜索设置； Dream-RSI 改变了第三个。 二：问谁被冻结了；这里是编码器、判断器和重写器， 全部三个。三：问标题数字是什么单位。 节省的计算是优化；模型以前无法达到的基准是 起飞，但还没有人发布过。

3:40 判决，幕后揭秘：NEEDS REVIEW。 循环是真实的，节省的开支是可测量的，封面上的两个词 描述的机器在论文中并不存在。 如果你宁愿阅读而不是听我说，The Daily Diff 每天早上免费发送到你的收件箱， 在 thedailydiff.dev，链接在下方。 在评论中告诉我接下来要打开什么。 这就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。

4:00 负责任地合并。

## 来源

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
