+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

递归式自我改进,幕后揭秘

Google DeepMind 发布了“Dream-RSI:通过演化世界实现递归式自我改进”——其内部的编码模型从未改变。

Google DeepMind 发布了“Dream-RSI:通过演化世界实现递归式自我改进”——其内部的编码模型从未改变。幕后揭秘:这个短语在过去 60 年的含义是什么,Dream-RSI 中实际循环的是什么(一种在记录的搜索树上“梦想”的 Python 探索策略),以及为什么 317 次代理调用而非 550 次是折扣,而不是起飞。判决:NEEDS REVIEW。

阅读书面版(英文) ↗

本视频涵盖的内容

  • 1965 → 2008:I. J. Good 的“智能爆炸”,Yudkowsky 的种子 AI——一台重写自身权重的机器
  • 2025:AlphaEvolve——48 乘法 4×4 矩阵乘法,恢复了 Google 计算的 0.7%,Gemini 内核速度提高 23%
  • 2026:Dream-RSI——策略改进,编码器、判断器和重写器都已冻结;提示语是“不要解决科学任务”
  • X:“Google 刚刚攻克了递归式自我改进”(819 个赞)VS HN:“称其为 RSI 似乎具有误导性”
  • 使用数字:§4.1 Lasso 550 → 317 次代理调用,3587 → 2931 毫秒;表 1 圆形填充 2.635983 = AlphaEvolveV2;§4.3 KernelBench 减少了 2.43 倍 / 1.79 倍的生成次数,速度提高了 2.09 倍;附录 B.2 提示(均来自上述 PDF)

翻译的文字记录

译自英文原版旁白。可用音频和字幕由 YouTube 控制。

0:00 递归式自我改进是一种理念,即 AI 使自己变得更聪明, 然后利用更聪明的自己再次进行改进,本周 Google 发表了一篇 标题中包含这两个词的论文,其中模型的权重从未改变。 三个数字。 Anthropic 的 CEO 表示这个循环从夏天就开始运行了, 这也是他放缓整个行业发展的原因。 宣布 Google 刚刚攻克了这一难题的推文在一天内获得了八百个赞。 一天之内。

0:24 而论文本身的标题结果是 317 次模型调用而非 550 次, 这是一个折扣,而不是起飞。 三分钟内:这个短语的由来,Dream-RSI 内部实际循环的是什么, 以及如何阅读下一篇封面印有 RSI 的论文。 这里是 The Daily Diff,幕后揭秘。 1965 年。I. J. 古德,一位在布莱切利园与图灵共事的统计学家, 写道,一个超智能机器可以设计出更好的机器,

0:52 称之为智能爆炸,是人类有史以来最后一次发明, 前提是机器足够温顺,能够告诉我们如何控制它, 而人们在逗号之后就停止阅读了。 四十年来,这个短语的含义就是:一个系统编辑自己的 源代码或权重,并且每次迭代都变得更聪明。 埃利泽·尤德科夫斯基 2008 年的论文使其成为 AI 安全的支撑词,当时没有人有机器可以测试它,这是 定义。然后在 2025 年 5 月,DeepMind 发布了 AlphaEvolve,

1:23 一个 Gemini 代理,它提出代码,对其进行评分,保留获胜者并对其进行变异。 它在 48 个步骤中完成了四乘四复数矩阵的乘法, 打破了 Strassen 在 1969 年创下的记录,并回收了 Google 全球计算的约零点 七个百分点,这在 Google 的规模下,相当于 在沙发底下找到一个数据中心。 Gemini 正在帮助训练 Gemini,这个短语也悄然从安全 博客进入了新闻稿。 Dream-RSI 在该循环之上安装了一个控制器。

1:52 一个策略,一个真实的 Python 程序,决定 要扩展搜索树的哪些分支, 有多少个并行,以及何时放弃。 Gemini 编写候选代码,一个固定的评估器对其进行评分。 每次运行都会留下一个记录了尝试过什么以及分数如何的树。 这棵树变成了一个回放模拟器:第二个同样冻结的 Gemini 重写 策略,新策略根据记录的结果进行测试,而不是 在真实的 GPU 上。

2:16 论文称之为梦想,一次真实的运行可以支付数千次梦想的 运行,零执行成本。 获胜者重新上线,记录的世界池不断增长, 重复。附录 B.2 中的提示告诉自我改进的 AI, 书面指示:只编辑这一个文件,不要解决科学任务。 测量。在 Lasso 求解器任务上,固定探索花费了 550 次 Gemini 调用才达到 3.6 秒,Dream-RSI 花费了 317 次才达到 2.9 秒, 两者都击败了 scikit-learn。

2:46 在 KernelBench 上,它以大约 2.4 倍的生成次数达到了相同的内核速度。 更少的代。在圆形填充方面,它的得分为 2.635983,这精确到小数点后六位, 这正是 AlphaEvolve 第二版去年取得的成绩。 去年取得了成绩。 所以 X 读了标题:Google 刚刚攻克了递归式自我改进。 Hacker News 阅读了 PDF:称其为 RSI 似乎具有误导性。 而同一周,一位竞争对手的 CEO 表示,这个循环从夏天就开始运行了, 所有人都应该放慢速度。

3:13 三句话,同样的两个词,三台不同的机器。 那么,周一,如何阅读下一篇 RSI 论文。 一:问哪个对象改变了,是权重、代码还是搜索设置; Dream-RSI 改变了第三个。 二:问谁被冻结了;这里是编码器、判断器和重写器, 全部三个。三:问标题数字是什么单位。 节省的计算是优化;模型以前无法达到的基准是 起飞,但还没有人发布过。

3:40 判决,幕后揭秘:NEEDS REVIEW。 循环是真实的,节省的开支是可测量的,封面上的两个词 描述的机器在论文中并不存在。 如果你宁愿阅读而不是听我说,The Daily Diff 每天早上免费发送到你的收件箱, 在 thedailydiff.dev,链接在下方。 在评论中告诉我接下来要打开什么。 这就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。

4:00 负责任地合并。

来源

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

相关视频

under-the-hood · zh-CN · 2026年9月24日

SAML 内部揭秘:信件里的签名

SAML 让你登录几乎所有工作应用,其签名存在于它签名的 XML 内部。深入探讨:应用、浏览器和身份提供商之间的登录流程,断言的样子,为什么规范化必须在每个字节上达成一致,以及为什么相同的错误类别从 2012 年到 2025 年不断重现。受 Trail of Bits 的“SAML:糟糕设计的碎片” (在 Hacker News 上获得 312 分) 启发。

3:02 ↗
under-the-hood · zh-CN · 2026年9月23日

模型“死亡”的幕后

人工智能模型不会死亡——它会有一个关闭日期,第二天早上,你的 API 调用将返回 404:“该模型已被弃用,点击此处了解更多信息。”幕后:四状态管道(活跃 → 遗留 → 弃用 → 退役)、通知窗口(OpenAI ≥ 6 个月 / 3 个月 / 预览版约 2 周;Anthropic ≥ 60 天)、开发者会遇到的问题(响亮的 404、静默的评估漂移、Claude 4.7+ 新的温度参数 400 错误

3:15 ↗
under-the-hood · zh-CN · 2026年9月19日

通行密钥,深入解析

通行密钥是您的设备生成的一个密码,它从不显示给您,也拒绝透露给任何人——包括您自己。深入解析:WebAuthn 仪式(每站点密钥对、挑战、签名)、浏览器写入的唯一能够阻止网络钓鱼的字段(来源)、设备绑定密钥与同步密钥、AAGUID,以及为什么“不可网络钓鱼”和“不可移动”是同一个属性——这也是“我不喜欢通行密钥”(在 Hacker News 上获得 616 积分)真正关心的。结论:NEEDS RE

3:12 ↗