# 再帰的自己改善、その裏側

Published: 2026-09-18

Google DeepMindは「Dream-RSI: 再帰的自己改善による進化する世界」を発表しました。その中にあるコーディングモデルは決して変わりません。その裏側では、60年間このフレーズが何を意味してきたのか、Dream-RSI（記録された探索木上で「夢を見る」Python探索ポリシー）で実際にループしているもの、そして550ではなく317のエージェント呼び出しが割引であって離陸ではない理由が語られます。評決：NEEDS REVIEW。

Canonical: https://thedailydiff.dev/ja/video/2026-09-18-self-improving-ai/

## この動画の要点

- 1965年 → 2008年：I. J. Goodの「知能爆発」、ユドコウスキーのシードAI — 自身の重みを書き換える機械
- 2025年：AlphaEvolve — 48回の乗算による4×4行列乗算、Googleの計算能力の0.7%を回復、Geminiカーネルが23%高速化
- 2026年：Dream-RSI — ポリシーは改善されるが、コーダー、評価者、書き換えはすべて固定されている。プロンプトは「科学的タスクを解決しないこと」と指示
- X: 「Googleは再帰的自己改善を達成したばかりだ」（819いいね）vs HN: 「これをRSIと呼ぶのは誤解を招くようだ」
- 使用された数値：§4.1 Lasso 550 → 317のエージェント呼び出し、3587 → 2931 ms；表1 円充填 2.635983 = AlphaEvolveV2；§4.3 KernelBench 2.43× / 1.79×少ない世代数、最大2.09×高速化；付録B.2 プロンプト（すべて上記のPDFより）

## 翻訳されたトランスクリプト

オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。

0:00 再帰的自己改善とは、AIが自分自身を賢くするという考え方で、 その賢くなった自分を使って再びそれを行う、そして今週Googleは その二つの言葉をタイトルに含む論文を発表しました。その中でモデルの重みは決して 動きません。3つの数字。 AnthropicのCEOは、このループが夏から続いていると言っています、 それが彼が業界全体を減速させる理由です。 Googleがそれを達成したと発表したツイートは、1日で800件の「いいね」を集めました。 1日で。

0:24 そして、この論文の主要な結果は、550回のモデル呼び出しではなく317回で、 これは割引であり、離陸ではありません。 3分で：このフレーズがどこから来たのか、Dream-RSIの内部で実際にループしているもの、 そしてRSIが表紙にある次の論文をどう読むか。 これはThe Daily Diff、その裏側です。 1965年。I. J. チューリングの隣で働いていたブレッチリーパークの統計学者であるグッドは、 超知能機械がさらに優れた機械を設計できると書き、

0:52 それを知能爆発と呼び、人間がこれまでに必要とする最後の発明だとしました。 ただし、その機械が十分に温厚で、我々にそれを制御する方法を教えることができるならば、と。 それが「ただし」の人々がカンマの後に読み続けるのをやめてしまうところです。 40年間、このフレーズはまさにそれを意味していました：自身のソースや重みを編集し、 毎回賢くなっていくシステムです。 エリーザー・ユドコウスキーの2008年のエッセイにより、AI安全保障の主要な言葉となり、 誰もそれをテストする機械を持っていませんでした。これは定義にとって理想的な条件です。 その後、2025年5月にDeepMindはAlphaEvolveを出荷しました。

1:23 これはコードを提案し、スコア付けされ、勝者を保持して再び変異させるGeminiエージェントです。 これは48ステップで4×4の複素行列を乗算し、 1969年にStrassenが打ち立てた記録を破り、Googleの全世界の計算能力の約0.7%を回復します。Googleの規模では、 これはソファの下で見つかったデータセンターに匹敵します。 ソファの下で見つかったデータセンターに匹敵します。 Geminiは今やGeminiのトレーニングを助けており、このフレーズは静かに安全保障ブログから プレスリリースへと移行しました。 Dream-RSIは、そのループの上にコントローラーをボルトで固定します。

1:52 ポリシー、つまり実際のPythonプログラムが、 探索木のどのブランチを 展開するか、いくつ並行して行うか、そしていつ諦めるかを決定します。 Geminiが候補コードを書き、固定された評価者がそれを採点します。 各実行は、試されたこととそれらのスコアのツリーを残します。 そのツリーはリプレイシミュレーターとなります。2番目の、同様に固定されたGeminiが ポリシーを書き換え、新しいポリシーは実際のGPUではなく、記録された結果に対してテストされます。 実際のGPUではなく、記録された結果に対してテストされます。

2:16 この論文はこれを夢見と呼び、1回の実際の実行で数千回の夢見た実行を 実行コストゼロでまかなうことができます。 勝者はオンラインに戻り、記録された世界のプールは成長し、 繰り返されます。そして付録B.2のプロンプトは、自己改善AIに書面で、 書面で：この1つのファイルのみを編集し、科学的タスクを解決しないように指示します。 測定されました。Lassoソルバータスクでは、固定探索は3.6秒に到達するのに550回のGemini呼び出しを費やし、 Dream-RSIは2.9秒に到達するのに317回を費やし、 どちらもscikit-learnを上回りました。

2:46 KernelBenchでは、約2.4倍少ない世代で同じカーネル速度に達しました。 円充填では2.635983というスコアを記録しました。これは、AlphaEvolveバージョン2が昨年記録したスコアと、 正確に小数点以下6桁まで一致します。 昨年記録したスコアと、正確に小数点以下6桁まで一致します。 だからXはタイトルを読みました：「Googleは再帰的自己改善を達成したばかりだ」。 Hacker NewsはPDFを読みました：「これをRSIと呼ぶのは誤解を招くようだ」。 そして同じ週、競合他社のCEOは、このループが夏から続いており、 誰もが減速すべきだと述べました。

3:13 3つの文、同じ2つの言葉、3つの異なる機械。 では月曜日、次のRSI論文をどう読むか。 1つ：何が変わるのか、重みか、コードか、探索設定かを問いかけます。Dream-RSIは3番目を変更します。 Dream-RSIは3番目を変更します。 2つ：誰が固定されているのかを問いかけます。ここでは、コーダー、評価者、リライターの3人全員です。 3人全員です。3つ：主要な数値が何の単位であるかを問いかけます。 計算の節約は最適化です。以前モデルが到達できなかったベンチマークは 離陸であり、それはまだ誰も発表していません。

3:40 評決、その裏側：NEEDS REVIEW。 ループは現実のものであり、節約は測定されており、表紙の2つの言葉は 論文には書かれていない機械について説明しています。 私が話すよりもこれを読みたい場合は、毎朝The Daily Diffが受信トレイに届きます。 毎日無料でthedailydiff.devで入手できます。リンクは下にあります。 次に何を開くべきかコメントで教えてください。 そして今日の差分は以上です。 私はAxrisiのNikoです。

4:00 Merge responsibly.

## 情報源

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
