# خودبهبودی بازگشتی، پشت پرده

Published: 2026-09-18

گوگل دیپ‌مایند "Dream-RSI: خودبهبودی بازگشتی از طریق جهان‌های در حال تکامل" را منتشر کرد – و مدل کدنویسی درون آن هرگز تغییر نمی‌کند. پشت پرده: این عبارت برای ۶۰ سال چه معنایی داشت، چه چیزی واقعاً در Dream-RSI حلقه می‌زند (یک سیاست اکتشاف پایتون که بر درختان جستجوی ضبط شده "رویاپردازی" می‌کند)، و چرا ۳۱۷ فراخوانی عامل به جای ۵۵۰ یک تخفیف است، نه یک جهش. حکم: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/fa/video/2026-09-18-self-improving-ai/

## این ویدیو چه مواردی را پوشش می‌دهد

- ۱۹۶۵ ← ۲۰۰۸: "انفجار هوش" آی. جی. گود، هوش مصنوعی بذری یودکوفسکی — ماشینی که وزن‌های خود را بازنویسی می‌کند
- ۲۰۲۵: AlphaEvolve — ضرب ماتریس ۴×۴ با ۴۸ ضرب، ۰.۷٪ از توان محاسباتی گوگل بازیابی شد، هسته‌های Gemini 23% سریع‌تر
- ۲۰۲۶: Dream-RSI — سیاست بهبود می‌یابد، کدنویس، داور و بازنویس همگی ثابت هستند؛ اعلان می‌گوید "وظیفه علمی را حل نکنید"
- X: "گوگل همین الان خودبهبودی بازگشتی را شکافت" (۸۱۹ لایک) در مقابل HN: "نامیدن این RSI به نظر گمراه‌کننده است"
- اعداد استفاده شده: §۴.۱ Lasso ۵۵۰ → ۳۱۷ فراخوانی عامل، ۳۵۸۷ → ۲۹۳۱ میلی‌ثانیه؛ جدول ۱ بسته‌بندی دایره ۲.۶۳۵۹۸۳ = AlphaEvolveV2؛ §۴.۳ KernelBench ۲.۴۳× / ۱.۷۹× نسل‌های کمتر، تا ۲.۰۹× سریع‌تر؛ پیوست B.2 اعلان (همه از PDF بالا)

## رونوشت ترجمه شده

ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویس‌های موجود توسط YouTube کنترل می‌شوند.

0:00 خودبهبودی بازگشتی ایده‌ای است که یک هوش مصنوعی خود را باهوش‌تر می‌کند، سپس از خود باهوش‌تر برای انجام دوباره آن استفاده می‌کند، و این هفته گوگل یک مقاله با این دو کلمه در عنوان آن منتشر کرد، که در آن وزن‌های مدل هرگز حرکت نمی‌کنند. سه عدد. مدیرعامل Anthropic می‌گوید این حلقه از تابستان در حال اجراست، که دلیل او برای کند کردن کل صنعت است. توییت اعلام کننده اینکه گوگل همین الان آن را شکافت، هشتصد لایک را در یک روز جمع کرد.

0:24 و نتیجه اصلی مقاله خود، ۳۱۷ فراخوانی مدل به جای ۵۵۰ است، که یک تخفیف است، نه یک جهش. در سه دقیقه: این عبارت از کجا آمد، چه چیزی واقعاً در Dream-RSI حلقه می‌زند، و چگونه مقاله بعدی با RSI روی جلد را بخوانیم. این The Daily Diff است، پشت پرده. ۱۹۶۵. آی. جی. گود، یک آمارشناس پارک بلچلی که در کنار تورینگ کار می‌کرد، می‌نویسد که یک ماشین فوق‌هوشمند می‌تواند ماشین‌های حتی بهتری طراحی کند،

0:52 آن را یک انفجار هوش و آخرین اختراعی که انسان باید انجام دهد می‌نامد، به شرطی که ماشین به اندازه کافی مطیع باشد تا به ما بگوید چگونه آن را کنترل کنیم، که این همان به شرطی است که مردم بعد از ویرگول خواندن را متوقف می‌کنند. برای چهل سال این عبارت دقیقاً به معنای آن بود: سیستمی که خود را ویرایش می‌کند منبع یا وزن‌ها و هر بار باهوش‌تر بیرون می‌آید. مقاله سال ۲۰۰۸ الیزر یودکوفسکی آن را به کلمه اصلی ایمنی هوش مصنوعی تبدیل کرد، و هیچ کس ماشینی برای آزمایش آن نداشت، که وضعیت ایده‌آل برای یک تعریف است. سپس در می ۲۰۲۵ دیپ‌مایند AlphaEvolve را عرضه کرد،

1:23 یک عامل Gemini که کد را پیشنهاد می‌دهد، امتیاز می‌گیرد، برندگان را نگه می‌دارد و آنها را دوباره جهش می‌دهد. ماتریس‌های مختلط چهار در چهار را در ۴۸ مرحله ضرب کرد، رکوردی را که اشترسن در ۱۹۶۹ ثبت کرده بود شکست، و حدود صفر ممیز هفت درصد از توان محاسباتی جهانی گوگل را بازیابی می‌کند، که در مقیاس گوگل، یک مرکز داده است که زیر مبل پیدا شده است. Gemini اکنون به آموزش Gemini کمک می‌کرد، و این عبارت بی‌صدا از بلاگ‌های ایمنی به بیانیه‌های مطبوعاتی منتقل شد. Dream-RSI یک کنترل‌کننده را روی آن حلقه قرار می‌دهد.

1:52 یک سیاست، یک برنامه واقعی پایتون، تصمیم می‌گیرد که کدام شاخه‌های درخت جستجو را توسعه دهد، چند تا به صورت موازی، و چه زمانی تسلیم شود. Gemini کد نامزد را می‌نویسد و یک ارزیاب ثابت آن را امتیاز می‌دهد. هر اجرا یک درخت از آنچه امتحان شد و امتیازی که گرفت پشت سر می‌گذارد. آن درخت به یک شبیه‌ساز بازپخش تبدیل می‌شود: یک Gemini دوم، که به همان اندازه ثابت است، سیاست را بازنویسی می‌کند، و سیاست جدید در برابر نتایج ضبط شده آزمایش می‌شود به جای GPU های واقعی.

2:16 این مقاله این را رویاپردازی می‌نامد، و یک اجرای واقعی هزاران مورد رویایی را با هزینه اجرای صفر پرداخت می‌کند. برنده دوباره آنلاین می‌شود، مجموعه جهان‌های ضبط شده رشد می‌کند، تکرار کنید. و اعلان در پیوست B.2 به هوش مصنوعی خودبهبود، به صورت کتبی: فقط این یک فایل را ویرایش کنید، و وظیفه علمی را حل نکنید. اندازه‌گیری شد. در وظیفه حل‌کننده Lasso، اکتشاف ثابت ۵۵۰ فراخوانی Gemini را برای رسیدن به سه ممیز شش ثانیه صرف کرد، Dream-RSI ۳۱۷ فراخوانی را برای رسیدن به دو ممیز نه صرف کرد، و هر دو scikit-learn را شکست دادند.

2:46 در KernelBench به همان سرعت هسته با حدود دو ممیز چهار برابر نسل‌های کمتر رسید. و در بسته‌بندی دایره‌ای امتیاز دو ممیز شش سه پنج نه هشت سه را کسب کرد، که دقیقاً، تا شش رقم اعشار، همان چیزی است که نسخه دوم AlphaEvolve سال گذشته امتیاز گرفت. پس X عنوان را خواند: گوگل همین الان خودبهبودی بازگشتی را شکافت. Hacker News PDF را خواند: نامیدن این RSI به نظر گمراه‌کننده است. و در همان هفته مدیرعامل یک رقیب گفت که حلقه از تابستان در حال اجراست و همه باید کند شوند.

3:13 سه جمله، همان دو کلمه، سه ماشین متفاوت. خب، دوشنبه، چگونه مقاله بعدی RSI را بخوانیم. یک: بپرسید چه چیزی تغییر می‌کند، وزن‌ها، کد، یا تنظیمات جستجو؛ Dream-RSI سومی را تغییر می‌دهد. دو: بپرسید چه کسی ثابت است؛ اینجا کدنویس، داور و بازنویس هستند، هر سه. سه: بپرسید عدد اصلی واحد چه چیزی است. محاسبات صرفه‌جویی شده بهینه‌سازی است؛ یک معیار که مدل قبلاً نمی‌توانست به آن برسد یک جهش است، و هنوز کسی آن را منتشر نکرده است.

3:40 حکم، پشت پرده: NEEDS REVIEW. حلقه واقعی است، صرفه‌جویی‌ها اندازه‌گیری شده‌اند، و دو کلمه روی جلد ماشینی را توصیف می‌کنند که در مقاله نیست. اگر ترجیح می‌دهید این را بخوانید تا اینکه من آن را بگویم، The Daily Diff هر روز صبح به صندوق پستی شما می‌رسد، رایگان در thedailydiff.dev، لینک در زیر. در نظرات به من بگویید دفعه بعد چه چیزی را باز کنم. و این The Daily Diff امروز است. من نیکو از Axrisi هستم.

4:00 مسئولانه ادغام کنید.

## منابع

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
