خودبهبودی بازگشتی، پشت پرده
گوگل دیپمایند "Dream-RSI: خودبهبودی بازگشتی از طریق جهانهای در حال تکامل" را منتشر کرد – و مدل کدنویسی درون آن هرگز تغییر نمیکند.
گوگل دیپمایند "Dream-RSI: خودبهبودی بازگشتی از طریق جهانهای در حال تکامل" را منتشر کرد – و مدل کدنویسی درون آن هرگز تغییر نمیکند. پشت پرده: این عبارت برای ۶۰ سال چه معنایی داشت، چه چیزی واقعاً در Dream-RSI حلقه میزند (یک سیاست اکتشاف پایتون که بر درختان جستجوی ضبط شده "رویاپردازی" میکند)، و چرا ۳۱۷ فراخوانی عامل به جای ۵۵۰ یک تخفیف است، نه یک جهش. حکم: NEEDS REVIEW.
نسخه نوشتاری را بخوانید (انگلیسی) ↗
این ویدیو چه مواردی را پوشش میدهد
- ۱۹۶۵ ← ۲۰۰۸: "انفجار هوش" آی. جی. گود، هوش مصنوعی بذری یودکوفسکی — ماشینی که وزنهای خود را بازنویسی میکند
- ۲۰۲۵: AlphaEvolve — ضرب ماتریس ۴×۴ با ۴۸ ضرب، ۰.۷٪ از توان محاسباتی گوگل بازیابی شد، هستههای Gemini 23% سریعتر
- ۲۰۲۶: Dream-RSI — سیاست بهبود مییابد، کدنویس، داور و بازنویس همگی ثابت هستند؛ اعلان میگوید "وظیفه علمی را حل نکنید"
- X: "گوگل همین الان خودبهبودی بازگشتی را شکافت" (۸۱۹ لایک) در مقابل HN: "نامیدن این RSI به نظر گمراهکننده است"
- اعداد استفاده شده: §۴.۱ Lasso ۵۵۰ → ۳۱۷ فراخوانی عامل، ۳۵۸۷ → ۲۹۳۱ میلیثانیه؛ جدول ۱ بستهبندی دایره ۲.۶۳۵۹۸۳ = AlphaEvolveV2؛ §۴.۳ KernelBench ۲.۴۳× / ۱.۷۹× نسلهای کمتر، تا ۲.۰۹× سریعتر؛ پیوست B.2 اعلان (همه از PDF بالا)
رونوشت ترجمه شده
ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویسهای موجود توسط YouTube کنترل میشوند.
0:00 خودبهبودی بازگشتی ایدهای است که یک هوش مصنوعی خود را باهوشتر میکند، سپس از خود باهوشتر برای انجام دوباره آن استفاده میکند، و این هفته گوگل یک مقاله با این دو کلمه در عنوان آن منتشر کرد، که در آن وزنهای مدل هرگز حرکت نمیکنند. سه عدد. مدیرعامل Anthropic میگوید این حلقه از تابستان در حال اجراست، که دلیل او برای کند کردن کل صنعت است. توییت اعلام کننده اینکه گوگل همین الان آن را شکافت، هشتصد لایک را در یک روز جمع کرد.
0:24 و نتیجه اصلی مقاله خود، ۳۱۷ فراخوانی مدل به جای ۵۵۰ است، که یک تخفیف است، نه یک جهش. در سه دقیقه: این عبارت از کجا آمد، چه چیزی واقعاً در Dream-RSI حلقه میزند، و چگونه مقاله بعدی با RSI روی جلد را بخوانیم. این The Daily Diff است، پشت پرده. ۱۹۶۵. آی. جی. گود، یک آمارشناس پارک بلچلی که در کنار تورینگ کار میکرد، مینویسد که یک ماشین فوقهوشمند میتواند ماشینهای حتی بهتری طراحی کند،
0:52 آن را یک انفجار هوش و آخرین اختراعی که انسان باید انجام دهد مینامد، به شرطی که ماشین به اندازه کافی مطیع باشد تا به ما بگوید چگونه آن را کنترل کنیم، که این همان به شرطی است که مردم بعد از ویرگول خواندن را متوقف میکنند. برای چهل سال این عبارت دقیقاً به معنای آن بود: سیستمی که خود را ویرایش میکند منبع یا وزنها و هر بار باهوشتر بیرون میآید. مقاله سال ۲۰۰۸ الیزر یودکوفسکی آن را به کلمه اصلی ایمنی هوش مصنوعی تبدیل کرد، و هیچ کس ماشینی برای آزمایش آن نداشت، که وضعیت ایدهآل برای یک تعریف است. سپس در می ۲۰۲۵ دیپمایند AlphaEvolve را عرضه کرد،
1:23 یک عامل Gemini که کد را پیشنهاد میدهد، امتیاز میگیرد، برندگان را نگه میدارد و آنها را دوباره جهش میدهد. ماتریسهای مختلط چهار در چهار را در ۴۸ مرحله ضرب کرد، رکوردی را که اشترسن در ۱۹۶۹ ثبت کرده بود شکست، و حدود صفر ممیز هفت درصد از توان محاسباتی جهانی گوگل را بازیابی میکند، که در مقیاس گوگل، یک مرکز داده است که زیر مبل پیدا شده است. Gemini اکنون به آموزش Gemini کمک میکرد، و این عبارت بیصدا از بلاگهای ایمنی به بیانیههای مطبوعاتی منتقل شد. Dream-RSI یک کنترلکننده را روی آن حلقه قرار میدهد.
1:52 یک سیاست، یک برنامه واقعی پایتون، تصمیم میگیرد که کدام شاخههای درخت جستجو را توسعه دهد، چند تا به صورت موازی، و چه زمانی تسلیم شود. Gemini کد نامزد را مینویسد و یک ارزیاب ثابت آن را امتیاز میدهد. هر اجرا یک درخت از آنچه امتحان شد و امتیازی که گرفت پشت سر میگذارد. آن درخت به یک شبیهساز بازپخش تبدیل میشود: یک Gemini دوم، که به همان اندازه ثابت است، سیاست را بازنویسی میکند، و سیاست جدید در برابر نتایج ضبط شده آزمایش میشود به جای GPU های واقعی.
2:16 این مقاله این را رویاپردازی مینامد، و یک اجرای واقعی هزاران مورد رویایی را با هزینه اجرای صفر پرداخت میکند. برنده دوباره آنلاین میشود، مجموعه جهانهای ضبط شده رشد میکند، تکرار کنید. و اعلان در پیوست B.2 به هوش مصنوعی خودبهبود، به صورت کتبی: فقط این یک فایل را ویرایش کنید، و وظیفه علمی را حل نکنید. اندازهگیری شد. در وظیفه حلکننده Lasso، اکتشاف ثابت ۵۵۰ فراخوانی Gemini را برای رسیدن به سه ممیز شش ثانیه صرف کرد، Dream-RSI ۳۱۷ فراخوانی را برای رسیدن به دو ممیز نه صرف کرد، و هر دو scikit-learn را شکست دادند.
2:46 در KernelBench به همان سرعت هسته با حدود دو ممیز چهار برابر نسلهای کمتر رسید. و در بستهبندی دایرهای امتیاز دو ممیز شش سه پنج نه هشت سه را کسب کرد، که دقیقاً، تا شش رقم اعشار، همان چیزی است که نسخه دوم AlphaEvolve سال گذشته امتیاز گرفت. پس X عنوان را خواند: گوگل همین الان خودبهبودی بازگشتی را شکافت. Hacker News PDF را خواند: نامیدن این RSI به نظر گمراهکننده است. و در همان هفته مدیرعامل یک رقیب گفت که حلقه از تابستان در حال اجراست و همه باید کند شوند.
3:13 سه جمله، همان دو کلمه، سه ماشین متفاوت. خب، دوشنبه، چگونه مقاله بعدی RSI را بخوانیم. یک: بپرسید چه چیزی تغییر میکند، وزنها، کد، یا تنظیمات جستجو؛ Dream-RSI سومی را تغییر میدهد. دو: بپرسید چه کسی ثابت است؛ اینجا کدنویس، داور و بازنویس هستند، هر سه. سه: بپرسید عدد اصلی واحد چه چیزی است. محاسبات صرفهجویی شده بهینهسازی است؛ یک معیار که مدل قبلاً نمیتوانست به آن برسد یک جهش است، و هنوز کسی آن را منتشر نکرده است.
3:40 حکم، پشت پرده: NEEDS REVIEW. حلقه واقعی است، صرفهجوییها اندازهگیری شدهاند، و دو کلمه روی جلد ماشینی را توصیف میکنند که در مقاله نیست. اگر ترجیح میدهید این را بخوانید تا اینکه من آن را بگویم، The Daily Diff هر روز صبح به صندوق پستی شما میرسد، رایگان در thedailydiff.dev، لینک در زیر. در نظرات به من بگویید دفعه بعد چه چیزی را باز کنم. و این The Daily Diff امروز است. من نیکو از Axrisi هستم.
4:00 مسئولانه ادغام کنید.
منابع
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



