ریکرسیو سیلف امپرومنٹ، اندر کی کہانی
گوگل ڈیپ مائنڈ نے "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" شائع کیا — اور اس کے اندر کا کوڈنگ ماڈل کبھی نہیں بدلتا۔
گوگل ڈیپ مائنڈ نے "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" شائع کیا — اور اس کے اندر کا کوڈنگ ماڈل کبھی نہیں بدلتا۔ اندر کی کہانی: اس جملے کا 60 سال تک کیا مطلب تھا، Dream-RSI میں اصل میں کیا لوپ ہوتا ہے (ایک Python ایکسپلوریشن پالیسی جو ریکارڈ شدہ سرچ ٹریز پر "خواب دیکھتی ہے")، اور کیوں 550 کے بجائے 317 ایجنٹ کالز چھوٹ ہیں، کوئی اڑان نہیں۔ فیصلہ: NEEDS REVIEW۔
تحریری ایڈیشن پڑھیں (انگریزی) ↗
اس ویڈیو میں کیا شامل ہے
- 1965 → 2008: I. J. Good کا "intelligence explosion"، Yudkowsky کی سیڈ AI — ایک مشین جو اپنے وزن کو دوبارہ لکھتی ہے۔
- 2025: AlphaEvolve — 48 گنا 4×4 میٹرکس ضرب، گوگل کے کمپیوٹ کا 0.7% دوبارہ حاصل کیا گیا، Gemini کرنل 23% تیز۔
- 2026: Dream-RSI — پالیسی بہتر ہوتی ہے، کوڈر، جج اور ری رائٹر سب منجمد ہوتے ہیں؛ پرامپٹ کہتا ہے "سائنسی کام کو حل نہ کریں"۔
- X: "گوگل نے ابھی ریکرسیو سیلف امپرومنٹ کریک کر دیا" (819 لائکس) بمقابلہ HN: "اسے RSI کہنا گمراہ کن معلوم ہوتا ہے"۔
- استعمال شدہ نمبر: §4.1 Lasso 550 → 317 ایجنٹ کالز، 3587 → 2931 ms؛ جدول 1 سرکل پیکنگ 2.635983 = AlphaEvolveV2؛ §4.3 KernelBench 2.43× / 1.79× کم نسلیں، 2.09× تک تیز؛ ضمیمہ B.2 پرامپٹ (سب اوپر دی گئی PDF سے)۔
ترجمہ شدہ ٹرانسکرپٹ
اصل انگریزی بیان سے ترجمہ کیا گیا۔ دستیاب آڈیو اور کیپشنز یوٹیوب کے زیر انتظام ہیں۔
0:00 ریکرسیو سیلف امپرومنٹ اس خیال کا نام ہے کہ ایک AI خود کو زیادہ ذہین بناتا ہے، پھر اس زیادہ ذہین خود کو دوبارہ ایسا کرنے کے لیے استعمال کرتا ہے، اور اس ہفتے گوگل نے ایک ایسا مقالہ شائع کیا جس کے عنوان میں یہ دو الفاظ تھے، جس میں ماڈل کے وزن کبھی حرکت نہیں کرتے۔ تین نمبر۔ Anthropic کے CEO کا کہنا ہے کہ یہ لوپ موسم گرما سے چل رہا ہے، جو پوری صنعت کو سست کرنے کی اس کی وجہ ہے۔ گوگل نے ابھی اسے کریک کرنے کا اعلان کرنے والی ٹویٹ کو ایک دن میں آٹھ سو لائکس ملے ایک دن میں۔
0:24 اور مقالے کا اپنا ہیڈلائن نتیجہ 550 کے بجائے 317 ماڈل کالز ہے، جو ایک رعایت ہے، کوئی اڑان نہیں۔ تین منٹ میں: یہ جملہ کہاں سے آیا، Dream-RSI کے اندر اصل میں کیا لوپ ہوتا ہے، اور RSI کے ساتھ اگلا مقالہ کیسے پڑھیں۔ یہ The Daily Diff ہے، اندر کی کہانی۔ 1965۔ I. J۔ Good، ایک Bletchley Park کے ماہر شماریات جو ٹیورنگ کے ساتھ کام کرتے تھے، لکھتے ہیں کہ ایک انتہائی ذہین مشین اور بھی بہتر مشینیں ڈیزائن کر سکتی ہے،
0:52 اسے انٹیلی جنس ایکسپلوزن کہتے ہیں اور انسان کی آخری ایجاد جو اسے کبھی بنانی ہوگی، بشرطیکہ مشین اتنی فرمانبردار ہو کہ ہمیں یہ بتا سکے کہ اسے کیسے کنٹرول کیا جائے، جو کہ provided-that لوگ وقفے کے بعد پڑھنا بند کر دیتے ہیں۔ چالیس سال تک اس جملے کا مطلب بالکل یہی تھا: ایک ایسا نظام جو اپنی خود کی سورس یا وزن میں ترمیم کرتا ہے اور ہر گزرنے کے ساتھ زیادہ ذہین ہوتا جاتا ہے۔ Eliezer Yudkowsky کا 2008 کا مضمون اسے AI سیفٹی کا بنیادی لفظ بنا گیا، اور کسی کے پاس اسے آزمانے کے لیے مشین نہیں تھی، جو کہ تعریف کے لیے مثالی حالت ہے ایک تعریف۔ پھر مئی 2025 میں DeepMind نے AlphaEvolve بھیجا،
1:23 ایک Gemini ایجنٹ جو کوڈ تجویز کرتا ہے، اسے سکور کرتا ہے، فاتحین کو رکھتا ہے اور انہیں دوبارہ متغیر کرتا ہے۔ اس نے چار بائی چار کمپلیکس میٹرکس کو 48 مراحل میں ضرب دیا، جس نے 1969 میں Strassen کے قائم کردہ ریکارڈ کو مات دی، اور یہ گوگل کے عالمی کمپیوٹ کا تقریباً صفر پوائنٹ سات فیصد دوبارہ حاصل کرتا ہے، جو گوگل کے پیمانے پر ایک ڈیٹا سینٹر ہے جو صوفے کے نیچے پایا جاتا ہے۔ Gemini اب Gemini کو تربیت دینے میں مدد کر رہا تھا، اور یہ جملہ خاموشی سے سیفٹی بلاگز سے پریس ریلیز میں منتقل ہو گیا۔ Dream-RSI اس لوپ کے اوپر ایک کنٹرولر کو جوڑتا ہے۔
1:52 ایک پالیسی، ایک حقیقی Python پروگرام، فیصلہ کرتا ہے کہ سرچ ٹری کی کون سی شاخوں کو توسیع دی جائے، کتنی متوازی طور پر، اور کب ہار مان لی جائے۔ Gemini امیدوار کوڈ لکھتا ہے، اور ایک مقررہ ایویلیوٹر اسے سکور کرتا ہے۔ ہر رن ایک درخت پیچھے چھوڑ جاتا ہے کہ کیا کوشش کی گئی اور کیا اس کا سکور تھا۔ وہ درخت ایک ری پلے سمیلیٹر بن جاتا ہے: ایک دوسرا، یکساں طور پر منجمد Gemini پالیسی کو دوبارہ لکھتا ہے، اور نئی پالیسی کو ریکارڈ شدہ نتائج کے خلاف جانچا جاتا ہے بجائے اس کے کہ حقیقی GPUs پر۔
2:16 مقالہ اسے خواب دیکھنا کہتا ہے، اور ایک حقیقی رن ہزاروں خواب دیدہ رنز کی ادائیگی کرتا ہے بغیر کسی عملدرآمد لاگت کے۔ فاتح واپس آن لائن جاتا ہے، ریکارڈ شدہ دنیاؤں کا پول بڑھتا ہے، دہرائیں۔ اور ضمیمہ B.2 میں پرامپٹ خود کو بہتر بنانے والی AI کو، لکھ کر بتاتا ہے: صرف اس ایک فائل میں ترمیم کریں، اور سائنسی کام کو حل نہ کریں۔ ناپا گیا۔ Lasso سالور ٹاسک پر، مقررہ ایکسپلوریشن نے تین اعشاریہ چھ سیکنڈ تک پہنچنے کے لیے 550 Gemini کالز صرف کیں، Dream-RSI نے دو اعشاریہ نو تک پہنچنے کے لیے 317 صرف کیں، اور دونوں نے scikit-learn کو مات دی۔
2:46 KernelBench پر اس نے تقریباً دو اعشاریہ چار گنا کم نسلوں کے ساتھ وہی کرنل سپیڈ حاصل کی۔ اور سرکل پیکنگ پر اس نے دو اعشاریہ چھ تین پانچ نو آٹھ تین سکور کیا، جو بالکل، چھ اعشاریہ تک، وہی ہے جو AlphaEvolve ورژن دو نے گزشتہ سال سکور کیا تھا۔ تو X نے عنوان پڑھا: گوگل نے ابھی ریکرسیو سیلف امپرومنٹ کریک کر دیا ہے۔ Hacker News نے PDF پڑھا: اسے RSI کہنا گمراہ کن معلوم ہوتا ہے۔ اور اسی ہفتے ایک حریف کے CEO نے کہا کہ لوپ موسم گرما سے چل رہا ہے اور سب کو سست ہو جانا چاہیے۔
3:13 تین جملے، وہی دو الفاظ، تین مختلف مشینیں ہیں۔ تو، پیر، اگلا RSI مقالہ کیسے پڑھیں۔ ایک: پوچھیں کہ کون سا آبجیکٹ بدلتا ہے، وزن، کوڈ، یا سرچ سیٹنگز؛ Dream-RSI تیسرے کو بدلتا ہے۔ دو: پوچھیں کہ کون منجمد ہے؛ یہاں یہ کوڈر، جج اور ری رائٹر ہیں، تینوں۔ تین: پوچھیں کہ ہیڈلائن نمبر کس یونٹ کا ہے۔ بچایا گیا کمپیوٹ آپٹیمائزیشن ہے؛ ایک بینچ مارک جو ماڈل پہلے نہیں پہنچ سکا وہ ٹیک آف ہے، اور کسی نے ابھی تک وہ شائع نہیں کیا ہے۔
3:40 فیصلہ، اندر کی کہانی: NEEDS REVIEW۔ لوپ حقیقی ہے، بچتیں ناپی گئی ہیں، اور سرورق پر دو الفاظ ایک ایسی مشین کی وضاحت کرتے ہیں جو مقالے میں نہیں ہے۔ اگر آپ یہ پڑھنا پسند کریں گے بجائے اس کے کہ میں اسے کہوں، تو ڈیف ہر صبح آپ کے ان باکس میں آتا ہے، daily diff dot dev پر مفت، لنک نیچے ہے۔ تبصروں میں مجھے بتائیں کہ اگلا کیا کھولوں۔ اور آج کے لیے بس اتنا ہی ڈیف تھا۔ میں Axrisi سے Niko ہوں۔
4:00 ذمہ داری سے ضم کریں۔
ذرائع
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



