# रिकर्सिव सेल्फ-इम्प्रूवमेंट, अंडर द हुड

Published: 2026-09-18

गूगल डीपमाइंड ने "ड्रीम-आरएसआई: इवॉल्विंग वर्ल्ड्स के माध्यम से रिकर्सिव सेल्फ-इम्प्रूवमेंट" प्रकाशित किया — और इसमें शामिल कोडिंग मॉडल कभी नहीं बदलता। अंडर द हुड: इस वाक्यांश का 60 वर्षों से क्या मतलब था, ड्रीम-आरएसआई में वास्तव में क्या लूप होता है (एक पायथन एक्सप्लोरेशन पॉलिसी जो रिकॉर्डेड सर्च ट्रीज़ पर "सपने देखती है"), और क्यों 550 के बजाय 317 एजेंट कॉल छूट है, न कि टेकऑफ़। फैसला: NEEDS REVIEW।

Canonical: https://thedailydiff.dev/hi/video/2026-09-18-self-improving-ai/

## इस वीडियो में क्या शामिल है

- 1965 → 2008: आई. जे. गुड का "इंटेलिजेंस एक्सप्लोजन", युडकोव्स्की का सीड एआई — एक मशीन जो अपने स्वयं के वेट्स को फिर से लिखती है
- 2025: अल्फाईवॉल्व — 48-गुणा 4×4 मैट्रिक्स गुणा, गूगल के कंप्यूट का 0.7% बरामद, जेमिनी कर्नेल 23% तेज़
- 2026: ड्रीम-आरएसआई — नीति में सुधार होता है, कोडर, जज और रीराइटर सभी स्थिर होते हैं; प्रॉम्प्ट कहता है "वैज्ञानिक कार्य को हल न करें"
- एक्स: "गूगल ने अभी-अभी रिकर्सिव सेल्फ-इम्प्रूवमेंट में महारत हासिल की" (819 लाइक) बनाम एचएन: "इसे आरएसआई कहना भ्रामक लगता है"
- उपयोग की गई संख्याएँ: §4.1 लासो 550 → 317 एजेंट कॉल, 3587 → 2931 ms; तालिका 1 सर्कल पैकिंग 2.635983 = अल्फाईवॉल्ववी2; §4.3 कर्नेल बेंच 2.43× / 1.79× कम जनरेशन, 2.09× तक तेज़; परिशिष्ट बी.2 प्रॉम्प्ट (सभी उपरोक्त पीडीएफ से)

## अनुवादित प्रतिलेख

मूल अंग्रेजी कथन से अनुवादित। उपलब्ध ऑडियो और कैप्शन YouTube द्वारा नियंत्रित होते हैं।

0:00 रिकर्सिव सेल्फ-इम्प्रूवमेंट यह विचार है कि एक एआई खुद को अधिक स्मार्ट बनाता है, फिर उसी स्मार्ट स्वयं का उपयोग इसे फिर से करने के लिए करता है, और इस सप्ताह गूगल ने एक पेपर प्रकाशित किया जिसके शीर्षक में वे दो शब्द थे, जिसमें मॉडल के वेट्स कभी नहीं बदलते। तीन संख्याएँ। एंथ्रोपिक के सीईओ का कहना है कि यह लूप गर्मियों से चल रहा है, जो उनके पूरे उद्योग को धीमा करने का कारण है। यह घोषणा करने वाला ट्वीट कि गूगल ने अभी-अभी इसे क्रैक किया है, एक दिन में आठ सौ लाइक इकट्ठा कर चुका है।

0:24 और पेपर का अपना मुख्य परिणाम 550 के बजाय 317 मॉडल कॉल है, जो एक छूट है, न कि टेकऑफ़। तीन मिनट में: यह वाक्यांश कहाँ से आया, ड्रीम-आरएसआई के अंदर वास्तव में क्या लूप होता है, और कवर पर आरएसआई के साथ अगले पेपर को कैसे पढ़ें। यह The Daily Diff है, अंडर द हुड। 1965। आई. जे. गुड, ब्लेचले पार्क के एक सांख्यिकीविद् जिन्होंने ट्यूरिंग के बगल में काम किया, लिखते हैं कि एक अति-बुद्धिमान मशीन और भी बेहतर मशीनें डिज़ाइन कर सकती है,

0:52 इसे एक बुद्धिमत्ता विस्फोट और अंतिम आविष्कार कहते हैं जो मनुष्य को कभी करना होगा, बशर्ते मशीन इतनी विनम्र हो कि हमें यह बता सके कि इसे कैसे नियंत्रित किया जाए, जो 'बशर्ते' वाले लोग कॉमा के बाद पढ़ना बंद कर देते हैं। चालीस वर्षों तक इस वाक्यांश का यही मतलब था: एक ऐसी प्रणाली जो अपने स्वयं के स्रोत या वेट्स को संपादित करती है और हर पास में अधिक स्मार्ट निकलती है। एलिज़र युडकोव्स्की के 2008 के निबंध ने इसे एआई सुरक्षा का लोड-बियरिंग शब्द बना दिया, और किसी के पास इसे परीक्षण करने के लिए मशीन नहीं थी, जो एक परिभाषा के लिए आदर्श स्थिति है। फिर मई 2025 में डीपमाइंड ने AlphaEvolve भेजा,

1:23 एक जेमिनी एजेंट जो कोड प्रस्तावित करता है, उसे स्कोर मिलता है, विजेताओं को रखता है और उन्हें फिर से उत्परिवर्तित करता है। इसने 48 चरणों में चार-ब-चार जटिल मैट्रिक्स को गुणा किया, 1969 में स्ट्रैसेन द्वारा स्थापित एक रिकॉर्ड को तोड़ते हुए, और यह गूगल के विश्वव्यापी कंप्यूट का लगभग शून्य दशमलव सात प्रतिशत वसूल करता है, जो गूगल के पैमाने पर एक सोफे के नीचे मिला डेटा सेंटर है। जेमिनी अब जेमिनी को प्रशिक्षित करने में मदद कर रहा था, और यह वाक्यांश चुपचाप सुरक्षा ब्लॉग से प्रेस विज्ञप्तियों में चला गया। Dream-RSI उस लूप के ऊपर एक नियंत्रक बोल्ट करता है।

1:52 एक नीति, एक वास्तविक पायथन प्रोग्राम, तय करती है कि सर्च ट्री की कौन सी शाखाओं का विस्तार किया जाए, कितनी समानांतर में, और कब हार माननी है। जेमिनी उम्मीदवार कोड लिखता है, और एक निश्चित मूल्यांकनकर्ता उसे स्कोर करता है। हर रन पीछे छोड़ता है कि क्या कोशिश की गई थी और उसने क्या स्कोर किया। वह ट्री एक रिप्ले सिम्युलेटर बन जाता है: एक दूसरा, समान रूप से स्थिर जेमिनी नीति को फिर से लिखता है, और नई नीति का परीक्षण वास्तविक जीपीयू के बजाय रिकॉर्डेड परिणामों के खिलाफ किया जाता है। रियल जीपीयू पर।

2:16 यह पेपर इसे 'सपना देखना' कहता है, और एक वास्तविक रन हजारों सपने देखे गए लोगों के लिए शून्य निष्पादन लागत पर भुगतान करता है। विजेता वापस ऑनलाइन जाता है, रिकॉर्ड की गई दुनिया का पूल बढ़ता है, दोहराएं। और परिशिष्ट बी.2 में प्रॉम्प्ट सेल्फ-इम्प्रूविंग एआई को बताता है, लिखित रूप में: केवल इस एक फ़ाइल को संपादित करें, और वैज्ञानिक कार्य को हल न करें। मापा गया। लासो सॉल्वर टास्क पर, निश्चित अन्वेषण ने 3.6 सेकंड तक पहुंचने के लिए 550 जेमिनी कॉल खर्च किए, Dream-RSI ने 2.9 तक पहुंचने के लिए 317 खर्च किए, और दोनों ने scikit-learn को हराया। और दोनों ने scikit-learn को हराया।

2:46 KernelBench पर यह लगभग 2.4 गुना कम पीढ़ियों के साथ समान कर्नेल गति तक पहुंच गया। और सर्कल पैकिंग पर इसने 2.635983 स्कोर किया, जो ठीक पिछले साल AlphaEvolve संस्करण दो ने स्कोर किया था, जो छह दशमलव स्थानों तक ठीक वही है, जो AlphaEvolve संस्करण दो ने पिछले साल स्कोर किया था। पिछले साल स्कोर किया था। तो एक्स ने शीर्षक पढ़ा: गूगल ने अभी-अभी रिकर्सिव सेल्फ-इम्प्रूवमेंट में महारत हासिल की। हैकर न्यूज़ ने पीडीएफ पढ़ा: इसे आरएसआई कहना भ्रामक लगता है। और उसी सप्ताह एक प्रतियोगी के सीईओ ने कहा कि लूप गर्मियों से चल रहा था और सभी को धीमा कर देना चाहिए।

3:13 तीन वाक्य, वही दो शब्द, तीन अलग-अलग मशीनें। तो, सोमवार को, अगले आरएसआई पेपर को कैसे पढ़ें। एक: पूछें कि कौन सी वस्तु बदलती है, वेट्स, कोड, या खोज सेटिंग्स; Dream-RSI तीसरे को बदलता है। दो: पूछें कि कौन स्थिर है; यहाँ यह कोडर, जज और रीराइटर है, तीनों। तीन: पूछें कि शीर्षक संख्या किस इकाई की है। बचाया गया कंप्यूट अनुकूलन है; एक बेंचमार्क जिसे मॉडल पहले नहीं पहुंच सका वह टेकऑफ़ है, और किसी ने अभी तक वह प्रकाशित नहीं किया है।

3:40 फैसला, अंडर द हुड: NEEDS REVIEW। लूप वास्तविक है, बचत मापी गई है, और कवर पर दो शब्द एक ऐसी मशीन का वर्णन करते हैं जो पेपर में नहीं है। यदि आप इसे मुझसे कहने के बजाय पढ़ना पसंद करते हैं, तो The Daily Diff हर सुबह आपके इनबॉक्स में आता है, daily diff dot dev पर मुफ्त, लिंक नीचे है। टिप्पणियों में मुझे बताएं कि आगे क्या खोलना है। और आज के लिए यही अंतर है। मैं Axrisi से निको हूँ।

4:00 Merge responsibly.

## स्रोत

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
