+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

रिकर्सिव सेल्फ-इम्प्रूवमेंट, अंडर द हुड

गूगल डीपमाइंड ने "ड्रीम-आरएसआई: इवॉल्विंग वर्ल्ड्स के माध्यम से रिकर्सिव सेल्फ-इम्प्रूवमेंट" प्रकाशित किया — और इसमें शामिल कोडिंग मॉडल कभी नहीं बदलता।

गूगल डीपमाइंड ने "ड्रीम-आरएसआई: इवॉल्विंग वर्ल्ड्स के माध्यम से रिकर्सिव सेल्फ-इम्प्रूवमेंट" प्रकाशित किया — और इसमें शामिल कोडिंग मॉडल कभी नहीं बदलता। अंडर द हुड: इस वाक्यांश का 60 वर्षों से क्या मतलब था, ड्रीम-आरएसआई में वास्तव में क्या लूप होता है (एक पायथन एक्सप्लोरेशन पॉलिसी जो रिकॉर्डेड सर्च ट्रीज़ पर "सपने देखती है"), और क्यों 550 के बजाय 317 एजेंट कॉल छूट है, न कि टेकऑफ़। फैसला: NEEDS REVIEW।

लिखित संस्करण पढ़ें (अंग्रेजी) ↗

इस वीडियो में क्या शामिल है

  • 1965 → 2008: आई. जे. गुड का "इंटेलिजेंस एक्सप्लोजन", युडकोव्स्की का सीड एआई — एक मशीन जो अपने स्वयं के वेट्स को फिर से लिखती है
  • 2025: अल्फाईवॉल्व — 48-गुणा 4×4 मैट्रिक्स गुणा, गूगल के कंप्यूट का 0.7% बरामद, जेमिनी कर्नेल 23% तेज़
  • 2026: ड्रीम-आरएसआई — नीति में सुधार होता है, कोडर, जज और रीराइटर सभी स्थिर होते हैं; प्रॉम्प्ट कहता है "वैज्ञानिक कार्य को हल न करें"
  • एक्स: "गूगल ने अभी-अभी रिकर्सिव सेल्फ-इम्प्रूवमेंट में महारत हासिल की" (819 लाइक) बनाम एचएन: "इसे आरएसआई कहना भ्रामक लगता है"
  • उपयोग की गई संख्याएँ: §4.1 लासो 550 → 317 एजेंट कॉल, 3587 → 2931 ms; तालिका 1 सर्कल पैकिंग 2.635983 = अल्फाईवॉल्ववी2; §4.3 कर्नेल बेंच 2.43× / 1.79× कम जनरेशन, 2.09× तक तेज़; परिशिष्ट बी.2 प्रॉम्प्ट (सभी उपरोक्त पीडीएफ से)

अनुवादित प्रतिलेख

मूल अंग्रेजी कथन से अनुवादित। उपलब्ध ऑडियो और कैप्शन YouTube द्वारा नियंत्रित होते हैं।

0:00 रिकर्सिव सेल्फ-इम्प्रूवमेंट यह विचार है कि एक एआई खुद को अधिक स्मार्ट बनाता है, फिर उसी स्मार्ट स्वयं का उपयोग इसे फिर से करने के लिए करता है, और इस सप्ताह गूगल ने एक पेपर प्रकाशित किया जिसके शीर्षक में वे दो शब्द थे, जिसमें मॉडल के वेट्स कभी नहीं बदलते। तीन संख्याएँ। एंथ्रोपिक के सीईओ का कहना है कि यह लूप गर्मियों से चल रहा है, जो उनके पूरे उद्योग को धीमा करने का कारण है। यह घोषणा करने वाला ट्वीट कि गूगल ने अभी-अभी इसे क्रैक किया है, एक दिन में आठ सौ लाइक इकट्ठा कर चुका है।

0:24 और पेपर का अपना मुख्य परिणाम 550 के बजाय 317 मॉडल कॉल है, जो एक छूट है, न कि टेकऑफ़। तीन मिनट में: यह वाक्यांश कहाँ से आया, ड्रीम-आरएसआई के अंदर वास्तव में क्या लूप होता है, और कवर पर आरएसआई के साथ अगले पेपर को कैसे पढ़ें। यह The Daily Diff है, अंडर द हुड। 1965। आई. जे. गुड, ब्लेचले पार्क के एक सांख्यिकीविद् जिन्होंने ट्यूरिंग के बगल में काम किया, लिखते हैं कि एक अति-बुद्धिमान मशीन और भी बेहतर मशीनें डिज़ाइन कर सकती है,

0:52 इसे एक बुद्धिमत्ता विस्फोट और अंतिम आविष्कार कहते हैं जो मनुष्य को कभी करना होगा, बशर्ते मशीन इतनी विनम्र हो कि हमें यह बता सके कि इसे कैसे नियंत्रित किया जाए, जो 'बशर्ते' वाले लोग कॉमा के बाद पढ़ना बंद कर देते हैं। चालीस वर्षों तक इस वाक्यांश का यही मतलब था: एक ऐसी प्रणाली जो अपने स्वयं के स्रोत या वेट्स को संपादित करती है और हर पास में अधिक स्मार्ट निकलती है। एलिज़र युडकोव्स्की के 2008 के निबंध ने इसे एआई सुरक्षा का लोड-बियरिंग शब्द बना दिया, और किसी के पास इसे परीक्षण करने के लिए मशीन नहीं थी, जो एक परिभाषा के लिए आदर्श स्थिति है। फिर मई 2025 में डीपमाइंड ने AlphaEvolve भेजा,

1:23 एक जेमिनी एजेंट जो कोड प्रस्तावित करता है, उसे स्कोर मिलता है, विजेताओं को रखता है और उन्हें फिर से उत्परिवर्तित करता है। इसने 48 चरणों में चार-ब-चार जटिल मैट्रिक्स को गुणा किया, 1969 में स्ट्रैसेन द्वारा स्थापित एक रिकॉर्ड को तोड़ते हुए, और यह गूगल के विश्वव्यापी कंप्यूट का लगभग शून्य दशमलव सात प्रतिशत वसूल करता है, जो गूगल के पैमाने पर एक सोफे के नीचे मिला डेटा सेंटर है। जेमिनी अब जेमिनी को प्रशिक्षित करने में मदद कर रहा था, और यह वाक्यांश चुपचाप सुरक्षा ब्लॉग से प्रेस विज्ञप्तियों में चला गया। Dream-RSI उस लूप के ऊपर एक नियंत्रक बोल्ट करता है।

1:52 एक नीति, एक वास्तविक पायथन प्रोग्राम, तय करती है कि सर्च ट्री की कौन सी शाखाओं का विस्तार किया जाए, कितनी समानांतर में, और कब हार माननी है। जेमिनी उम्मीदवार कोड लिखता है, और एक निश्चित मूल्यांकनकर्ता उसे स्कोर करता है। हर रन पीछे छोड़ता है कि क्या कोशिश की गई थी और उसने क्या स्कोर किया। वह ट्री एक रिप्ले सिम्युलेटर बन जाता है: एक दूसरा, समान रूप से स्थिर जेमिनी नीति को फिर से लिखता है, और नई नीति का परीक्षण वास्तविक जीपीयू के बजाय रिकॉर्डेड परिणामों के खिलाफ किया जाता है। रियल जीपीयू पर।

2:16 यह पेपर इसे 'सपना देखना' कहता है, और एक वास्तविक रन हजारों सपने देखे गए लोगों के लिए शून्य निष्पादन लागत पर भुगतान करता है। विजेता वापस ऑनलाइन जाता है, रिकॉर्ड की गई दुनिया का पूल बढ़ता है, दोहराएं। और परिशिष्ट बी.2 में प्रॉम्प्ट सेल्फ-इम्प्रूविंग एआई को बताता है, लिखित रूप में: केवल इस एक फ़ाइल को संपादित करें, और वैज्ञानिक कार्य को हल न करें। मापा गया। लासो सॉल्वर टास्क पर, निश्चित अन्वेषण ने 3.6 सेकंड तक पहुंचने के लिए 550 जेमिनी कॉल खर्च किए, Dream-RSI ने 2.9 तक पहुंचने के लिए 317 खर्च किए, और दोनों ने scikit-learn को हराया। और दोनों ने scikit-learn को हराया।

2:46 KernelBench पर यह लगभग 2.4 गुना कम पीढ़ियों के साथ समान कर्नेल गति तक पहुंच गया। और सर्कल पैकिंग पर इसने 2.635983 स्कोर किया, जो ठीक पिछले साल AlphaEvolve संस्करण दो ने स्कोर किया था, जो छह दशमलव स्थानों तक ठीक वही है, जो AlphaEvolve संस्करण दो ने पिछले साल स्कोर किया था। पिछले साल स्कोर किया था। तो एक्स ने शीर्षक पढ़ा: गूगल ने अभी-अभी रिकर्सिव सेल्फ-इम्प्रूवमेंट में महारत हासिल की। हैकर न्यूज़ ने पीडीएफ पढ़ा: इसे आरएसआई कहना भ्रामक लगता है। और उसी सप्ताह एक प्रतियोगी के सीईओ ने कहा कि लूप गर्मियों से चल रहा था और सभी को धीमा कर देना चाहिए।

3:13 तीन वाक्य, वही दो शब्द, तीन अलग-अलग मशीनें। तो, सोमवार को, अगले आरएसआई पेपर को कैसे पढ़ें। एक: पूछें कि कौन सी वस्तु बदलती है, वेट्स, कोड, या खोज सेटिंग्स; Dream-RSI तीसरे को बदलता है। दो: पूछें कि कौन स्थिर है; यहाँ यह कोडर, जज और रीराइटर है, तीनों। तीन: पूछें कि शीर्षक संख्या किस इकाई की है। बचाया गया कंप्यूट अनुकूलन है; एक बेंचमार्क जिसे मॉडल पहले नहीं पहुंच सका वह टेकऑफ़ है, और किसी ने अभी तक वह प्रकाशित नहीं किया है।

3:40 फैसला, अंडर द हुड: NEEDS REVIEW। लूप वास्तविक है, बचत मापी गई है, और कवर पर दो शब्द एक ऐसी मशीन का वर्णन करते हैं जो पेपर में नहीं है। यदि आप इसे मुझसे कहने के बजाय पढ़ना पसंद करते हैं, तो The Daily Diff हर सुबह आपके इनबॉक्स में आता है, daily diff dot dev पर मुफ्त, लिंक नीचे है। टिप्पणियों में मुझे बताएं कि आगे क्या खोलना है। और आज के लिए यही अंतर है। मैं Axrisi से निको हूँ।

4:00 Merge responsibly.

स्रोत

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

संबंधित वीडियो

under-the-hood · hi · 24 सित॰ 2026

SAML, तह के नीचे: पत्र के अंदर का हस्ताक्षर

SAML आपको लगभग हर कार्य ऐप में लॉग इन करता है, और इसका हस्ताक्षर उस XML के अंदर रहता है जिस पर यह हस्ताक्षर करता है। तह के नीचे: ऐप, ब्राउज़र और पहचान प्रदाता के बीच लॉगिन प्रक्रिया, एक अभिकथन कैसा दि

3:02 ↗
under-the-hood · hi · 23 सित॰ 2026

जब एक मॉडल मर जाता है, अंदर ही अंदर

एक AI मॉडल मरता नहीं है — उसे बंद करने की तारीख मिलती है, और अगली सुबह, आपका API कॉल 404 लौटाता है: "मॉडल को अप्रचलित कर दिया गया है, यहाँ और जानें।" अंदर ही अंदर: चार-स्थिति वाली पाइपलाइन (सक्रिय → व

3:15 ↗
under-the-hood · hi · 21 सित॰ 2026

क्लाउड ने RSA-896 का गुणनखंड किया। RSA वास्तव में कैसे टूटता है

19 सितंबर को एंथ्रोपिक के एक इंजीनियर ने क्लाउड का उपयोग करके RSA-896 — एक 270-अंकीय चुनौती संख्या — का गुणनखंड किया, जो ओपन-सोर्स CADO-NFS छलनी का एक GPU पोर्ट है और दस दिनों में 2,048 निष्क्रिय GPUs

3:39 ↗
under-the-hood · hi · 19 सित॰ 2026

पासकी, उसकी कार्यप्रणाली

पासकी एक ऐसा पासवर्ड है जो आपका डिवाइस बनाता है, आपको कभी नहीं दिखाता और किसी को भी—आप सहित—देने से मना कर देता है। इसकी कार्यप्रणाली: वेबऑथएन समारोह (प्रति-साइट कुंजी जोड़ी, चुनौती, हस्ताक्षर), एक फ़

3:12 ↗