# रिकर्सिभ सेल्फ-इम्प्रुभमेन्ट, भित्री भागमा

Published: 2026-09-18

गुगल डीपमाइन्डले "ड्रिम-आरएसआई: रिकर्सिभ सेल्फ-इम्प्रुभमेन्ट थ्रु इभोल्भिङ वर्ल्ड्स" प्रकाशित गर्यो — र यस भित्रको कोडिङ मोडेल कहिल्यै परिवर्तन हुँदैन। भित्री भागमा: ६० वर्षदेखि यो वाक्यांशको अर्थ के थियो, ड्रिम-आरएसआईमा वास्तवमा के लुप हुन्छ (रेकर्ड गरिएका सर्च ट्रीहरूमा "सपना" देख्ने पाइथन एक्सप्लोरेसन नीति), र ५५० को सट्टा ३१७ एजेन्ट कल किन छुट हो, टेकअफ होइन। फैसला: NEEDS REVIEW।

Canonical: https://thedailydiff.dev/ne/video/2026-09-18-self-improving-ai/

## यो भिडियोले के समेट्छ

- १९६५ → २००८: आई. जे. गुडको "इन्टेलिजेन्स एक्सप्लोजन", युडकोव्स्कीको सीड एआई — आफ्नो तौल आफैं लेख्ने मेसिन
- २०२५: अल्फाईभोल्भ — ४८-गुणा ४×४ म्याट्रिक्स गुणन, गुगलको ०.७% कम्प्युट पुनः प्राप्त, जेमिनी कर्नेलहरू २३% छिटो
- २०२६: ड्रिम-आरएसआई — नीति सुध्रिन्छ, कोडर, जज र रिराइटर सबै फ्रिज छन्; प्रम्प्टले भन्छ "वैज्ञानिक कार्य समाधान नगर्नुहोस्"
- एक्स: "गुगलले भर्खर रिकर्सिभ सेल्फ-इम्प्रुभमेन्ट क्र्याक गर्यो" (८१९ लाइक) बनाम एचएन: "यसलाई आरएसआई भन्नु भ्रामक लाग्छ"
- प्रयोग गरिएका संख्याहरू: §४.१ लासो ५५० → ३१७ एजेन्ट कलहरू, ३५८७ → २९३१ मिलिसेकेन्ड; तालिका १ सर्कल प्याकिङ २.६३५९८३ = अल्फाईभोल्भभी२; §४.३ कर्नेलबेन्च २.४३ गुणा / १.७९ गुणा कम जेनेरेसन, २.०९ गुणा सम्म छिटो; परिशिष्ट बी.२ प्रम्प्ट (माथिको पीडीएफबाट सबै)

## अनुवादित ट्रान्सक्रिप्ट

मूल अंग्रेजी कथाबाट अनुवादित। उपलब्ध अडियो र क्याप्सनहरू YouTube द्वारा नियन्त्रित हुन्छन्।

0:00 रिकर्सिभ सेल्फ-इम्प्रुभमेन्ट भनेको एआईले आफैंलाई स्मार्ट बनाउने विचार हो, त्यसपछि स्मार्ट स्वयंलाई फेरि त्यसो गर्न प्रयोग गर्दछ, र यस हप्ता गुगलले एउटा शीर्षकमा ती दुई शब्द भएको पेपर प्रकाशित गर्यो, जसमा मोडेलको तौल कहिल्यै चल्दैनन्। तीनवटा संख्याहरू। एन्थ्रोपिकका सीईओले यो लुप गर्मीदेखि चलिरहेको बताएका छन्, जुन उनको सम्पूर्ण उद्योगलाई सुस्त बनाउनुको कारण हो। गुगलले भर्खर यसलाई क्र्याक गरेको घोषणा गर्ने ट्वीटले एक दिनमा आठ सय लाइक बटुल्यो।

0:24 र पेपरको आफ्नै मुख्य नतिजा ५५० को सट्टा ३१७ मोडेल कल हो, जुन छुट हो, टेकअफ होइन। तीन मिनेटमा: यो वाक्यांश कहाँबाट आयो, ड्रिम-आरएसआई भित्र वास्तवमा के लुप हुन्छ, र आरएसआई कभर भएको अर्को पेपर कसरी पढ्ने। यो The Daily Diff हो, भित्री भागमा। १९६५। आई. जे. गुड, ट्युरिङको छेउमा काम गर्ने एक ब्लेट्चले पार्क तथ्याङ्कविद्, लेख्छन् कि एक अल्ट्रा-इन्टेलिजेन्ट मेसिनले अझ राम्रो मेसिनहरू डिजाइन गर्न सक्छ,

0:52 यसलाई इन्टेलिजेन्स एक्सप्लोजन र मानिसले कहिल्यै बनाउनु पर्ने अन्तिम आविष्कार भन्छन्, यदि मेसिनले यसलाई कसरी नियन्त्रण गर्ने भनेर हामीलाई बताउन पर्याप्त आज्ञाकारी छ भने, जुन त्यो 'यदि' हो जुन मानिसहरूले अल्पविराम पछि पढ्न छोड्छन्। चालीस वर्षसम्म यो वाक्यांशको अर्थ ठ्याक्कै त्यही थियो: एउटा प्रणाली जसले आफ्नो स्रोत वा तौल सम्पादन गर्छ र हरेक पासमा स्मार्ट भएर निस्कन्छ। एलिजर युडकोव्स्कीको २००८ को निबन्धले यसलाई एआई सुरक्षाको मुख्य शब्द बनायो, र कसैसँग यसलाई परीक्षण गर्न मेसिन थिएन, जुन परिभाषाका लागि आदर्श अवस्था हो। त्यसपछि मे २०२५ मा डीपमाइन्डले अल्फाईभोल्भ पठायो,

1:23 एक जेमिनी एजेन्ट जसले कोड प्रस्ताव गर्छ, यसलाई स्कोर गराउँछ, विजेताहरूलाई राख्छ र फेरि उत्परिवर्तन गर्छ। यसले ४८ चरणमा चार-बाइ-चार जटिल म्याट्रिक्सहरू गुणन गर्यो, १९६९ मा स्ट्रासेनले सेट गरेको रेकर्डलाई हराउँदै, र यसले गुगलको विश्वव्यापी कम्प्युटको शून्य दशमलव सात प्रतिशत पुनः प्राप्त गर्छ, जुन गुगलको स्तरमा सोफा मुनि भेटिएको डाटा सेन्टर हो। जेमिनीले अब जेमिनीलाई तालिम दिन मद्दत गरिरहेको थियो, र यो वाक्यांश सुरक्षा ब्लगहरूबाट चुपचाप प्रेस विज्ञप्तिहरूमा सर्यो। ड्रिम-आरएसआईले त्यस लुपको शीर्षमा एउटा नियन्त्रक जोड्छ।

1:52 एउटा नीति, एउटा वास्तविक पाइथन प्रोग्राम, ले निर्णय गर्छ सर्च ट्रीका कुन शाखाहरू विस्तार गर्ने, कति समानान्तरमा, र कहिले त्याग्ने। जेमिनीले उम्मेदवार कोड लेख्छ, र एक स्थिर मूल्याङ्ककले यसलाई स्कोर गर्छ। हरेक रनले के प्रयास गरियो र यसले के स्कोर गर्यो भन्ने रूख छोड्छ। त्यो रूख एक रिप्ले सिमुलेटर बन्छ: दोस्रो, उत्तिकै स्थिर जेमिनीले नीतिलाई पुन: लेख्छ, र नयाँ नीतिलाई रेकर्ड गरिएका नतिजाहरू विरुद्ध परीक्षण गरिन्छ वास्तविक जीपीयूहरूमा होइन।

2:16 पेपरले यसलाई सपना देख्ने भन्छ, र एक वास्तविक रनले हजारौं सपना देखेका शून्य कार्यान्वयन लागतमा भुक्तानी गर्छ। विजेता फेरि अनलाइन जान्छ, रेकर्ड गरिएका संसारहरूको पूल बढ्छ, दोहोर्याउनुहोस्। र परिशिष्ट बी.२ मा रहेको प्रम्प्टले आत्म-सुधार गर्ने एआईलाई लिखित रूपमा भन्छ: यो एउटा फाइल मात्र सम्पादन गर्नुहोस्, र वैज्ञानिक कार्य समाधान नगर्नुहोस्। मापन गरियो। लासो सल्भर कार्यमा, निश्चित अन्वेषणले ५५० जेमिनी कलहरू खर्च गर्यो तीन दशमलव छ सेकेन्डमा पुग्न, ड्रिम-आरएसआईले ३१७ खर्च गर्यो दुई दशमलव नौमा पुग्न, र दुबैले स्किकिट-लर्नलाई हराए।

2:46 कर्नेलबेन्चमा यसले उही कर्नेल गति लगभग दुई दशमलव चार गुणा कम जेनेरेसनमा प्राप्त गर्यो। र सर्कल प्याकिङमा यसले दुई दशमलव छ तीन पाँच नौ आठ तीन स्कोर गर्यो, जुन ठ्याक्कै, छ दशमलवसम्म, अल्फाईभोल्भ संस्करण दुईले गत वर्ष स्कोर गरेको थियो। त्यसैले एक्सले शीर्षक पढ्यो: गुगलले भर्खर रिकर्सिभ सेल्फ-इम्प्रुभमेन्ट क्र्याक गर्यो। ह्याकर न्यूजले पीडीएफ पढ्यो: यसलाई आरएसआई भन्नु भ्रामक लाग्छ। र त्यही हप्ता एक प्रतिस्पर्धीका सीईओले भने कि लुप गर्मीदेखि चलिरहेको थियो र सबैले सुस्त हुनुपर्छ।

3:13 तीन वाक्य, उही दुई शब्द, तीन फरक मेसिनहरू। त्यसोभए, सोमबार, अर्को आरएसआई पेपर कसरी पढ्ने। एक: कुन वस्तु परिवर्तन हुन्छ, तौल, कोड, वा खोजी सेटिङहरू सोध्नुहोस्; ड्रिम-आरएसआईले तेस्रो परिवर्तन गर्छ। दुई: को फ्रिज छ सोध्नुहोस्; यहाँ कोडर, जज र रिराइटर छन्, तीनै जना। तीन: मुख्य संख्या केको एकाइ हो सोध्नुहोस्। बचत गरिएको कम्प्युट अप्टिमाइजेसन हो; मोडेलले पहिले पुग्न नसक्ने बेन्चमार्क टेकअफ हो, र कसैले पनि त्यो अझै प्रकाशित गरेको छैन।

3:40 फैसला, भित्री भागमा: NEEDS REVIEW। लुप वास्तविक छ, बचतहरू मापन गरिएका छन्, र कभरमा रहेका दुई शब्दहरूले पेपरमा नभएको मेसिनको वर्णन गर्दछ। यदि तपाईं मलाई यो भन्न सुन्नु भन्दा यो पढ्न चाहनुहुन्छ भने, diff हरेक बिहान तपाईंको इनबक्समा आउँछ, thedailydiff.dev मा निःशुल्क, लिङ्क तल। टिप्पणीहरूमा मलाई अर्को के खोल्ने भन्नुहोस्। र आजको लागि यति नै diff। म Axrisi बाट निको हुँ।

4:00 जिम्मेवारीपूर्वक मर्ज गर्नुहोस्।

## स्रोतहरू

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
