रिकर्सिव्ह सेल्फ-इम्प्रूव्हमेंट, पडद्यामागे
Google DeepMind ने "Dream-RSI: रिकर्सिव्ह सेल्फ-इम्प्रूव्हमेंट थ्रू इव्हॉल्व्हिंग वर्ल्ड्स" प्रकाशित केले — आणि त्यातील कोडिंग मॉडेल कधीच बदलत नाही.
Google DeepMind ने "Dream-RSI: रिकर्सिव्ह सेल्फ-इम्प्रूव्हमेंट थ्रू इव्हॉल्व्हिंग वर्ल्ड्स" प्रकाशित केले — आणि त्यातील कोडिंग मॉडेल कधीच बदलत नाही. पडद्यामागे: 60 वर्षांपासून या वाक्याचा अर्थ काय होता, Dream-RSI मध्ये प्रत्यक्षात काय फिरते (रेकॉर्ड केलेल्या सर्च ट्रीजवर "स्वप्न पाहणारे" पायथन एक्सप्लोरेशन धोरण), आणि 550 ऐवजी 317 एजंट कॉल्स ही सवलत का आहे, टेकऑफ का नाही. निकाल: NEEDS REVIEW.
लिखित आवृत्ती वाचा (इंग्रजी) ↗
या व्हिडिओमध्ये काय समाविष्ट आहे
- 1965 → 2008: आय. जे. गुडचा "इंटेलिजन्स एक्सप्लोजन", युडकोव्स्कीचा सीड एआय — एक मशीन जे स्वतःचे वेट्स पुन्हा लिहिते
- 2025: अल्फाइव्हॉल्व्ह — 48-गुणाकाराचे 4×4 मॅट्रिक्स मल्टिप्लाय, Google च्या कंम्प्यूटच्या 0.7% पुनर्प्राप्त, जेमिनी कर्नल 23% वेगाने
- 2026: Dream-RSI — धोरण सुधारते, कोडर, जज आणि रीरायटर सर्व गोठलेले आहेत; प्रॉम्प्ट म्हणतो "वैज्ञानिक कार्य सोडवू नका"
- X: "Google ने नुकतेच रिकर्सिव्ह सेल्फ-इम्प्रूव्हमेंट क्रॅक केले" (819 लाईक्स) वि. HN: "याला RSI म्हणणे दिशाभूल करणारे वाटते"
- वापरलेले आकडे: §4.1 लॅसो 550 → 317 एजंट कॉल्स, 3587 → 2931 ms; टेबल 1 सर्कल पॅकिंग 2.635983 = AlphaEvolveV2; §4.3 कर्नल बेंच 2.43× / 1.79× कमी जनरेशन्स, 2.09× पर्यंत जलद; परिशिष्ट B.2 प्रॉम्प्ट (वरील PDF मधून सर्व)
अनुवादित प्रतिलेख
मूळ इंग्रजी निवेदनातून अनुवादित. उपलब्ध ऑडिओ आणि मथळे YouTube द्वारे नियंत्रित आहेत.
0:00 रिकर्सिव्ह सेल्फ-इम्प्रूव्हमेंट म्हणजे एक एआय स्वतःला अधिक हुशार बनवते, आणि नंतर ते अधिक हुशार स्वतःचा पुन्हा वापर करते, आणि या आठवड्यात Google ने एक शीर्षकात ते दोन शब्द असलेला पेपर प्रकाशित केला, ज्यात मॉडेलचे वेट्स कधीच हलत नाहीत. तीन आकडे. अँथ्रॉपिकचे सीईओ म्हणतात की हा लूप उन्हाळ्यापासून सुरू आहे, जे संपूर्ण उद्योगाला धीमे करण्याचे त्यांचे कारण आहे. Google ने नुकतेच ते क्रॅक केल्याची घोषणा करणाऱ्या ट्वीटला एका दिवसात आठशे लाईक्स मिळाले.
0:24 आणि पेपरचे स्वतःचे मुख्य परिणाम 550 ऐवजी 317 मॉडेल कॉल्स आहेत, जी सवलत आहे, टेकऑफ नाही. तीन मिनिटात: हे वाक्य कुठून आले, Dream-RSI मध्ये प्रत्यक्षात काय फिरते, आणि RSI असलेल्या पुढील पेपर कसे वाचावे. हे द डेली डिफ आहे, पडद्यामागे. 1965. आय. जे. गुड, ब्लेचले पार्कचे एक सांख्यिकीशास्त्रज्ञ जे ट्युरिंगच्या बाजूला काम करत होते, लिहितात की एक अति-हुशार मशीन अजून चांगल्या मशीनची रचना करू शकते,
0:52 त्याला इंटेलिजन्स एक्सप्लोजन आणि माणसाने कधीही करायचे असलेले शेवटचे शोध म्हणतात, जोपर्यंत मशीन आपल्याला ते कसे नियंत्रित करावे हे सांगण्यासाठी पुरेसे शांत असते, जे 'जोपर्यंत' लोक स्वल्पविरामानंतर वाचणे थांबवतात. चाळीस वर्षांपासून या वाक्याचा अर्थ तोच होता: एक प्रणाली जी स्वतःचा स्रोत किंवा वेट्स संपादित करते आणि प्रत्येक पासमध्ये अधिक हुशार बाहेर येते. एलिझर युडकोव्स्कीच्या 2008 च्या निबंधाने तो एआय सेफ्टीचा भार वाहणारा शब्द बनवला, आणि कोणाकडेही ते तपासण्यासाठी मशीन नव्हते, जी व्याख्येसाठी आदर्श स्थिती आहे. नंतर मे 2025 मध्ये डीपमाइंडने अल्फाइव्हॉल्व्ह पाठवले,
1:23 एक जेमिनी एजंट जो कोड प्रस्तावित करतो, त्याला स्कोअर मिळवतो, विजेत्यांना ठेवतो आणि त्यांना पुन्हा बदलतो. त्याने 48 पायऱ्यांमध्ये चार बाय चार जटिल मॅट्रिक्स गुणाकारले, 1969 मध्ये स्ट्रॅसनने केलेला रेकॉर्ड मोडला, आणि तो Google च्या जागतिक कंम्प्यूटच्या सुमारे शून्य पॉईंट सात टक्के पुनर्प्राप्त करतो, जे Google च्या स्केलवर सोफ्याखाली सापडलेल्या डेटा सेंटरसारखे आहे. जेमिनी आता जेमिनीला प्रशिक्षण देण्यात मदत करत होते, आणि हे वाक्य शांतपणे सेफ्टी ब्लॉग्समधून प्रेस रिलीझमध्ये गेले. Dream-RSI त्या लूपच्या वर एक कंट्रोलर जोडतो.
1:52 एक धोरण, एक वास्तविक पायथन प्रोग्राम, ठरवतो सर्च ट्रीच्या कोणत्या शाखा विस्तारित करायच्या, किती समांतरपणे, आणि कधी हार मानायची. जेमिनी उमेदवार कोड लिहितो, आणि एक निश्चित मूल्यांकक त्याला स्कोअर देतो. प्रत्येक रन मागे काय प्रयत्न केले आणि त्याला काय स्कोअर मिळाले याचा एक ट्री ठेवतो. तो ट्री एक रीप्ले सिम्युलेटर बनतो: एक दुसरा, तितकाच गोठलेला जेमिनी धोरण पुन्हा लिहितो, आणि नवीन धोरण वास्तविक जीपीयूवर न करता रेकॉर्ड केलेल्या परिणामांविरुद्ध तपासले जाते.
2:16 पेपर याला स्वप्न पाहणे म्हणतो, आणि एक वास्तविक रन शून्य एक्झिक्यूशन खर्चात हजारो स्वप्नातील रनसाठी पैसे देते. विजेता पुन्हा ऑनलाइन जातो, रेकॉर्ड केलेल्या जगांचा पूल वाढतो, पुनरावृत्ती. आणि परिशिष्ट B.2 मधील प्रॉम्प्ट सेल्फ-इम्प्रूव्हिंग एआयला लिहिलेल्या स्वरूपात सांगतो: फक्त ही एक फाईल संपादित करा, आणि वैज्ञानिक कार्य सोडवू नका. मोजले. लॅसो सॉल्वर टास्कवर, निश्चित एक्सप्लोरेशनने तीन पॉईंट सहा सेकंदांपर्यंत पोहोचण्यासाठी 550 जेमिनी कॉल्स खर्च केले, Dream-RSI ने दोन पॉईंट नऊ पर्यंत पोहोचण्यासाठी 317 खर्च केले, आणि दोघांनीही scikit-learn ला हरवले.
2:46 KernelBench वर ते सुमारे दोन पॉईंट चार पट कमी जनरेशन्ससह समान कर्नल स्पीडपर्यंत पोहोचले. आणि सर्कल पॅकिंगवर त्याला दोन पॉईंट सहा तीन पाच नऊ आठ तीन स्कोअर मिळाले, जे नेमके, सहा दशमान पर्यंत, AlphaEvolve आवृत्ती दोनला गेल्या वर्षी मिळाले होते. तर X ने शीर्षक वाचले: Google ने नुकतेच रिकर्सिव्ह सेल्फ-इम्प्रूव्हमेंट क्रॅक केले. हॅकर न्यूजने PDF वाचले: याला RSI म्हणणे दिशाभूल करणारे वाटते. आणि त्याच आठवड्यात एका प्रतिस्पर्धीच्या सीईओने सांगितले की लूप उन्हाळ्यापासून सुरू आहे आणि प्रत्येकाने धीमे झाले पाहिजे.
3:13 तीन वाक्ये, तेच दोन शब्द, तीन भिन्न मशीन्स. तर, सोमवारी, पुढील RSI पेपर कसे वाचावे. एक: कोणता ऑब्जेक्ट बदलतो ते विचारा, वेट्स, कोड, किंवा सर्च सेटिंग्ज; Dream-RSI तिसरा बदलतो. Dream-RSI तिसरा बदलतो. दोन: कोण गोठलेले आहे ते विचारा; येथे कोडर, जज आणि रीरायटर, तिन्ही. तीन: मुख्य आकडा कशाचा एकक आहे ते विचारा. तिन्ही. तीन: मुख्य आकडा कशाचा एकक आहे ते विचारा. बचत केलेले कंम्प्यूट ऑप्टिमायझेशन आहे; एक बेंचमार्क जो मॉडेल यापूर्वी गाठू शकले नाही तो टेकऑफ आहे, आणि कोणीही तो अजून प्रकाशित केलेला नाही.
3:40 निकाल, पडद्यामागे: NEEDS REVIEW. लूप वास्तविक आहे, बचती मोजल्या गेल्या आहेत, आणि कव्हरवरील दोन शब्द पेपरमध्ये नसलेल्या मशीनचे वर्णन करतात. तुम्हाला मी हे सांगण्याऐवजी हे वाचायचे असेल, तर डिफ दररोज सकाळी तुमच्या इनबॉक्समध्ये येतो, daily diff dot dev वर विनामूल्य, लिंक खाली. पुढील काय उघडायचे ते मला टिप्पण्यांमध्ये सांगा. आणि आजसाठी हा डिफ आहे. मी Axrisi मधून निको आहे.
4:00 जबाबदारीने विलीन करा.
स्रोत
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



