રિકર્સિવ સેલ્ફ-ઇમ્પ્રૂવમેન્ટ, પડદા પાછળ
ગૂગલ ડીપમાઇન્ડે "ડ્રીમ-આરએસઆઈ: ઇવોલ્વિંગ વર્લ્ડ્સ દ્વારા રિકર્સિવ સેલ્ફ-ઇમ્પ્રૂવમેન્ટ" પ્રકાશિત કર્યું — અને તેની અંદરનો કોડિંગ મોડેલ ક્યારેય બદલાતો નથી.
ગૂગલ ડીપમાઇન્ડે "ડ્રીમ-આરએસઆઈ: ઇવોલ્વિંગ વર્લ્ડ્સ દ્વારા રિકર્સિવ સેલ્ફ-ઇમ્પ્રૂવમેન્ટ" પ્રકાશિત કર્યું — અને તેની અંદરનો કોડિંગ મોડેલ ક્યારેય બદલાતો નથી. પડદા પાછળ: આ શબ્દનો 60 વર્ષથી શું અર્થ થતો હતો, ડ્રીમ-આરએસઆઈમાં ખરેખર શું લૂપ થાય છે (એક પાયથોન એક્સપ્લોરેશન પોલિસી જે રેકોર્ડ કરાયેલા સર્ચ ટ્રીઝ પર "સ્વપ્ન" જુએ છે), અને શા માટે 550 ને બદલે 317 એજન્ટ કોલ ડિસ્કાઉન્ટ છે, ટેકઓફ નથી. ચુકાદો: NEEDS REVIEW.
લખેલી આવૃત્તિ વાંચો (અંગ્રેજી) ↗
આ વીડિયોમાં શું આવરી લેવામાં આવ્યું છે
- 1965 → 2008: આઇ. જે. ગુડનો "ઇન્ટેલિજન્સ એક્સપ્લોઝન", યુડકોવ્સ્કીનો સીડ AI — એક મશીન જે તેના પોતાના વજનને ફરીથી લખે છે
- 2025: આલ્ફાએવોલ્વ — 48-ગુણાકાર 4×4 મેટ્રિક્સ ગુણાકાર, ગૂગલના કમ્પ્યુટનો 0.7% પાછો મેળવ્યો, જેમિની કર્નલ 23% ઝડપી
- 2026: ડ્રીમ-આરએસઆઈ — પોલિસી સુધરે છે, કોડર, જજ અને રિરાઈટર બધા સ્થિર છે; પ્રોમ્પ્ટ કહે છે "વૈજ્ઞાનિક કાર્ય હલ કરશો નહીં"
- X: "ગૂગલે હમણાં જ રિકર્સિવ સેલ્ફ-ઇમ્પ્રૂવમેન્ટ ક્રેક કર્યું" (819 લાઇક્સ) વિરુદ્ધ HN: "આને RSI કહેવું ભ્રામક લાગે છે"
- ઉપયોગમાં લેવાયેલા નંબરો: §4.1 લાસો 550 → 317 એજન્ટ કોલ, 3587 → 2931 મિલીસેકન્ડ; ટેબલ 1 સર્કલ પેકિંગ 2.635983 = આલ્ફાએવોલ્વV2; §4.3 કર્નલબેન્ચ 2.43× / 1.79× ઓછા જનરેશન, 2.09× સુધી ઝડપી; પરિશિષ્ટ B.2 પ્રોમ્પ્ટ (ઉપરોક્ત PDF માંથી બધા)
અનુવાદિત ટ્રાન્સક્રિપ્ટ
મૂળ અંગ્રેજી કથામાંથી અનુવાદિત. ઉપલબ્ધ ઑડિઓ અને કૅપ્શન્સ YouTube દ્વારા નિયંત્રિત થાય છે.
0:00 રિકર્સિવ સેલ્ફ-ઇમ્પ્રૂવમેન્ટ એવો વિચાર છે કે એક AI પોતાને વધુ સ્માર્ટ બનાવે છે, પછી તે સ્માર્ટ સ્વનો ઉપયોગ ફરીથી કરવા માટે કરે છે, અને આ અઠવાડિયે ગૂગલે એક પેપર પ્રકાશિત કર્યું જેમાં શીર્ષકમાં તે બે શબ્દો છે, જેમાં મોડેલના વજન ક્યારેય હલતા નથી. ત્રણ નંબરો. એન્થ્રોપિકના સીઇઓ કહે છે કે આ લૂપ ઉનાળાથી ચાલી રહ્યું છે, જે સમગ્ર ઉદ્યોગને ધીમું કરવાનું તેનું કારણ છે. ગૂગલે હમણાં જ તેને ક્રેક કર્યું હોવાની જાહેરાત કરતી ટ્વીટને એક દિવસમાં આઠસો લાઇક્સ મળી.
0:24 અને પેપરનું પોતાનું હેડલાઇન પરિણામ 550 ને બદલે 317 મોડેલ કોલ છે, જે ડિસ્કાઉન્ટ છે, ટેકઓફ નથી. ત્રણ મિનિટમાં: આ શબ્દ ક્યાંથી આવ્યો, ડ્રીમ-આરએસઆઈની અંદર ખરેખર શું લૂપ થાય છે, અને RSI કવર સાથેનું આગલું પેપર કેવી રીતે વાંચવું. આ ધ ડેઇલી ડિફ છે, પડદા પાછળ. 1965. આઇ. જે. ગુડ, બ્લિચલી પાર્કના આંકડાશાસ્ત્રી જે ટ્યુરિંગની બાજુમાં કામ કરતા હતા, લખે છે કે એક અતિબુદ્ધિશાળી મશીન વધુ સારા મશીનો ડિઝાઇન કરી શકે છે,
0:52 તેને ઇન્ટેલિજન્સ એક્સપ્લોઝન કહે છે અને મનુષ્યને ક્યારેય બનાવવાની જરૂર પડશે તેવી છેલ્લી શોધ કહે છે, જો મશીન તેને કેવી રીતે નિયંત્રિત કરવું તે આપણને કહેવા માટે પૂરતું નમ્ર હોય, જે પૂરી પાડવામાં આવેલી શરત છે કે લોકો અલ્પવિરામ પછી વાંચવાનું બંધ કરે છે. ચાલીસ વર્ષ સુધી આ શબ્દનો અર્થ બરાબર તે જ હતો: એક સિસ્ટમ જે તેના પોતાના સ્ત્રોત અથવા વજનને સંપાદિત કરે છે અને દરેક પાસમાં વધુ સ્માર્ટ બને છે. એલિઝર યુડકોવ્સ્કીના 2008ના નિબંધે તેને AI સુરક્ષાનો મુખ્ય શબ્દ બનાવ્યો, અને કોઈની પાસે તેને ચકાસવા માટે મશીન નહોતું, જે એક વ્યાખ્યા માટે આદર્શ સ્થિતિ છે. પછી મે 2025માં ડીપમાઇન્ડે આલ્ફાએવોલ્વ શિપ કર્યું,
1:23 એક જેમિની એજન્ટ જે કોડ પ્રસ્તાવિત કરે છે, તેને સ્કોર કરાવે છે, વિજેતાઓને રાખે છે અને તેમને ફરીથી મ્યુટેટ કરે છે. તેણે 48 પગલામાં ફોર-બાય-ફોર કોમ્પ્લેક્સ મેટ્રિસિસનો ગુણાકાર કર્યો, 1969માં સ્ટ્રાસેને બનાવેલો રેકોર્ડ તોડીને, અને તે ગૂગલના વિશ્વવ્યાપી કમ્પ્યુટનો લગભગ શૂન્ય પોઇન્ટ સાત ટકા પુનઃપ્રાપ્ત કરે છે, જે ગૂગલના સ્કેલ પર સોફા નીચે મળેલા ડેટા સેન્ટર જેવું છે. જેમિની હવે જેમિનીને તાલીમ આપવામાં મદદ કરી રહી હતી, અને આ શબ્દ શાંતિપૂર્વક સુરક્ષા બ્લોગ્સમાંથી પ્રેસ રિલીઝમાં સ્થળાંતર થયો. ડ્રીમ-આરએસઆઈ તે લૂપની ટોચ પર એક કંટ્રોલર જોડે છે.
1:52 એક પોલિસી, એક વાસ્તવિક પાયથોન પ્રોગ્રામ, નક્કી કરે છે કે સર્ચ ટ્રીની કઈ શાખાઓને વિસ્તૃત કરવી, કેટલી સમાંતરમાં, અને ક્યારે છોડી દેવું. જેમિની ઉમેદવાર કોડ લખે છે, અને એક નિશ્ચિત ઇવેલ્યુએટર તેને સ્કોર કરે છે. દરેક રન શું પ્રયાસ કર્યો હતો અને શું સ્કોર કર્યો હતો તેનું ટ્રી છોડી જાય છે. તે ટ્રી રિપ્લે સિમ્યુલેટર બની જાય છે: બીજો, સમાન રીતે સ્થિર જેમિની પોલિસીને ફરીથી લખે છે, અને નવી પોલિસીને વાસ્તવિક GPUs ને બદલે રેકોર્ડ કરાયેલા પરિણામો સામે ચકાસવામાં આવે છે. વાસ્તવિક GPUs પર.
2:16 પેપર આને ડ્રીમિંગ કહે છે, અને એક વાસ્તવિક રન હજારો સ્વપ્ન જોયેલા શૂન્ય એક્ઝેક્યુશન ખર્ચેલા માટે ચૂકવણી કરે છે. વિજેતા પાછો ઓનલાઈન જાય છે, રેકોર્ડ કરાયેલી દુનિયાનો પૂલ વધે છે, પુનરાવર્તન કરો. અને પરિશિષ્ટ B.2 માંનો પ્રોમ્પ્ટ સ્વ-સુધારતી AI ને કહે છે, લખવામાં: ફક્ત આ એક ફાઇલને સંપાદિત કરો, અને વૈજ્ઞાનિક કાર્ય હલ કરશો નહીં. માપેલ. લાસો સોલ્વર કાર્ય પર, નિશ્ચિત એક્સપ્લોરેશન 550 જેમિની કોલ ખર્ચ્યા ત્રણ પોઇન્ટ છ સેકન્ડ સુધી પહોંચવા માટે, ડ્રીમ-આરએસઆઈએ 317 ખર્ચ્યા બે પોઇન્ટ નવ સુધી પહોંચવા માટે, અને બંનેએ scikit-learn ને હરાવ્યું.
2:46 કર્નલબેન્ચ પર તેણે લગભગ બે પોઇન્ટ ચાર ગણી ઓછી જનરેશન સાથે સમાન કર્નલ ગતિ પ્રાપ્ત કરી. અને સર્કલ પેકિંગ પર તેણે બે પોઇન્ટ છ ત્રણ પાંચ નવ આઠ ત્રણ સ્કોર કર્યો, જે ચોક્કસપણે, છ દશાંશ સુધી, આલ્ફાએવોલ્વ વર્ઝન બે ગયા વર્ષે સ્કોર કર્યો હતો. તો X એ શીર્ષક વાંચ્યું: ગૂગલે હમણાં જ રિકર્સિવ સેલ્ફ-ઇમ્પ્રૂવમેન્ટ ક્રેક કર્યું. હેકર ન્યૂઝે PDF વાંચી: આને RSI કહેવું ભ્રામક લાગે છે. અને તે જ અઠવાડિયે એક હરીફના સીઇઓએ કહ્યું કે લૂપ ઉનાળાથી ચાલી રહ્યું હતું અને દરેકને ધીમું કરવું જોઈએ.
3:13 ત્રણ વાક્યો, તે જ બે શબ્દો, ત્રણ અલગ મશીનો. તો, સોમવારે, આગામી RSI પેપર કેવી રીતે વાંચવું. એક: કઈ વસ્તુ બદલાય છે તે પૂછો, વજન, કોડ, અથવા સર્ચ સેટિંગ્સ; ડ્રીમ-આરએસઆઈ ત્રીજું બદલે છે. બે: કોણ સ્થિર છે તે પૂછો; અહીં તે કોડર, જજ અને રિરાઈટર છે, બધા ત્રણ. ત્રણ: હેડલાઇન નંબર કયા એકમનો છે તે પૂછો. બચાવેલ કમ્પ્યુટ ઓપ્ટિમાઇઝેશન છે; એક બેન્ચમાર્ક જે મોડેલ પહેલાં પહોંચી શકતું ન હતું તે ટેકઓફ છે, અને હજી સુધી કોઈએ તે પ્રકાશિત કર્યું નથી.
3:40 ચુકાદો, પડદા પાછળ: સમીક્ષાની જરૂર છે. લૂપ વાસ્તવિક છે, બચત માપવામાં આવે છે, અને કવર પરના બે શબ્દો એવા મશીનનું વર્ણન કરે છે જે પેપરમાં નથી. જો તમે મને તે કહેવાને બદલે આ વાંચવાનું પસંદ કરો છો, તો ડિફ તમારા ઇનબોક્સમાં દરરોજ સવારે આવે છે, thedailydiff.dev પર મફત, લિંક નીચે. ટિપ્પણીઓમાં મને કહો કે આગળ શું ખોલવું. અને આ આજનો ડિફ છે. હું Axrisi માંથી નિકો છું.
4:00 જવાબદારીપૂર્વક મર્જ કરો.
સ્ત્રોતો
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



