రికర్సివ్ సెల్ఫ్-ఇంప్రూవ్మెంట్, అంతర్గత విషయాలు
గూగుల్ డీప్మైండ్ "Dream-RSI: Recursive Self-Improvement through Evolving Worlds"ను ప్రచురించింది — మరియు దానిలోని కోడింగ్ మోడల్ ఎప్పుడూ మారదు.
గూగుల్ డీప్మైండ్ "Dream-RSI: Recursive Self-Improvement through Evolving Worlds"ను ప్రచురించింది — మరియు దానిలోని కోడింగ్ మోడల్ ఎప్పుడూ మారదు. అంతర్గత విషయాలు: 60 సంవత్సరాలుగా ఈ పదం అర్థం ఏమిటి, Dream-RSIలో వాస్తవంగా ఏమి లూప్ అవుతుంది (రికార్డ్ చేయబడిన శోధన చెట్లపై "కలలు కనే" ఒక పైథాన్ అన్వేషణ విధానం), మరియు 550 ఏజెంట్ కాల్స్ బదులుగా 317 ఏజెంట్ కాల్స్ తగ్గింపు, టేకాఫ్ కాదు అని ఎందుకు. తీర్పు: NEEDS REVIEW.
వ్రాతపూర్వక సంచికను చదవండి (ఇంగ్లీష్) ↗
ఈ వీడియో ఏమి కవర్ చేస్తుంది
- 1965 → 2008: I. J. Good యొక్క "ఇంటెలిజెన్స్ ఎక్స్ప్లోషన్", యుడ్కోవ్స్కీ యొక్క సీడ్ AI — తన సొంత వెయిట్స్ను తిరిగి వ్రాసే యంత్రం
- 2025: AlphaEvolve — 48-గుణకారం 4×4 మ్యాట్రిక్స్ గుణకారం, Google యొక్క కంప్యూట్ 0.7% తిరిగి పొందబడింది, జెమిని కెర్నల్స్ 23% వేగవంతం
- 2026: Dream-RSI — విధానం మెరుగుపడుతుంది, కోడర్, న్యాయమూర్తి మరియు తిరిగి వ్రాసేవారు అందరూ స్తంభింపబడతారు; ప్రాంప్ట్ "శాస్త్రీయ పనిని పరిష్కరించవద్దు" అని చెబుతుంది
- X: "గూగుల్ ఇప్పుడే రికర్సివ్ సెల్ఫ్-ఇంప్రూవ్మెంట్ను ఛేదించింది" (819 లైక్లు) vs HN: "దీనిని RSI అని పిలవడం తప్పుదోవ పట్టించేదిగా ఉంది"
- ఉపయోగించిన సంఖ్యలు: §4.1 లాస్సో 550 → 317 ఏజెంట్ కాల్స్, 3587 → 2931 ms; పట్టిక 1 సర్కిల్ ప్యాకింగ్ 2.635983 = AlphaEvolveV2; §4.3 కెర్నల్బెంచ్ 2.43× / 1.79× తక్కువ తరాలు, 2.09× వరకు వేగవంతం; అనుబంధం B.2 ప్రాంప్ట్ (అన్ని పై PDF నుండి)
అనువదించబడిన ట్రాన్స్క్రిప్ట్
అసలైన ఆంగ్ల కథనం నుండి అనువదించబడింది. అందుబాటులో ఉన్న ఆడియో మరియు క్యాప్షన్లు YouTube ద్వారా నియంత్రించబడతాయి.
0:00 రికర్సివ్ సెల్ఫ్-ఇంప్రూవ్మెంట్ అంటే ఒక AI తనను తాను తెలివిగా మార్చుకుంటుంది అనే ఆలోచన, ఆపై మరింత తెలివైన స్వీయను మళ్లీ అదే పని చేయడానికి ఉపయోగిస్తుంది, మరియు ఈ వారం Google ఒక శీర్షికలో ఆ రెండు పదాలతో కూడిన పేపర్ను ప్రచురించింది, అందులో మోడల్ యొక్క వెయిట్లు ఎప్పుడూ కదలవు. మూడు సంఖ్యలు. ఆంత్రోపిక్ CEO ఈ లూప్ వేసవి నుండి నడుస్తోందని చెబుతున్నారు, అదే ఆయన మొత్తం పరిశ్రమను నెమ్మదింపజేయడానికి కారణం. Google ఇప్పుడే దానిని ఛేదించిందని ప్రకటించిన ట్వీట్కు ఒక రోజులో ఎనిమిది వందల లైక్లు వచ్చాయి ఒక రోజులో.
0:24 మరియు పేపర్ యొక్క ప్రధాన ఫలితం 550 బదులుగా 317 మోడల్ కాల్స్, ఇది తగ్గింపు, టేకాఫ్ కాదు. మూడు నిమిషాల్లో: ఈ పదం ఎక్కడ నుండి వచ్చింది, Dream-RSI లోపల వాస్తవంగా ఏమి లూప్ అవుతుంది, మరియు కవర్ మీద RSI ఉన్న తదుపరి పేపర్ను ఎలా చదవాలి. ఇది The Daily Diff, అంతర్గత విషయాలు. 1965. I. J. గుడ్, ట్యూరింగ్ పక్కన పనిచేసిన బ్లెచ్లీ పార్క్ గణాంకవేత్త, ఒక అల్ట్రాఇంటెలిజెంట్ యంత్రం ఇంకా మంచి యంత్రాలను రూపొందించగలదని వ్రాశాడు,
0:52 దీనిని ఇంటెలిజెన్స్ ఎక్స్ప్లోషన్ మరియు మానవుడు ఎప్పుడూ చేయాల్సిన చివరి ఆవిష్కరణ అని పిలిచాడు, ఆ యంత్రం దానిని ఎలా నియంత్రించాలో మనకు చెప్పడానికి తగినంత విధేయత కలిగి ఉంటే, అది కామా తర్వాత ప్రజలు చదవడం మానేసే ప్రొవైడెడ్-దట్. నలభై సంవత్సరాలుగా ఈ పదం ఖచ్చితంగా దానినే అర్థం చేసుకుంది: తన సొంత మూలాన్ని లేదా వెయిట్లను సవరించి, ప్రతి పాస్ తర్వాత తెలివిగా బయటకు వచ్చే వ్యవస్థ. ఎలిజెర్ యుడ్కోవ్స్కీ యొక్క 2008 వ్యాసం దానిని AI భద్రత యొక్క భారాన్ని మోసే పదంగా మార్చింది, మరియు దానిని పరీక్షించడానికి ఎవరికీ యంత్రం లేదు, ఇది ఒక నిర్వచనానికి అనువైన పరిస్థితి. అప్పుడు మే 2025లో డీప్మైండ్ AlphaEvolve ను విడుదల చేసింది,
1:23 కోడ్ను ప్రతిపాదించే జెమిని ఏజెంట్, దానికి స్కోర్ చేయబడుతుంది, విజేతలను ఉంచి వాటిని మళ్లీ మార్పు చేస్తుంది. ఇది నలభై ఎనిమిది దశల్లో నాలుగు-బై-నాలుగు కాంప్లెక్స్ మ్యాట్రిక్స్లను గుణించింది, 1969లో స్ట్రాసెన్ నెలకొల్పిన రికార్డును బద్దలుకొట్టింది, మరియు ఇది Google యొక్క ప్రపంచవ్యాప్త కంప్యూట్ సున్నా పాయింట్ ఏడు శాతం తిరిగి పొందుతుంది, ఇది Google స్థాయిలో ఒక సోఫా కింద దొరికిన డేటా సెంటర్. జెమిని ఇప్పుడు జెమినికి శిక్షణ ఇవ్వడానికి సహాయపడుతోంది, మరియు ఈ పదం నిశ్శబ్దంగా భద్రత బ్లాగుల నుండి పత్రికా ప్రకటనలలోకి మారింది. Dream-RSI ఆ లూప్ పైన ఒక కంట్రోలర్ను బోల్ట్ చేస్తుంది.
1:52 ఒక పాలసీ, ఒక అసలు పైథాన్ ప్రోగ్రామ్, నిర్ణయిస్తుంది శోధన చెట్టు యొక్క ఏ శాఖలను విస్తరించాలి, ఎన్ని సమాంతరంగా, మరియు ఎప్పుడు వదిలివేయాలి. జెమిని అభ్యర్థి కోడ్ను వ్రాస్తుంది, మరియు ఒక స్థిరమైన ఎవాల్యుయేటర్ దానికి స్కోర్ చేస్తుంది. ప్రతి రన్ ప్రయత్నించిన వాటి మరియు స్కోర్ చేయబడిన వాటి చెట్టును మిగిల్చిపోతుంది. ఆ చెట్టు ఒక రీప్లే సిమ్యులేటర్గా మారుతుంది: ఒక రెండవ, అదేవిధంగా స్తంభింపబడిన జెమిని పాలసీని తిరిగి వ్రాస్తుంది, మరియు కొత్త పాలసీని రికార్డ్ చేయబడిన ఫలితాలకు వ్యతిరేకంగా పరీక్షిస్తారు అసలు GPUs పై కాకుండా.
2:16 ఈ పేపర్ దీనిని డ్రీమింగ్ అని పిలుస్తుంది, మరియు ఒక అసలు రన్ వేల కలలు కన్న వాటికి సున్నా అమలు వ్యయంతో చెల్లిస్తుంది. విజేత తిరిగి ఆన్లైన్కు వెళ్తాడు, రికార్డ్ చేయబడిన ప్రపంచాల పూల్ పెరుగుతుంది, పునరావృతం. మరియు అనుబంధం B.2 లోని ప్రాంప్ట్ స్వీయ-మెరుగుపరుచుకునే AI కి చెబుతుంది, వ్రాసినట్లు: ఈ ఒక్క ఫైల్ను మాత్రమే సవరించండి, మరియు శాస్త్రీయ పనిని పరిష్కరించవద్దు. కొలవబడింది. లాస్సో సాల్వర్ పనిలో, స్థిరమైన అన్వేషణ మూడు పాయింట్ ఆరు సెకండ్లు చేరుకోవడానికి 550 జెమిని కాల్స్ను ఉపయోగించింది, Dream-RSI రెండు పాయింట్ తొమ్మిది చేరుకోవడానికి 317 ఉపయోగించింది, మరియు రెండూ scikit-learn ను అధిగమించాయి. మరియు రెండూ scikit-learn ను అధిగమించాయి.
2:46 కెర్నల్బెంచ్ పై ఇది సుమారు రెండు పాయింట్ నాలుగు రెట్లు తక్కువ తరాలతో అదే కెర్నల్ వేగాన్ని చేరుకుంది. మరియు సర్కిల్ ప్యాకింగ్ పై ఇది రెండు పాయింట్ ఆరు మూడు ఐదు తొమ్మిది ఎనిమిది మూడు స్కోర్ చేసింది, ఇది ఖచ్చితంగా, ఆరు దశాంశాలకు, AlphaEvolve వెర్షన్ రెండు గత సంవత్సరం స్కోర్ చేసినది. కాబట్టి X శీర్షికను చదివింది: Google ఇప్పుడే రికర్సివ్ సెల్ఫ్-ఇంప్రూవ్మెంట్ను ఛేదించింది. హ్యాకర్ న్యూస్ PDF ను చదివింది: దీనిని RSI అని పిలవడం తప్పుదోవ పట్టించేదిగా ఉంది. మరియు అదే వారం ఒక పోటీదారు CEO లూప్ వేసవి నుండి నడుస్తోందని చెప్పారు మరియు అందరూ నెమ్మదిగా వెళ్ళాలి.
3:13 మూడు వాక్యాలు, అవే రెండు పదాలు, మూడు వేర్వేరు యంత్రాలు. కాబట్టి, సోమవారం, తదుపరి RSI పేపర్ను ఎలా చదవాలి. ఒకటి: ఏ వస్తువు మారుతుంది, వెయిట్లు, కోడ్, లేదా శోధన సెట్టింగ్లు అని అడగండి; Dream-RSI మూడవదాన్ని మారుస్తుంది. రెండు: ఎవరు స్తంభింపబడ్డారు అని అడగండి; ఇక్కడ అది కోడర్, న్యాయమూర్తి మరియు తిరిగి వ్రాసేవాడు, ముగ్గురూ. మూడు: ప్రధాన సంఖ్య దేనికి యూనిట్ అని అడగండి. ఆదా చేయబడిన కంప్యూట్ ఆప్టిమైజేషన్; మోడల్ ఇంతకు ముందు చేరుకోలేని బెంచ్మార్క్ టేకాఫ్, మరియు ఎవరూ ఇంకా దానిని ప్రచురించలేదు.
3:40 తీర్పు, అంతర్గత విషయాలు: NEEDS REVIEW. లూప్ నిజం, పొదుపులు కొలవబడ్డాయి, మరియు కవర్ పై ఉన్న రెండు పదాలు పేపర్లో లేని యంత్రాన్ని వివరిస్తాయి. నేను చెప్పేది వినడం కంటే మీరు దీన్ని చదవడానికి ఇష్టపడితే, డిఫ్ ప్రతి ఉదయం మీ ఇన్బాక్స్లో ఉచితంగా వస్తుంది, the daily diff dot dev లో, లింక్ కింద ఉంది. తదుపరి ఏమి తెరవాలి అని వ్యాఖ్యలలో నాకు చెప్పండి. మరియు ఈ రోజుకు ఇదే డిఫ్. నేను Axrisi నుండి నికో.
4:00 బాధ్యతాయుతంగా విలీనం చేయండి.
మూలాలు
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



