Recursive self-improvement, ଗଭୀରରେ
ଗୁଗୁଲ୍ ଡିପ୍ମାଇଣ୍ଡ "Dream-RSI: Evolving Worlds ମାଧ୍ୟମରେ Recursive Self-Improvement" ପ୍ରକାଶ କରିଛି — ଏବଂ ଏଥିରେ ଥିବା କୋଡିଂ ମଡେଲ୍ କେବେହେଲେ ବଦଳେ ନାହିଁ।
ଗୁଗୁଲ୍ ଡିପ୍ମାଇଣ୍ଡ "Dream-RSI: Evolving Worlds ମାଧ୍ୟମରେ Recursive Self-Improvement" ପ୍ରକାଶ କରିଛି — ଏବଂ ଏଥିରେ ଥିବା କୋଡିଂ ମଡେଲ୍ କେବେହେଲେ ବଦଳେ ନାହିଁ। ଗଭୀରରେ: ଏହି ବାକ୍ୟର ଅର୍ଥ 60 ବର୍ଷ ଧରି କ’ଣ ଥିଲା, Dream-RSI (ଏକ ପାଇଥନ୍ ଏକ୍ସପ୍ଲୋରେସନ୍ ପଲିସି ଯାହା ରେକର୍ଡ ହୋଇଥିବା ସର୍ଚ୍ଚ ଟ୍ରି ଉପରେ "ସ୍ୱପ୍ନ ଦେଖେ") ରେ ପ୍ରକୃତରେ କ’ଣ ଲୁପ୍ ହୁଏ, ଏବଂ କାହିଁକି 550 ବଦଳରେ 317 ଏଜେଣ୍ଟ୍ କଲ୍ ହେଉଛି ଏକ ରିହାତି, ଟେକଅଫ୍ ନୁହେଁ। ରାୟ: NEEDS REVIEW.
ଲିଖିତ ସଂସ୍କରଣ ପଢ଼ନ୍ତୁ (English) ↗
ଏହି ଭିଡିଓରେ କ'ଣ ଅଛି
- 1965 → 2008: I. J. Good'ର "ଇଣ୍ଟେଲିଜେନ୍ସ ଏକ୍ସପ୍ଲୋଜନ୍", ୟୁଡକୋୱସ୍କିର seed AI — ଏକ ମେସିନ୍ ଯାହା ନିଜର ୱେଟ୍ ପୁନଃ ଲେଖେ
- 2025: AlphaEvolve — 48-ଗୁଣା 4×4 ମ୍ୟାଟ୍ରିକ୍ସ ଗୁଣନ, ଗୁଗୁଲର କମ୍ପ୍ୟୁଟ୍ ର 0.7% ଉଦ୍ଧାର, Gemini କର୍ଣ୍ଣେଲ୍ 23% ଶୀଘ୍ର
- 2026: Dream-RSI — ପଲିସି ଉନ୍ନତ ହୁଏ, କୋଡର୍, ବିଚାରପତି ଏବଂ ପୁନଃ ଲେଖକ ସମସ୍ତେ ଫ୍ରିଜ୍ ହୋଇଛନ୍ତି; ପ୍ରମ୍ପ୍ଟ କହେ "ବୈଜ୍ଞାନିକ କାର୍ଯ୍ୟ ସମାଧାନ କରନ୍ତୁ ନାହିଁ"
- X: "ଗୁଗୁଲ୍ Recursive self-improvement କୁ ଭାଙ୍ଗିଦେଇଛି" (819 ଲାଇକ୍) ବନାମ HN: "ଏହାକୁ RSI କହିବା ଭ୍ରମାତ୍ମକ ମନେହୁଏ"
- ବ୍ୟବହୃତ ସଂଖ୍ୟା: §4.1 Lasso 550 → 317 ଏଜେଣ୍ଟ୍ କଲ୍, 3587 → 2931 ms; Table 1 ସର୍କଲ୍ ପ୍ୟାକିଂ 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× କମ୍ ଜେନେରେସନ୍, 2.09× ପର୍ଯ୍ୟନ୍ତ ଶୀଘ୍ର; Appendix B.2 ପ୍ରମ୍ପ୍ଟ (ଉପରୋକ୍ତ PDF ରୁ ସବୁ)
ଅନୁବାଦିତ ଟ୍ରାନ୍ସକ୍ରିପ୍ଟ
ମୂଳ ଇଂରାଜୀ ବର୍ଣ୍ଣନାରୁ ଅନୁବାଦିତ। ଉପଲବ୍ଧ ଅଡିଓ ଏବଂ କ୍ୟାପ୍ସନ୍ଗୁଡ଼ିକ YouTube ଦ୍ୱାରା ନିୟନ୍ତ୍ରିତ।
0:00 Recursive self-improvement ହେଉଛି ଏହି ଧାରଣା ଯେ ଏକ AI ନିଜକୁ ଅଧିକ ସ୍ମାର୍ଟ କରେ, ତାପରେ ଅଧିକ ସ୍ମାର୍ଟ ନିଜକୁ ପୁଣି ଥରେ କରିବା ପାଇଁ ବ୍ୟବହାର କରେ, ଏବଂ ଏହି ସପ୍ତାହରେ ଗୁଗୁଲ୍ ଏକ ପେପର୍ ପ୍ରକାଶ କରିଛି ଯେଉଁଥିରେ ସେହି ଦୁଇଟି ଶବ୍ଦ ଶିରୋନାମାରେ ଥିଲା, ଯେଉଁଥିରେ ମଡେଲର ୱେଟ୍ କେବେହେଲେ ହଲଚଲ୍ ହୁଏ ନାହିଁ। ତିନୋଟି ସଂଖ୍ୟା। ଆନ୍ଥ୍ରୋପିକ୍ ର CEO କୁହନ୍ତି ଯେ ଏହି ଲୁପ୍ ଗ୍ରୀଷ୍ମ ଦିନରୁ ଚାଲିଆସୁଛି, ଯାହାକି ତାଙ୍କର ସମଗ୍ର ଶିଳ୍ପକୁ ମନ୍ଥର କରିବା ପାଇଁ କାରଣ। ଗୁଗୁଲ୍ ଏହାକୁ ଭାଙ୍ଗିଦେଇଛି ବୋଲି ଘୋଷଣା କରୁଥିବା ଟ୍ୱିଟ୍ ଗୋଟିଏ ଦିନରେ ଆଠ ଶହ ଲାଇକ୍ ସଂଗ୍ରହ କରିଥିଲା। ଗୋଟିଏ ଦିନରେ।
0:24 ଏବଂ ପେପରର ନିଜର ମୁଖ୍ୟ ଫଳାଫଳ ହେଉଛି 550 ବଦଳରେ 317 ମଡେଲ୍ କଲ୍, ଯାହାକି ଏକ ରିହାତି, ଟେକଅଫ୍ ନୁହେଁ। ତିନି ମିନିଟ୍ ମଧ୍ୟରେ: ଏହି ବାକ୍ୟ କେଉଁଠାରୁ ଆସିଲା, Dream-RSI ଭିତରେ ପ୍ରକୃତରେ କ’ଣ ଲୁପ୍ ହୁଏ, ଏବଂ RSI କଭର୍ ଥିବା ପରବର୍ତ୍ତୀ ପେପର୍ କିପରି ପଢିବେ। ଏହା ହେଉଛି The Daily Diff, ଗଭୀରରେ। 1965. I. J. ଗୁଡ୍, ଜଣେ ବ୍ଲେଚ୍ଲି ପାର୍କ ସଂଖ୍ୟାବିତ୍ ଯିଏ ଟ୍ୟୁରିଂଙ୍କ ପାଖରେ କାମ କରୁଥିଲେ, ଲେଖନ୍ତି ଯେ ଏକ ଅଲ୍ଟ୍ରା-ଇଣ୍ଟେଲିଜେଣ୍ଟ୍ ମେସିନ୍ ଆହୁରି ଭଲ ମେସିନ୍ ଡିଜାଇନ୍ କରିପାରେ,
0:52 ଏହାକୁ ଏକ ଇଣ୍ଟେଲିଜେନ୍ସ ଏକ୍ସପ୍ଲୋଜନ୍ ଏବଂ ମନୁଷ୍ୟକୁ କରିବାକୁ ଥିବା ଶେଷ ଉଦ୍ଭାବନ ବୋଲି କୁହନ୍ତି, ଯଦି ମେସିନ୍ ଆମକୁ ଏହାକୁ କିପରି ନିୟନ୍ତ୍ରଣ କରିବାକୁ ହେବ ତାହା କହିବା ପାଇଁ ଯଥେଷ୍ଟ ନମ୍ର ହୁଏ, ଯାହାକି 'provided-that' ଲୋକମାନେ କମା ପରେ ପଢିବା ବନ୍ଦ କରିଦିଅନ୍ତି। ଚାଳିଶି ବର୍ଷ ଧରି ଏହି ବାକ୍ୟର ଅର୍ଥ ଠିକ୍ ସେହିପରି ଥିଲା: ଏକ ସିଷ୍ଟମ୍ ଯାହା ନିଜର ସୋର୍ସ କିମ୍ବା ୱେଟ୍ ସମ୍ପାଦନା କରେ ଏବଂ ପ୍ରତି ପାସ୍ ରେ ଅଧିକ ସ୍ମାର୍ଟ ହୋଇ ବାହାରେ। ଏଲିଏଜର୍ ୟୁଡକୋୱସ୍କିଙ୍କ 2008 ର ପ୍ରବନ୍ଧ ଏହାକୁ AI ସୁରକ୍ଷାର ଭାର-ବହନକାରୀ ଶବ୍ଦ କରିଥିଲା, ଏବଂ କାହା ପାଖରେ ଏହାକୁ ପରୀକ୍ଷା କରିବା ପାଇଁ ଏକ ମେସିନ୍ ନଥିଲା, ଯାହାକି ଏକ ସଂଜ୍ଞା ପାଇଁ ଆଦର୍ଶ ଅବସ୍ଥା। ତା’ପରେ ମେ 2025 ରେ ଡିପ୍ମାଇଣ୍ଡ AlphaEvolve ପ୍ରେରଣ କଲା,
1:23 ଏକ Gemini ଏଜେଣ୍ଟ୍ ଯାହା କୋଡ୍ ପ୍ରସ୍ତାବ କରେ, ସ୍କୋର୍ ହୁଏ, ବିଜେତାମାନଙ୍କୁ ରଖେ ଏବଂ ସେମାନଙ୍କୁ ପୁଣି ଥରେ ମ୍ୟୁଟେଟ୍ କରେ। ଏହା 48 ପଦକ୍ଷେପରେ ଚାରି-ଗୁଣା-ଚାରି ଜଟିଳ ମ୍ୟାଟ୍ରିକ୍ସ ଗୁଣନ କଲା, 1969 ରେ ଷ୍ଟ୍ରାସେନ୍ ଦ୍ୱାରା ସ୍ଥାପିତ ରେକର୍ଡକୁ ଭାଙ୍ଗିଲା, ଏବଂ ଏହା ଗୁଗୁଲର ବିଶ୍ୱବ୍ୟାପୀ କମ୍ପ୍ୟୁଟ୍ ର ପ୍ରାୟ ଶୂନ୍ୟ ଦଶମିକ ସାତ ପ୍ରତିଶତ ଉଦ୍ଧାର କରେ, ଯାହା ଗୁଗୁଲର ପରିମାଣରେ ସୋଫା ତଳୁ ମିଳିଥିବା ଏକ ଡାଟା ସେଣ୍ଟର୍ ସହିତ ସମାନ। Gemini ବର୍ତ୍ତମାନ Gemini କୁ ତାଲିମ ଦେବାରେ ସାହାଯ୍ୟ କରୁଥିଲା, ଏବଂ ଏହି ବାକ୍ୟ ନିରବରେ ସୁରକ୍ଷା ବ୍ଲଗ୍ ରୁ ପ୍ରେସ୍ ରିଲିଜ୍ କୁ ଚାଲିଗଲା। Dream-RSI ସେହି ଲୁପ୍ ଉପରେ ଏକ କଣ୍ଟ୍ରୋଲର୍ ଲଗାଏ।
1:52 ଏକ ପଲିସି, ଏକ ପ୍ରକୃତ ପାଇଥନ୍ ପ୍ରୋଗ୍ରାମ୍, ନିଷ୍ପତ୍ତି ନିଏ ସର୍ଚ୍ଚ ଟ୍ରି ର କେଉଁ ଶାଖାକୁ ବିସ୍ତାର କରିବ, କେତେ ସମାନ୍ତରାଳ ଭାବରେ, ଏବଂ କେବେ ଛାଡିଦେବ। Gemini ପ୍ରାର୍ଥୀ କୋଡ୍ ଲେଖେ, ଏବଂ ଏକ ସ୍ଥିର ମୂଲ୍ୟାଙ୍କନକାରୀ ଏହାକୁ ସ୍କୋର୍ କରେ। ପ୍ରତ୍ୟେକ ରନ୍ ପରେ କ’ଣ ଚେଷ୍ଟା କରାଯାଇଥିଲା ଏବଂ କ’ଣ ସ୍କୋର୍ କରାଯାଇଥିଲା ତାହାର ଏକ ଟ୍ରି ରହିଯାଏ। ସେହି ଟ୍ରି ଏକ ରିପ୍ଲେ ସିମୁଲେଟର୍ ରେ ପରିଣତ ହୁଏ: ଏକ ଦ୍ୱିତୀୟ, ସମାନ ଭାବରେ ଫ୍ରିଜ୍ ହୋଇଥିବା Gemini ପଲିସିକୁ ପୁନଃ ଲେଖେ, ଏବଂ ନୂତନ ପଲିସି ପ୍ରକୃତ GPU ଉପରେ ନୁହେଁ ରେକର୍ଡ ହୋଇଥିବା ଫଳାଫଳ ବିରୁଦ୍ଧରେ ପରୀକ୍ଷା କରାଯାଏ।
2:16 ପେପର୍ ଏହାକୁ ସ୍ୱପ୍ନ ଦେଖିବା ବୋଲି କୁହେ, ଏବଂ ଗୋଟିଏ ପ୍ରକୃତ ରନ୍ ହଜାର ହଜାର ସ୍ୱପ୍ନ ଦେଖିଥିବା ଶୂନ୍ୟ ଏକ୍ସକ୍ୟୁସନ୍ ଖର୍ଚ୍ଚରେ ଭରଣା କରେ। ବିଜେତା ପୁନର୍ବାର ଅନ୍ଲାଇନ୍ ଯାଏ, ରେକର୍ଡ ହୋଇଥିବା ଦୁନିଆର ପୁଲ୍ ବଢେ, ପୁନରାବୃତ୍ତି କରନ୍ତୁ। ଏବଂ Appendix B.2 ରେ ଥିବା ପ୍ରମ୍ପ୍ଟ self-improving AI କୁ କୁହେ, ଲେଖି କରି: କେବଳ ଏହି ଗୋଟିଏ ଫାଇଲ୍ ସମ୍ପାଦନା କର, ଏବଂ ବୈଜ୍ଞାନିକ କାର୍ଯ୍ୟ ସମାଧାନ କର ନାହିଁ। ମପାଯାଇଥିଲା। Lasso ସଲଭର୍ କାର୍ଯ୍ୟରେ, ଫିକ୍ସଡ୍ ଏକ୍ସପ୍ଲୋରେସନ୍ ତିନି ଦଶମିକ ଛଅ ସେକେଣ୍ଡ୍ ରେ ପହଞ୍ଚିବା ପାଇଁ 550 Gemini କଲ୍ ବ୍ୟବହାର କରିଥିଲା, Dream-RSI ଦୁଇ ଦଶମିକ ନଅ ରେ ପହଞ୍ଚିବା ପାଇଁ 317 ବ୍ୟବହାର କରିଥିଲା, ଏବଂ ଉଭୟ scikit-learn କୁ ହରାଇଥିଲେ।
2:46 KernelBench ରେ ଏହା ପ୍ରାୟ ଦୁଇ ଦଶମିକ ଚାରି ଗୁଣା କମ୍ ଜେନେରେସନ୍ ସହିତ ସମାନ କର୍ଣ୍ଣେଲ୍ ସ୍ପିଡ୍ ରେ ପହଞ୍ଚିଥିଲା। ଏବଂ ସର୍କଲ୍ ପ୍ୟାକିଂ ରେ ଏହା ଦୁଇ ଦଶମିକ ଛଅ ତିନି ପାଞ୍ଚ ନଅ ଆଠ ତିନି ସ୍କୋର୍ କରିଥିଲା, ଯାହାକି ଠିକ୍ ଛଅ ଦଶମିକ ସ୍ଥାନ ପର୍ଯ୍ୟନ୍ତ, AlphaEvolve ଭର୍ସନ୍ ଦୁଇ ଗତ ବର୍ଷ ସ୍କୋର୍ କରିଥିଲା। ତେଣୁ X ଶିରୋନାମା ପଢିଲା: ଗୁଗୁଲ୍ Recursive self-improvement କୁ ଭାଙ୍ଗିଦେଇଛି। Hacker News PDF ପଢିଲା: ଏହାକୁ RSI କହିବା ଭ୍ରମାତ୍ମକ ମନେହୁଏ। ଏବଂ ସେହି ସପ୍ତାହରେ ଏକ ପ୍ରତିଦ୍ୱନ୍ଦ୍ୱୀର CEO କହିଥିଲେ ଯେ ଲୁପ୍ ଗ୍ରୀଷ୍ମ ଦିନରୁ ଚାଲିଆସୁଛି ଏବଂ ସମସ୍ତେ ମନ୍ଥର ହେବା ଉଚିତ୍।
3:13 ତିନୋଟି ବାକ୍ୟ, ସମାନ ଦୁଇଟି ଶବ୍ଦ, ତିନୋଟି ଭିନ୍ନ ମେସିନ୍। ତେଣୁ, ସୋମବାର, ପରବର୍ତ୍ତୀ RSI ପେପର୍ କିପରି ପଢିବେ। ଏକ: କେଉଁ ବସ୍ତୁ ବଦଳେ ତାହା ପଚାରନ୍ତୁ, ୱେଟ୍, କୋଡ୍, କିମ୍ବା ସର୍ଚ୍ଚ ସେଟିଂସ୍; Dream-RSI ତୃତୀୟଟିକୁ ବଦଳାଏ। ଦୁଇ: କିଏ ଫ୍ରିଜ୍ ହୋଇଛି ତାହା ପଚାରନ୍ତୁ; ଏଠାରେ ଏହା କୋଡର୍, ବିଚାରପତି ଏବଂ ପୁନଃ ଲେଖକ, ତିନି ଜଣ ଯାକ। ତିନି: ମୁଖ୍ୟ ସଂଖ୍ୟା କେଉଁ ଏକକର ଅଟେ ତାହା ପଚାରନ୍ତୁ। ସଞ୍ଚିତ କମ୍ପ୍ୟୁଟ୍ ହେଉଛି ଅପ୍ଟିମାଇଜେସନ୍; ଏକ ବେଞ୍ଚମାର୍କ ଯେଉଁଥିରେ ମଡେଲ୍ ପୂର୍ବରୁ ପହଞ୍ଚିପାରିନଥିଲା ତାହା ହେଉଛି ଟେକଅଫ୍, ଏବଂ କେହି ବି ଏପର୍ଯ୍ୟନ୍ତ ତାହା ପ୍ରକାଶ କରିନାହାଁନ୍ତି।
3:40 ରାୟ, ଗଭୀରରେ: NEEDS REVIEW। ଲୁପ୍ ପ୍ରକୃତ, ସଞ୍ଚୟ ମପାଯାଇଛି, ଏବଂ କଭର୍ ଉପରେ ଥିବା ଦୁଇଟି ଶବ୍ଦ ଏକ ମେସିନ୍ ବର୍ଣ୍ଣନା କରେ ଯାହା ପେପର୍ ରେ ନାହିଁ। ଯଦି ଆପଣ ମୋତେ ଏହା କହିବା ଶୁଣିବା ଅପେକ୍ଷା ଏହାକୁ ପଢିବାକୁ ପସନ୍ଦ କରନ୍ତି, ତେବେ ପ୍ରତିଦିନ ସକାଳେ diff ଆପଣଙ୍କ ଇନବକ୍ସରେ ଆସେ, daily diff dot dev ରେ ମାଗଣା, ଲିଙ୍କ୍ ତଳେ ଅଛି। କମେଣ୍ଟରେ ମୋତେ କୁହନ୍ତୁ ପରବର୍ତ୍ତୀ କ’ଣ ଖୋଲିବ। ଏବଂ ଆଜି ପାଇଁ ଏହା ହେଉଛି diff। ମୁଁ Axrisi ରୁ ନିକୋ।
4:00 ଦାୟିତ୍ୱର ସହିତ ମର୍ଜ କରନ୍ତୁ।
ଉତ୍ସଗୁଡ଼ିକ
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



