# পুনরাবৃত্তিমূলক স্ব-উন্নতি, আড়ালে

Published: 2026-09-18

গুগল ডিপমাইন্ড "Dream-RSI: Evolving Worlds-এর মাধ্যমে পুনরাবৃত্তিমূলক স্ব-উন্নতি" প্রকাশ করেছে – এবং এর ভেতরের কোডিং মডেল কখনও পরিবর্তন হয় না। আড়ালে: ৬০ বছর ধরে এই শব্দগুচ্ছের অর্থ কী ছিল, Dream-RSI-তে আসলে কী লুপ হয় (একটি পাইথন অন্বেষণ নীতি যা রেকর্ড করা সার্চ ট্রি-এর উপর "স্বপ্ন দেখে"), এবং কেন ৫৫০ এর পরিবর্তে ৩১৭ এজেন্ট কল একটি ছাড়, উড্ডয়ন নয়। রায়: NEEDS REVIEW।

Canonical: https://thedailydiff.dev/bn/video/2026-09-18-self-improving-ai/

## এই ভিডিওতে যা আছে

- ১৯৬৫ → ২০০৮: আই. জে. গুড-এর "গোয়েন্দা বিস্ফোরণ", ইউডকভস্কির বীজ এআই — একটি মেশিন যা তার নিজস্ব ওজন পুনরায় লেখে
- ২০২৫: AlphaEvolve — ৪৮-গুণন ৪×৪ ম্যাট্রিক্স গুণ, গুগলের ০.৭% গণনা পুনরুদ্ধার করা হয়েছে, জেমিনি কার্নেল ২৩% দ্রুত
- ২০২৬: Dream-RSI — নীতি উন্নত হয়, কোডার, বিচারক এবং পুনরায় লেখক সবই হিমায়িত; প্রম্পটে লেখা আছে "বৈজ্ঞানিক কাজটি সমাধান করবেন না"
- X: "গুগল সবেমাত্র পুনরাবৃত্তিমূলক স্ব-উন্নতি ভেঙে দিয়েছে" (৮১৯ লাইক) বনাম HN: "এটিকে RSI বলা বিভ্রান্তিকর বলে মনে হচ্ছে"
- ব্যবহৃত সংখ্যা: §৪.১ ল্যাসো ৫৫০ → ৩১৭ এজেন্ট কল, ৩৫৮৭ → ২৯৩১ মিমি; সারণী ১ বৃত্ত প্যাকিং ২.৬৩৫৯৮৩ = AlphaEvolveV2; §৪.৩ কার্নেলবেঞ্চ ২.৪৩× / ১.৭৯× কম প্রজন্ম, ২.০৯× পর্যন্ত দ্রুত; পরিশিষ্ট বি.২ প্রম্পট (উপরের PDF থেকে সব)

## অনুবাদিত প্রতিলিপি

মূল ইংরেজি বর্ণনা থেকে অনূদিত। উপলব্ধ অডিও এবং ক্যাপশন YouTube দ্বারা নিয়ন্ত্রিত।

0:00 পুনরাবৃত্তিমূলক স্ব-উন্নতি হল এমন একটি ধারণা যে একটি এআই নিজেকে আরও স্মার্ট করে তোলে, তারপর আরও স্মার্ট নিজেকে আবার তা করতে ব্যবহার করে, এবং এই সপ্তাহে গুগল একটি কাগজ প্রকাশ করেছে যেখানে শিরোনামে সেই দুটি শব্দ রয়েছে, যেখানে মডেলের ওজন কখনও নড়ে না। তিনটি সংখ্যা। অ্যানথ্রোপিকের সিইও বলেছেন যে এই লুপটি গ্রীষ্মকাল থেকে চলছে, যা পুরো শিল্পকে ধীর করার তার কারণ। গুগল সবেমাত্র এটি ভেঙে দিয়েছে বলে ঘোষণা করা টুইটটি একদিনে আটশো লাইক পেয়েছে একদিনে।

0:24 এবং কাগজটির নিজস্ব প্রধান ফলাফল হল ৫৫০ এর পরিবর্তে ৩১৭ মডেল কল, যা একটি ছাড়, উড্ডয়ন নয়। তিন মিনিটে: শব্দগুচ্ছটি কোথা থেকে এসেছে, Dream-RSI এর ভিতরে আসলে কী লুপ হয়, এবং কীভাবে RSI কভারে থাকা পরবর্তী কাগজটি পড়তে হয়। এটি হল The Daily Diff, আড়ালে। ১৯৬৫। আই. জে. গুড, একজন ব্লেচলি পার্কের পরিসংখ্যানবিদ যিনি টুরিং এর পাশে কাজ করতেন, লিখেছেন যে একটি আল্ট্রাইন্টেলিজেন্ট মেশিন আরও ভালো মেশিন ডিজাইন করতে পারে,

0:52 এটিকে গোয়েন্দা বিস্ফোরণ এবং মানুষের তৈরি করা শেষ উদ্ভাবন বলে অভিহিত করেছেন, যদি মেশিনটি যথেষ্ট নম্র হয় আমাদের কীভাবে এটি নিয়ন্ত্রণ করতে হয় তা বলার জন্য, যা কমার পরে মানুষ পড়া বন্ধ করে দেয় এমন একটি শর্ত। চল্লিশ বছর ধরে এই শব্দগুচ্ছটির অর্থ ছিল ঠিক তাই: একটি সিস্টেম যা তার নিজস্ব সোর্স বা ওজন সম্পাদনা করে এবং প্রতিটি পাসে আরও স্মার্ট হয়ে ওঠে। এলিয়েজার ইউডকভস্কির ২০০৮ সালের প্রবন্ধ এটিকে এআই সুরক্ষার মূল শব্দ করে তোলে, এবং কারও কাছে এটি পরীক্ষা করার জন্য কোনও মেশিন ছিল না, যা একটি সংজ্ঞার জন্য আদর্শ অবস্থা। তারপর মে ২০২৫ সালে ডিপমাইন্ড AlphaEvolve প্রকাশ করে,

1:23 একটি জেমিনি এজেন্ট যা কোড প্রস্তাব করে, এটিকে স্কোর করে, বিজয়ীদের রাখে এবং তাদের আবার পরিবর্তন করে। এটি ৪৮ ধাপে চার-বাই-চার জটিল ম্যাট্রিক্স গুণ করে, ১৯৬৯ সালে স্ট্র্যাসেনের একটি রেকর্ড ভেঙেছে, এবং এটি গুগলের বিশ্বব্যাপী গণনার প্রায় শূন্য দশমিক সাত শতাংশ পুনরুদ্ধার করে, যা গুগলের স্কেলে একটি সোফার নিচে পাওয়া ডেটা সেন্টার। জেমিনি এখন জেমিনিকে প্রশিক্ষণ দিতে সাহায্য করছিল, এবং শব্দটি নীরবে সুরক্ষা ব্লগ থেকে প্রেস রিলিজের দিকে চলে যায়। Dream-RSI সেই লুপের উপরে একটি কন্ট্রোলার যোগ করে।

1:52 একটি নীতি, একটি প্রকৃত পাইথন প্রোগ্রাম, সিদ্ধান্ত নেয় সার্চ ট্রির কোন শাখাগুলি সম্প্রসারণ করতে হবে, কতগুলি সমান্তরালে, এবং কখন হাল ছেড়ে দিতে হবে। জেমিনি প্রার্থী কোড লেখে, এবং একটি নির্দিষ্ট মূল্যায়নকারী এটিকে স্কোর করে। প্রতিটি রান কী চেষ্টা করা হয়েছিল এবং এটি কী স্কোর করেছিল তার একটি ট্রি রেখে যায়। সেই ট্রি একটি রিপ্লে সিমুলেটর হয়ে ওঠে: একটি দ্বিতীয়, একইভাবে হিমায়িত জেমিনি নীতিটি পুনরায় লেখে, এবং নতুন নীতিটি রেকর্ড করা ফলাফলের বিরুদ্ধে পরীক্ষা করা হয় বাস্তব জিপিইউ-এর পরিবর্তে।

2:16 কাগজটি এটিকে স্বপ্ন দেখা বলে, এবং একটি বাস্তব রান হাজার হাজার স্বপ্নের জন্য অর্থ প্রদান করে শূন্য কার্যকরকরণ খরচে। বিজয়ী আবার অনলাইনে ফিরে আসে, রেকর্ড করা বিশ্বের পুল বৃদ্ধি পায়, পুনরাবৃত্তি। এবং পরিশিষ্ট বি.২-এর প্রম্পটটি স্ব-উন্নতিশীল এআইকে বলে, লিখিতভাবে: শুধুমাত্র এই একটি ফাইল সম্পাদনা করুন, এবং বৈজ্ঞানিক কাজটি সমাধান করবেন না। পরিমাপ করা হয়েছে। ল্যাসো সলভার টাস্কে, নির্দিষ্ট অন্বেষণ ৫৫০ জেমিনি কল ব্যয় করে তিন দশমিক ছয় সেকেন্ডে পৌঁছাতে, Dream-RSI ৩১৭ ব্যয় করে দুই দশমিক নয় সেকেন্ডে পৌঁছাতে, এবং উভয়ই scikit-learn কে ছাড়িয়ে গেছে।

2:46 কার্নেলবেঞ্চে এটি প্রায় দুই দশমিক চার গুণ কম প্রজন্মের সাথে একই কার্নেল গতিতে পৌঁছেছে। এবং বৃত্ত প্যাকিংয়ে এটি দুই দশমিক ছয় তিন পাঁচ নয় আট তিন স্কোর করেছে, যা ঠিক, ছয় দশমিক স্থান পর্যন্ত, AlphaEvolve সংস্করণ দুই গত বছর স্কোর করেছিল। সুতরাং X শিরোনামটি পড়েছে: গুগল সবেমাত্র পুনরাবৃত্তিমূলক স্ব-উন্নতি ভেঙে দিয়েছে। হ্যাকারের খবর PDF পড়েছে: এটিকে RSI বলা বিভ্রান্তিকর বলে মনে হচ্ছে। এবং একই সপ্তাহে একজন প্রতিযোগীর সিইও বলেছেন যে লুপটি গ্রীষ্মকাল থেকে চলছে এবং সবার গতি কমানো উচিত।

3:13 তিনটি বাক্য, একই দুটি শব্দ, তিনটি ভিন্ন মেশিন। সুতরাং, সোমবার, পরবর্তী RSI কাগজটি কীভাবে পড়তে হয়। এক: জিজ্ঞাসা করুন কোন বস্তু পরিবর্তন হয়, ওজন, কোড, নাকি অনুসন্ধান সেটিংস; Dream-RSI তৃতীয়টি পরিবর্তন করে। দুই: জিজ্ঞাসা করুন কে হিমায়িত; এখানে এটি কোডার, বিচারক এবং পুনরায় লেখক, তিনটিই। তিন: জিজ্ঞাসা করুন প্রধান সংখ্যাটি কীসের একক। গণনা সংরক্ষণ করা হল অপ্টিমাইজেশন; একটি বেঞ্চমার্ক যা মডেল আগে পৌঁছাতে পারেনি তা হল উড্ডয়ন, এবং কেউ এখনও সেটি প্রকাশ করেনি।

3:40 রায়, আড়ালে: NEEDS REVIEW। লুপটি বাস্তব, সঞ্চয় পরিমাপ করা হয়েছে, এবং কভারে থাকা দুটি শব্দ কাগজে নেই এমন একটি মেশিন বর্ণনা করে। আপনি যদি এটি শোনার চেয়ে পড়তে পছন্দ করেন তবে, প্রতিটি সকালে আপনার ইনবক্সে ডিফারেন্সটি আসে, daily diff dot dev এ বিনামূল্যে, লিঙ্ক নিচে। মন্তব্যে আমাকে বলুন পরবর্তীতে কী খুলতে হবে। এবং আজকের জন্য এই ডিফারেন্স। আমি অ্যাক্স্রিসি থেকে নিকো।

4:00 দায়িত্বের সাথে মার্জ করুন।

## উৎস

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
