+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

რეკურსიული თვითგაუმჯობესება, კულისებში

Google DeepMind-მა გამოაქვეყნა „Dream-RSI: რეკურსიული თვითგაუმჯობესება განვითარებადი სამყაროების მეშვეობით“ — და მასში შემავალი კოდირების მოდელი არასოდეს იცვლება.

Google DeepMind-მა გამოაქვეყნა „Dream-RSI: რეკურსიული თვითგაუმჯობესება განვითარებადი სამყაროების მეშვეობით“ — და მასში შემავალი კოდირების მოდელი არასოდეს იცვლება. კულისებში: რას ნიშნავდა ეს ფრაზა 60 წლის განმავლობაში, რა მეორდება რეალურად Dream-RSI-ში (პითონის საძიებო პოლიტიკა, რომელიც „ოცნებობს“ ჩაწერილ საძიებო ხეებზე) და რატომ არის 317 აგენტის ზარი 550-ის ნაცვლად ფასდაკლება და არა აფრენა. ვერდიქტი: საჭიროებს განხილვას.

წაიკითხეთ წერილობითი გამოცემა (ინგლისური) ↗

რას მოიცავს ეს ვიდეო

  • 1965 → 2008: ი. ჯ. გუდის „ინტელექტის აფეთქება“, იუდკოვსკის საწყისი ხელოვნური ინტელექტი — მანქანა, რომელიც გადაწერს საკუთარ წონას
  • 2025: AlphaEvolve — 48-გამრავლების 4×4 მატრიცის გამრავლება, Google-ის გამოთვლის 0.7% აღდგენილი, Gemini-ის ბირთვები 23% უფრო სწრაფი
  • 2026: Dream-RSI — პოლიტიკა უმჯობესდება, კოდერი, მსაჯი და გადამწერი გაყინულია; მოთხოვნაში ნათქვამია „არ გადაჭრათ სამეცნიერო ამოცანა“
  • X: „Google-მა ახლახან დაასრულა რეკურსიული თვითგაუმჯობესება“ (819 მოწონება) vs HN: „ამ RSI-ის დარქმევა შეცდომაში შემყვანი ჩანს“
  • გამოყენებული რიცხვები: §4.1 Lasso 550 → 317 აგენტის ზარი, 3587 → 2931 მლ; ცხრილი 1 წრის შეფუთვა 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× ნაკლები თაობა, 2.09×-მდე უფრო სწრაფი; დანართი B.2 მოთხოვნა (ყველა ზემოთ მოცემული PDF-დან)

ნათარგმნი ტრანსკრიპტი

ნათარგმნია ორიგინალური ინგლისური ნარატივიდან. ხელმისაწვდომი აუდიო და სუბტიტრები კონტროლდება YouTube-ის მიერ.

0:00 რეკურსიული თვითგაუმჯობესება არის იდეა, რომ ხელოვნური ინტელექტი თავს აუმჯობესებს, შემდეგ იყენებს გაუმჯობესებულ თავს, რათა ეს კვლავ გააკეთოს, და ამ კვირაში Google-მა გამოაქვეყნა ნაშრომი ამ ორი სიტყვით სათაურში, რომელშიც მოდელის წონები არასოდეს იძვრის. სამი რიცხვი. Anthropic-ის აღმასრულებელი დირექტორი ამბობს, რომ ეს ციკლი ზაფხულიდან მიმდინარეობს, რაც მისი მიზეზია მთელი ინდუსტრიის შესანელებლად. ტვიტმა, რომელიც აცხადებდა, რომ Google-მა ახლახან დაასრულა, რვაასი მოწონება მოაგროვა ერთ დღეში.

0:24 და თავად ნაშრომის მთავარი შედეგია 317 მოდელის ზარი 550-ის ნაცვლად, რაც ფასდაკლებაა და არა აფრენა. სამ წუთში: საიდან გაჩნდა ეს ფრაზა, რა მეორდება რეალურად Dream-RSI-ში და როგორ წავიკითხოთ შემდეგი ნაშრომი RSI-ით ყდაზე. ეს არის The Daily Diff, კულისებში. 1965. ი. ჯ. გუდი, ბლეტჩლი პარკის სტატისტიკოსი, რომელიც ტურინგის გვერდით მუშაობდა, წერს, რომ ულტრაინტელექტუალურ მანქანას შეუძლია შექმნას კიდევ უკეთესი მანქანები,

0:52 უწოდებს მას ინტელექტის აფეთქებას და უკანასკნელ გამოგონებას, რაც ადამიანს ოდესმე დასჭირდება, იმ პირობით, რომ მანქანა საკმარისად მორჩილი იქნება, რათა გვითხრას, როგორ გავაკონტროლოთ იგი, რაც არის „იმ პირობით“, რომ ხალხი მძიმის შემდეგ კითხვას წყვეტს. ორმოცი წლის განმავლობაში ეს ფრაზა ზუსტად ამას ნიშნავდა: სისტემას, რომელიც რედაქტირებს საკუთარ წყაროს ან წონას და ყოველი გავლის შემდეგ უფრო ჭკვიანი ხდება. ელიეზერ იუდკოვსკის 2008 წლის ესეიმ ის ხელოვნური ინტელექტის უსაფრთხოების მთავარ სიტყვად აქცია, და არავის ჰქონდა მანქანა, რომელზეც მისი ტესტირება შეეძლო, რაც იდეალური პირობაა განმარტებისთვის. შემდეგ 2025 წლის მაისში DeepMind-მა გამოუშვა AlphaEvolve,

1:23 Gemini-ის აგენტი, რომელიც გვთავაზობს კოდს, იღებს შეფასებას, ინახავს გამარჯვებულებს და კვლავ აგენერირებს მათ. მან გაამრავლა ოთხ-ოთხზე კომპლექსური მატრიცები 48 ნაბიჯში, მოხსნა შტრასენის 1969 წელს დამყარებული რეკორდი და აღადგინა Google-ის მსოფლიო გამოთვლის დაახლოებით ნულ მთელი შვიდი პროცენტი, რაც Google-ის მასშტაბით არის დივანის ქვეშ ნაპოვნი მონაცემთა ცენტრი. Gemini ახლა ეხმარებოდა Gemini-ის გაწვრთნას, და ფრაზა ჩუმად გადავიდა უსაფრთხოების ბლოგებიდან პრეს-რელიზებში. Dream-RSI ამ ციკლის თავზე ამაგრებს კონტროლერს.

1:52 პოლიტიკა, რეალური Python პროგრამა, წყვეტს საძიებო ხის რომელი განშტოება გააფართოვოს, რამდენი პარალელურად და როდის დანებდეს. Gemini წერს კანდიდატ კოდს, და ფიქსირებული შემფასებელი აფასებს მას. ყოველი გაშვება ტოვებს ხეს იმის შესახებ, თუ რა სცადა და რა შეფასება მიიღო. ეს ხე ხდება განმეორებითი სიმულატორი: მეორე, თანაბრად გაყინული Gemini გადაწერს პოლიტიკას, და ახალი პოლიტიკა შემოწმდება ჩაწერილი შედეგების მიხედვით რეალურ GPU-ებზე.

2:16 ნაშრომი ამას სიზმარს უწოდებს, და ერთი რეალური გაშვება ათასობით ნასიზმრევი გაშვების ღირებულებას ანაზღაურებს ნულოვანი შესრულების ხარჯით. გამარჯვებული ბრუნდება ონლაინში, ჩაწერილი სამყაროების აუზი იზრდება, იმეორებს. და დანართი B.2-ის მოთხოვნა ეუბნება თვითგაუმჯობესებად AI-ს, წერილობით: შეცვალე მხოლოდ ეს ერთი ფაილი და არ გადაჭრა სამეცნიერო ამოცანა. გაზომილი. Lasso-ს ამომხსნელის ამოცანაზე, ფიქსირებულმა ძიებამ 550 Gemini-ის ზარი დახარჯა სამი მთელი ექვსი წამის მისაღწევად, Dream-RSI-მ დახარჯა 317 ორი მთელი ცხრა წამის მისაღწევად, და ორივემ აჯობა scikit-learn-ს.

2:46 KernelBench-ზე მან მიაღწია იმავე ბირთვის სიჩქარეს დაახლოებით ორ მთელ ოთხჯერ ნაკლები თაობით. და წრის შეფუთვაზე მან მიიღო ქულა ორი მთელი ექვსი სამი ხუთი ცხრა რვა სამი, რაც ზუსტად, ექვს ათწილადამდე, AlphaEvolve ვერსია ორმა მიიღო გასულ წელს. ასე რომ, X-მა წაიკითხა სათაური: Google-მა ახლახან დაასრულა რეკურსიული თვითგაუმჯობესება. Hacker News-მა წაიკითხა PDF: ამ RSI-ის დარქმევა შეცდომაში შემყვანი ჩანს. და იმავე კვირას კონკურენტის აღმასრულებელმა დირექტორმა თქვა, რომ ციკლი ზაფხულიდან მიმდინარეობდა და ყველამ უნდა შეანელოს.

3:13 სამი წინადადება, იგივე ორი სიტყვა, სამი სხვადასხვა მანქანა. ასე რომ, ორშაბათი, როგორ წავიკითხოთ შემდეგი RSI ნაშრომი. ერთი: იკითხეთ, რომელი ობიექტი იცვლება, წონები, კოდი თუ ძიების პარამეტრები; Dream-RSI ცვლის მესამეს. ორი: იკითხეთ, ვინ არის გაყინული; აქ ესენი არიან კოდერი, მსაჯი და გადამწერი, სამივე. სამი: იკითხეთ, რისი ერთეულია მთავარი რიცხვი. დაზოგილი გამოთვლა არის ოპტიმიზაცია; ბენჩმარკი, რომელსაც მოდელი მანამდე ვერ აღწევდა, არის აფრენა, და ჯერ არავის გამოუქვეყნებია ის.

3:40 ვერდიქტი, კულისებში: საჭიროებს განხილვას. ციკლი რეალურია, დანაზოგი გაზომილია, და ყდაზე არსებული ორი სიტყვა აღწერს მანქანას, რომელიც არ არის ნაშრომში. თუ ამის წაკითხვა გირჩევნიათ, ვიდრე მოსმენა, განსხვავება თქვენს შემოსულებშია ყოველ დილით, უფასოდ daily diff dot dev-ზე, ბმული ქვემოთ. მითხარით, რა გავხსნა შემდეგ კომენტარებში. და ეს არის დღევანდელი განსხვავება. მე ვარ ნიკო Axrisi-დან.

4:00 პასუხისმგებლობით გააერთიანეთ.

წყაროები

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

მსგავსი ვიდეოები

under-the-hood · ka · 24 სექ. 2026

SAML, შიგნიდან: ხელმოწერა წერილის შიგნით

SAML თითქმის ყველა სამუშაო აპლიკაციაში გირთავთ, მისი ხელმოწერა კი XML-ის შიგნითაა, რომელსაც ის აწერს ხელს. შიგნიდან: შესვლის „ცეკვა“ აპლიკაციას, ბრაუზერსა და იდენტობის პროვაიდერს შორის, როგორ გამოიყურ

3:02 ↗
under-the-hood · ka · 23 სექ. 2026

როცა მოდელი კვდება, შიგნიდან

AI მოდელი არ კვდება — მას ეძლევა გათიშვის თარიღი, და მეორე დილით, თქვენი API ზარი აბრუნებს 404-ს: "მოდელი მოძველებულია, მეტი გაიგეთ აქ." შიგნიდან: ოთხ-მდგომარეობიანი მილსადენი (აქტიური → მოძველებული →

3:15 ↗
under-the-hood · ka · 21 სექ. 2026

კლოდმა RSA-896 დაშალა. აი, როგორ იშლება RSA სინამდვილეში

19 სექტემბერს Anthropic-ის ინჟინერმა დაშალა RSA-896 — 270-ნიშნა გამოწვევის რიცხვი — Claude-ის, ღია კოდის CADO-NFS საცრის GPU პორტის და ~30 GPU-წლის გამოყენებით 2,048 უმოქმედო GPU-ზე ათი დღის განმავლობ

3:39 ↗
under-the-hood · ka · 19 სექ. 2026

პასქეიები, შიგნიდან

პასქეი არის პაროლი, რომელსაც თქვენი მოწყობილობა იგონებს, არასოდეს გაჩვენებთ და უარს ამბობს ვინმესთვის გადაცემაზე — თქვენი ჩათვლით. შიგნიდან: WebAuthn ცერემონია (საიტზე ერთეული გასაღებების წყვილი, გამო

3:12 ↗