+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Rekursinis savęs tobulinimas: kas po gaubtu

„Google DeepMind“ paskelbė „Dream-RSI: Recursive Self-Improvement through Evolving Worlds“ – ir jame esantis kodavimo modelis niekada nesikeičia.

„Google DeepMind“ paskelbė „Dream-RSI: Recursive Self-Improvement through Evolving Worlds“ – ir jame esantis kodavimo modelis niekada nesikeičia. Kas po gaubtu: ką ši frazė reiškė 60 metų, kas iš tikrųjų kartojasi „Dream-RSI“ (Python tyrinėjimo politika, kuri „svajoja“ apie įrašytus paieškos medžius) ir kodėl 317 agentų iškvietimų, o ne 550, yra nuolaida, o ne pakilimas. Verdiktas: NEEDS REVIEW.

Skaityti rašytinę versiją (anglų k.) ↗

Kas aptariama šiame vaizdo įraše

  • 1965 → 2008: I. J. Goodo „intelekto sprogimas“, Yudkowsky sėklos dirbtinis intelektas – mašina, kuri perrašo savo svorius
  • 2025: AlphaEvolve – 48 daugybos 4×4 matricos daugyba, 0.7% Google skaičiavimo galios atgauta, Gemini branduoliai 23% greitesni
  • 2026: Dream-RSI – politika tobulėja, kodavimo programa, vertintojas ir perrašytojas yra užšaldyti; instrukcijoje sakoma „Nespręskite mokslinės užduoties“
  • X: „Google ką tik įvaldė rekursinį savęs tobulinimą“ (819 patinka) prieš HN: „tai vadinti RSI atrodo klaidinančiai“
  • Naudoti skaičiai: §4.1 Lasso 550 → 317 agentų iškvietimų, 3587 → 2931 ms; 1 lentelė apskritimų pakavimas 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× mažiau generacijų, iki 2.09× greičiau; Priedas B.2 instrukcija (visi iš aukščiau pateikto PDF)

Išverstas transkriptas

Išversta iš originalo anglų kalbos. Galimas garso ir subtitrų valdymas per YouTube.

0:00 Rekursinis savęs tobulinimas yra idėja, kad DI daro save protingesniu, tada naudoja protingesnį save, kad tai padarytų vėl, ir šią savaitę „Google“ paskelbė straipsnį su šiais dviem žodžiais pavadinime, kuriame modelio svoriai niekada nejuda. Trys skaičiai. „Anthropic“ vadovas sako, kad ši kilpa veikia nuo vasaros, o tai yra jo priežastis sulėtinti visą pramonę. Tviterio įrašas, skelbiantis, kad „Google“ ką tik tai įvaldė, surinko aštuonis šimtus patinka per dieną.

0:24 Ir paties straipsnio pagrindinis rezultatas yra 317 modelio iškvietimų vietoj 550, o tai yra nuolaida, o ne pakilimas. Per tris minutes: iš kur atsirado frazė, kas iš tikrųjų kartojasi viduje „Dream-RSI“ ir kaip skaityti kitą straipsnį su RSI viršelyje. Tai yra „The Daily Diff“, kas po gaubtu. 1965 m. I. J. Goodas, Bletchley parko statistikas, dirbęs šalia Tiuringo, rašė, kad itin protinga mašina galėtų sukurti dar geresnes mašinas,

0:52 pavadino tai intelekto sprogimu ir paskutiniu išradimu, kurį žmogui kada nors reikės padaryti, su sąlyga, kad mašina bus pakankamai paklusni, kad pasakytų mums, kaip ją valdyti, o tai yra sąlyga, kurią žmonės nustoja skaityti po kablelio. Keturiasdešimt metų frazė reiškė būtent tai: sistema, kuri redaguoja savo šaltinį ar svorius ir kiekvienu praėjimu tampa protingesnė. Eliezerio Yudkowsky 2008 m. esė padarė ją pagrindiniu DI saugumo žodžiu, ir niekas neturėjo mašinos, kuria galėtų tai išbandyti, o tai yra ideali sąlyga apibrėžimui. Tada 2025 m. gegužę „DeepMind“ pristatė „AlphaEvolve“,

1:23 „Gemini“ agentą, kuris siūlo kodą, gauna įvertinimą, išsaugo nugalėtojus ir juos mutuoja vėl. Jis padaugino keturių iš keturių kompleksines matricas per 48 žingsnius, pagerindamas Strassen nustatytą rekordą 1969 m., ir atgauna apie nulį taškų septynių procentų „Google“ pasaulinio skaičiavimo, o tai „Google“ mastu yra duomenų centras, rastas po sofa. „Gemini“ dabar padėjo apmokyti „Gemini“, o frazė tyliai persikėlė iš saugumo tinklaraščių į pranešimus spaudai. „Dream-RSI“ ant šios kilpos uždeda valdiklį.

1:52 Politika, tikra Python programa, nusprendžia, kurias paieškos medžio šakas išplėsti, kiek lygiagrečiai, ir kada pasiduoti. „Gemini“ rašo kandidato kodą, o fiksuotas vertintojas jį įvertina. Kiekvienas paleidimas palieka medį to, kas buvo išbandyta ir kaip buvo įvertinta. Tas medis tampa atkūrimo simuliatoriumi: antras, lygiai taip pat užšaldytas „Gemini“ perrašo politiką, o nauja politika yra tikrinama pagal įrašytus rezultatus, o ne tikrose GPU.

2:16 Straipsnis tai vadina svajojimu, ir vienas realus paleidimas atsipirka tūkstančius išsvajotų be vykdymo išlaidų. Nugalėtojas vėl grįžta internetu, įrašytų pasaulių telkinys auga, kartoti. O priedo B.2 instrukcijoje raštu sakoma save tobulinančiam DI: redaguoti tik šį vieną failą ir nespręsti mokslinės užduoties. Išmatuota. Lasso sprendimo užduotyje, fiksuota paieška sunaudojo 550 „Gemini“ iškvietimų, kad pasiektų tris taškus šešias sekundes, „Dream-RSI“ sunaudojo 317, kad pasiektų du taškus devynias, ir abu aplenkė „scikit-learn“.

2:46 „KernelBench“ pasiekė tą patį branduolio greitį su maždaug du taškus keturis kartus mažiau generacijų. O apskritimų pakavime jis surinko du taškus šešis tris penkis devynis aštuonis tris, o tai tiksliai, iki šešių skaitmenų, ką „AlphaEvolve“ antroji versija surinko pernai. Taigi X perskaitė pavadinimą: „Google“ ką tik įvaldė rekursinį savęs tobulinimą. Hacker News perskaitė PDF: tai vadinti RSI atrodo klaidinančiai. Ir tą pačią savaitę konkurento vadovas pasakė, kad kilpa veikė nuo vasaros ir visi turėtų sulėtinti tempą.

3:13 Trys sakiniai, tie patys du žodžiai, trys skirtingos mašinos. Taigi, pirmadienį, kaip skaityti kitą RSI straipsnį. Pirma: paklauskite, koks objektas keičiasi – svoriai, kodas ar paieškos nustatymai; „Dream-RSI“ keičia trečiąjį. Antra: paklauskite, kas yra užšaldyta; čia tai – programuotojas, teisėjas ir perrašytojas, visi trys. Trečia: paklauskite, koks yra pagrindinis skaičius. Išsaugoti skaičiavimai yra optimizavimas; etalonas, kurio modelis anksčiau negalėjo pasiekti, yra pakilimas, ir niekas dar to nepaskelbė.

3:40 Verdiktas, kas po gaubtu: needs review. Kilpa yra tikra, sutaupymai išmatuoti, o du žodžiai viršelyje aprašo mašiną, kurios nėra straipsnyje. Jei norite tai perskaityti, o ne girdėti, kaip aš tai sakau, skirtumas kasdien atsiduria jūsų pašto dėžutėje kiekvieną rytą, nemokamai daily diff dot dev, nuoroda žemiau. Pasakykite man komentaruose, ką atidaryti toliau. Ir tai yra šiandienos skirtumas. Aš esu Niko iš Axrisi.

4:00 Sujunkite atsakingai.

Šaltiniai

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Susiję vaizdo įrašai