+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Auto-îmbunătățirea recursivă, sub capotă

Google DeepMind a publicat „Dream-RSI: Auto-îmbunătățire Recursivă prin Lumi în Evoluție” — iar modelul de codare din interior nu se schimbă niciodată.

Google DeepMind a publicat „Dream-RSI: Auto-îmbunătățire Recursivă prin Lumi în Evoluție” — iar modelul de codare din interior nu se schimbă niciodată. Sub capotă: ce a însemnat sintagma timp de 60 de ani, ce se află de fapt într-o buclă în Dream-RSI (o politică de explorare Python care „visează” peste arborii de căutare înregistrați) și de ce 317 apeluri de agent în loc de 550 este o reducere, nu o decolare. Verdict: NEEDS REVIEW.

Citiți ediția scrisă (engleză) ↗

Ce acoperă acest videoclip

  • 1965 → 2008: „explozia inteligenței” a lui I. J. Good, AI-ul seed al lui Yudkowsky — o mașină care își rescrie propriile ponderi
  • 2025: AlphaEvolve — înmulțire matrice 4×4 cu 48 de înmulțiri, 0,7% din puterea de calcul a Google recuperată, nucleele Gemini cu 23% mai rapide
  • 2026: Dream-RSI — politica se îmbunătățește, codorul, judecătorul și rescriitorul sunt toate înghețate; promptul spune „Nu rezolva sarcina științifică”
  • X: „Google tocmai a spart auto-îmbunătățirea recursivă” (819 aprecieri) vs HN: „a numi asta RSI pare înșelător”
  • Numere utilizate: §4.1 Lasso 550 → 317 apeluri de agent, 3587 → 2931 ms; Tabelul 1 împachetare cercuri 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× mai puține generații, până la 2.09× mai rapid; Anexa B.2 prompt (toate din PDF-ul de mai sus)

Transcrierea tradusă

Tradus din narațiunea originală în engleză. Audio-ul și subtitrările disponibile sunt controlate de YouTube.

0:00 Auto-îmbunătățirea recursivă este ideea că o inteligență artificială se face mai inteligentă, apoi folosește eul mai inteligent pentru a o face din nou, iar săptămâna aceasta Google a publicat o lucrare cu aceste două cuvinte în titlu, în care ponderile modelului nu se mișcă niciodată. Trei numere. CEO-ul Anthropic spune că această buclă a funcționat încă din vară, ceea ce este motivul său de a încetini întreaga industrie. Tweet-ul care anunța că Google tocmai a spart-o a adunat opt sute de aprecieri într-o zi.

0:24 Iar rezultatul principal al lucrării este de 317 apeluri de model în loc de 550, ceea ce este o reducere, nu o decolare. În trei minute: de unde a venit sintagma, ce se află de fapt într-o buclă în interiorul Dream-RSI și cum să citești următoarea lucrare cu RSI pe copertă. Acesta este The Daily Diff, sub capotă. 1965. I. J. Good, un statistician de la Bletchley Park care a lucrat alături de Turing, scrie că o mașină ultra-inteligentă ar putea proiecta mașini chiar mai bune,

0:52 o numește o explozie de inteligență și ultima invenție pe care omul ar trebui să o facă vreodată, cu condiția ca mașina să fie suficient de docilă pentru a ne spune cum să o controlăm, ceea ce este condiția pe care oamenii se opresc din citit după virgulă. Timp de patruzeci de ani, sintagma a însemnat exact asta: un sistem care își editează propriul cod sursă sau ponderi și devine mai inteligent la fiecare trecere. Eseul lui Eliezer Yudkowsky din 2008 a făcut-o cuvântul de bază al siguranței AI și nimeni nu avea o mașină pe care să o testeze, ceea ce este condiția ideală pentru o definiție. Apoi, în mai 2025, DeepMind a lansat AlphaEvolve,

1:23 un agent Gemini care propune cod, îl evaluează, păstrează câștigătorii și îi mută din nou. A înmulțit matrici complexe patru pe patru în 48 de pași, depășind un record stabilit de Strassen în 1969, și recuperează aproximativ zero virgulă șapte procente din puterea de calcul globală a Google, ceea ce, la scara Google, este un centru de date găsit sub canapea. Gemini ajuta acum la antrenarea Gemini, iar sintagma a trecut în liniște de la blogurile de siguranță la comunicatele de presă. Dream-RSI atașează un controler deasupra acelei bucle.

1:52 O politică, un program Python real, decide care ramuri ale arborelui de căutare să fie extinse, câte în paralel și când să renunțe. Gemini scrie codul candidat, iar un evaluator fix îl notează. Fiecare rulare lasă în urmă un arbore cu ce a fost încercat și ce scor a obținut. Acel arbore devine un simulator de redare: un al doilea Gemini, la fel de înghețat, rescrie politica, iar noua politică este testată împotriva rezultatelor înregistrate în loc să fie pe GPU-uri reale.

2:16 Lucrarea numește acest lucru visare, iar o rulare reală plătește pentru mii de rulări visate fără costuri de execuție. Câștigătorul revine online, grupul de lumi înregistrate crește, se repetă. Iar promptul din Anexa B.2 îi spune AI-ului care se auto-îmbunătățește, în scris: editează doar acest fișier și nu rezolva sarcina științifică. Măsurat. La sarcina rezolvitorului Lasso, explorarea fixă a petrecut 550 de apeluri Gemini pentru a atinge trei virgulă șase secunde, Dream-RSI a petrecut 317 pentru a atinge doi virgulă nouă, și ambele au depășit scikit-learn.

2:46 Pe KernelBench a atins aceeași viteză a nucleului cu aproximativ două virgulă patru ori mai puține generații. Și la împachetarea cercurilor a obținut scorul de doi virgulă șase trei cinci nouă opt trei, ceea ce este exact, la șase zecimale, scorul obținut de AlphaEvolve versiunea doi anul trecut. Deci X a citit titlul: Google tocmai a spart auto-îmbunătățirea recursivă. Hacker News a citit PDF-ul: a numi asta RSI pare înșelător. Și în aceeași săptămână, CEO-ul unui concurent a spus că bucla funcționează de vara trecută și că toată lumea ar trebui să încetinească.

3:13 Trei propoziții, aceleași două cuvinte, trei mașini diferite. Deci, luni, cum să citești următoarea lucrare RSI. Unu: întreabă ce obiect se schimbă, ponderile, codul sau setările de căutare; Dream-RSI schimbă al treilea. Doi: întreabă cine este înghețat; aici sunt codorul, judecătorul și rescriitorul, toți trei. Trei: întreabă ce reprezintă numărul principal ca unitate. Calculul economisit este optimizare; un reper pe care modelul nu l-a putut atinge înainte este decolarea, și nimeni nu a publicat încă asta.

3:40 Verdict, sub capotă: necesită revizuire. Bucla este reală, economiile sunt măsurate, iar cele două cuvinte de pe copertă descriu o mașină care nu este în lucrare. Dacă preferați să citiți asta decât să mă auziți spunând-o, diff-ul ajunge în căsuța dvs. de e-mail în fiecare dimineață, gratuit la thedailydiff dot dev, link mai jos. Spuneți-mi ce să deschid în continuare în comentarii. Și acesta este diff-ul pentru astăzi. Sunt Niko de la Axrisi.

4:00 Fuzionați responsabil.

Surse

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Videoclipuri similare