+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Rekurzivno samoizboljšanje, pod pokrovom

Google DeepMind je objavil "Dream-RSI: Rekurzivno samoizboljšanje skozi razvijajoče se svetove" — in kodirni model znotraj njega se nikoli ne spremeni.

Google DeepMind je objavil "Dream-RSI: Rekurzivno samoizboljšanje skozi razvijajoče se svetove" — in kodirni model znotraj njega se nikoli ne spremeni. Pod pokrovom: kaj je fraza pomenila 60 let, kaj se dejansko ponavlja v Dream-RSI (politika raziskovanja v Pythonu, ki "sanja" nad posnetimi iskalnimi drevesi) in zakaj je 317 klicov agenta namesto 550 popust, ne pa vzlet. Sodba: NEEDS REVIEW.

Preberi pisno izdajo (angleščina) ↗

Kaj zajema ta videoposnetek

  • 1965 → 2008: I. J. Goodova "eksplozija inteligence", Yudkowskyjev seed AI – stroj, ki prepisuje lastne uteži
  • 2025: AlphaEvolve – 48-kratno 4×4 matrično množenje, 0,7 % Googlove računske moči je povrnjene, Gemini jedra 23 % hitrejša
  • 2026: Dream-RSI – politika se izboljšuje, koder, sodnik in prepisovalec so vsi zamrznjeni; poziv pravi "Ne rešuj znanstvene naloge"
  • X: "Google je pravkar razrešil rekurzivno samoizboljšanje" (819 všečkov) proti HN: "klicanje tega RSI se zdi zavajajoče"
  • Uporabljene številke: §4.1 Lasso 550 → 317 klicev agenta, 3587 → 2931 ms; Tabela 1 pakiranje krogov 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× manj generacij, do 2.09× hitreje; Dodatek B.2 poziv (vse iz zgornjega PDF-ja)

Preveden prepis

Prevedeno iz izvirnega angleškega pripovedovanja. Razpoložljivi zvok in podnapisi so nadzorovani s strani YouTuba.

0:00 Rekurzivno samoizboljšanje je ideja, da se umetna inteligenca sama izboljšuje, nato pa uporabi to izboljšano sebe, da to ponovi, in ta teden je Google objavil članek z dvema besedama v naslovu, v katerem se uteži modela nikoli ne premike. Tri številke. Izvršni direktor podjetja Anthropic pravi, da ta zanka teče od poletja, kar je njegov razlog za upočasnitev celotne industrije. Tweet, ki je napovedal, da je Google to pravkar razrešil, je zbral osemsto všečkov v enem dnevu.

0:24 In lastni glavni rezultat članka je 317 klicev modela namesto 550, kar je popust, ne pa vzlet. V treh minutah: od kod izvira fraza, kaj se dejansko ponavlja v Dream-RSI in kako brati naslednji članek z RSI na naslovnici. To je The Daily Diff, pod pokrovom. 1965. I. J. Good, statistik iz Bletchley Parka, ki je delal poleg Turinga, piše, da bi ultrainteligentni stroj lahko zasnoval še boljše stroje,

0:52 to imenuje eksplozija inteligence in zadnji izum, ki ga bo človek kdaj potreboval, pod pogojem, da je stroj dovolj poslušen, da nam pove, kako ga nadzorovati, kar je tisto, kar ljudje prenehajo brati po vejici. Štirideset let je fraza pomenila ravno to: sistem, ki ureja lasten vir ali uteži in postane pametnejši z vsakim prehodom. Eliezer Yudkowskyjev esej iz leta 2008 jo je postavil za nosilno besedo varnosti umetne inteligence in nihče ni imel stroja, na katerem bi jo preizkusil, kar je idealen pogoj za definicijo. Nato je maja 2025 DeepMind izdal AlphaEvolve,

1:23 agenta Gemini, ki predlaga kodo, jo oceni, ohrani zmagovalce in jih ponovno mutira. Množil je štirikrat štiri kompleksne matrike v 48 korakih, podrl rekord, ki ga je Strassen postavil leta 1969, in povrne približno nič cela sedem odstotkov Googlove svetovne računske moči, kar je na Googlovi lestvici podatkovni center, najden pod kavčem. Gemini je zdaj pomagal uriti Gemini, in fraza se je tiho premaknila iz varnostnih blogov v sporočila za javnost. Dream-RSI nad to zanko nadgradi krmilnik.

1:52 Politika, dejanski program v Pythonu, se odloči, katere veje iskalnega drevesa bo razširil, koliko vzporedno in kdaj bo obupal. Gemini napiše kandidatno kodo, in fiksni ocenjevalec jo oceni. Vsak zagon pusti za seboj drevo, kaj je bilo poskušeno in kaj je bilo ocenjeno. To drevo postane simulator ponovnega predvajanja: drugi, prav tako zamrznjeni Gemini, prepiše politiko, in nova politika se preizkusi proti posnetim rezultatom namesto na resničnih GPU-jih.

2:16 Članek to imenuje sanjanje, in en resnični zagon plača za tisoče sanjanih brez stroškov izvedbe. Zmagovalec se vrne na splet, bazen posnetih svetov raste, ponovitev. In poziv v Dodatku B.2 pove samoizboljševalni umetni inteligenci, v pisni obliki: urejajte samo to datoteko in ne rešujte znanstvene naloge. Izmerjeno. Pri nalogi reševanja Lasso je fiksno raziskovanje porabilo 550 klicev Gemini, da je doseglo tri cele šest sekund, Dream-RSI pa 317, da je dosegel dve celi devet, in oba sta presegla scikit-learn.

2:46 Na KernelBench je dosegel enako hitrost jedra z približno dvakrat in štirikrat manj generacij. In pri pakiranju krogov je dosegel rezultat dve celi šest tri pet devet osem tri, kar je natančno, na šest decimalk, kar je AlphaEvolve različica dva dosegel lani. Tako je X prebral naslov: Google je pravkar razrešil rekurzivno samoizboljšanje. Hacker News je prebral PDF: klicanje tega RSI se zdi zavajajoče. In isti teden je izvršni direktor konkurenta dejal, da zanka teče od poletja in da bi se morali vsi upočasniti.

3:13 Trije stavki, isti dve besedi, trije različni stroji. Torej, ponedeljek, kako brati naslednji članek o RSI. Ena: vprašajte, kateri objekt se spreminja, uteži, koda ali nastavitve iskanja; Dream-RSI spreminja tretjega. Dve: vprašajte, kdo je zamrznjen; tukaj so to koder, sodnik in prepisovalec, vsi trije. Tri: vprašajte, kaj je enota naslovne številke. Prihranjena računska moč je optimizacija; merilo, ki ga model prej ni mogel doseči, je vzlet, in nihče ga še ni objavil.

3:40 Sodba, pod pokrovom: needs review. Zanka je resnična, prihranki so izmerjeni in dve besedi na naslovnici opisujeta stroj, ki ga v članku ni. Če bi raje prebrali to, kot da bi me slišali govoriti, se razlika prikaže v vašem nabiralniku vsako jutro, brezplačno na the daily diff dot dev, povezava spodaj. Povejte mi, kaj naj naslednje odprem v komentarjih. In to je razlika za danes. Sem Niko iz Axrisi.

4:00 Spojite odgovorno.

Viri

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Povezani videoposnetki