+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Recursive self-improvement, sa ilalim ng talukbong

Inilathala ng Google DeepMind ang "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — at ang coding model sa loob nito ay hindi nagbabago.

Inilathala ng Google DeepMind ang "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" — at ang coding model sa loob nito ay hindi nagbabago. Sa ilalim ng talukbong: kung ano ang ibig sabihin ng parirala sa loob ng 60 taon, kung ano ang aktwal na umuulit sa Dream-RSI (isang patakaran sa paggalugad ng Python na "nangangarap" sa mga naitalang search tree), at kung bakit ang 317 agent call sa halip na 550 ay isang diskwento, hindi isang paglarga. Pasya: NEEDS REVIEW.

Basahin ang nakasulat na edisyon (English) ↗

Ang sakop ng video na ito

  • 1965 → 2008: Ang "intelligence explosion" ni I. J. Good, ang seed AI ni Yudkowsky — isang makina na nagsusulat muli ng sarili nitong mga bigat
  • 2025: AlphaEvolve — 48-multiplication 4×4 matrix multiply, 0.7% ng compute ng Google ay nabawi, ang mga Gemini kernel ay 23% mas mabilis
  • 2026: Dream-RSI — ang patakaran ay bumuti, ang coder, hukom at tagasulat ay lahat ay frozen; ang prompt ay nagsasabing "Huwag lutasin ang gawaing siyentipiko"
  • X: "Na-crack lang ng Google ang recursive self-improvement" (819 likes) vs HN: "tila nakaliligaw ang pagtawag dito ng RSI"
  • Mga numerong ginamit: §4.1 Lasso 550 → 317 agent call, 3587 → 2931 ms; Table 1 circle packing 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× mas kaunting henerasyon, hanggang 2.09× mas mabilis; Appendix B.2 prompt (lahat mula sa PDF sa itaas)

Isinaling transcript

Isinalin mula sa orihinal na salaysay sa English. Ang available na audio at mga caption ay kinokontrol ng YouTube.

0:00 Ang recursive self-improvement ay ang ideya na pinapatalino ng isang AI ang sarili nito, pagkatapos ay ginagamit ang mas matalinong sarili upang gawin itong muli, at ngayong linggo ay naglathala ang Google ng isang papel na may dalawang salitang iyon sa pamagat, kung saan ang mga bigat ng modelo ay hindi kailanman gumagalaw. Tatlong numero. Sinasabi ng CEO ng Anthropic na ang loop na ito ay tumatakbo mula pa noong tag-araw, na siyang dahilan niya upang pabagalin ang buong industriya. Ang tweet na nagpahayag na na-crack lang ito ng Google ay nakakuha ng walong daang likes sa isang araw.

0:24 At ang pangunahing resulta ng sariling papel ay 317 model call sa halip na 550, na isang diskwento, hindi isang paglarga. Sa tatlong minuto: kung saan nagmula ang parirala, kung ano ang aktwal na umuulit sa loob ng Dream-RSI, at kung paano basahin ang susunod na papel na may RSI sa pabalat. Ito ang The Daily Diff, sa ilalim ng talukbong. 1965. I. J. Good, isang statistician ng Bletchley Park na katrabaho ni Turing, sumusulat na ang isang ultraintelligent machine ay maaaring magdisenyo ng mas mahusay na mga makina,

0:52 tinatawag itong intelligence explosion at ang huling imbensyon na kailangan pang gawin ng tao, sa kondisyon na ang makina ay sapat na docile upang sabihin sa atin kung paano ito kontrolin, na siyang ibinigay-na binabasa ng mga tao pagkatapos ng kuwit. Sa loob ng apatnapung taon ang parirala ay nangangahulugang eksakto iyon: isang sistema na nag-e-edit ng sarili nitong source o mga bigat at lumalabas na mas matalino sa bawat pagdaan. Ang sanaysay ni Eliezer Yudkowsky noong 2008 ang nagpagawa dito ng load-bearing na salita ng AI kaligtasan, at walang sinuman ang may makina upang subukan ito, na siyang ideal na kondisyon para sa isang depinisyon. Pagkatapos noong Mayo 2025 ay nagpadala ang DeepMind ng AlphaEvolve,

1:23 isang ahente ng Gemini na nagmumungkahi ng code, pinapuntos ito, pinapanatili ang mga nanalo at pinagmumuta sila muli. Nag-multiply ito ng four-by-four complex matrices sa 48 na hakbang, tinalo ang record ni Strassen noong 1969, at nakakabawi ito ng humigit-kumulang zero point seven percent ng worldwide compute ng Google, na sa scale ng Google ay isang data center na natagpuan sa ilalim ng sofa. Tinutulungan na ngayon ng Gemini ang pagsasanay sa Gemini, at ang parirala ay tahimik na lumipat mula sa safety blogs patungo sa mga press release. Ang Dream-RSI ay naglalagay ng controller sa ibabaw ng loop na iyon.

1:52 Isang patakaran, isang aktwal na programa ng Python, ang nagpapasya kung aling mga sangay ng search tree ang palawakin, ilan ang kahanay, at kung kailan susuko. Isinusulat ng Gemini ang kandidatong code, at isang nakapirming evaluator ang nagbibigay ng puntos dito. Bawat run ay nag-iiwan ng puno ng kung ano ang sinubukan at kung ano ang iskor nito. Ang punong iyon ay nagiging replay simulator: isang pangalawa, pantay na frozen na Gemini ang muling sumusulat sa patakaran, at ang bagong patakaran ay sinusuri laban sa mga naitalang kinalabasan sa halip na sa mga totoong GPU.

2:16 Tinatawag ito ng papel na dreaming, at isang totoong run ang nagbabayad para sa libu-libong pinangarap nang walang gastos sa pagpapatupad. Ang nanalo ay bumabalik online, lumalaki ang pool ng mga naitalang mundo, ulit. At ang prompt sa Appendix B.2 ay nagsasabi sa self-improving AI, sa sulat: i-edit lang ang isang file na ito, at huwag lutasin ang gawaing siyentipiko. Sinukat. Sa gawain ng Lasso solver, ang nakapirming paggalugad ay gumamit ng 550 Gemini call upang maabot ang tatlong punto anim na segundo, ang Dream-RSI ay gumamit ng 317 upang maabot ang dalawang punto siyam, at pareho silang tinalo ang scikit-learn.

2:46 Sa KernelBench naabot nito ang parehong bilis ng kernel na may humigit-kumulang dalawang punto apat na beses mas kaunting henerasyon. At sa circle packing nakakuha ito ng dalawang punto anim tatlo lima siyam walo tatlo, na siyang eksakto, hanggang anim na decimal, ang nakuha ng AlphaEvolve bersyon dalawa noong nakaraang taon. Kaya binasa ng X ang pamagat: Na-crack lang ng Google ang recursive self-improvement. Binasa ng Hacker News ang PDF: tila nakaliligaw ang pagtawag dito ng RSI. At sa parehong linggo sinabi ng CEO ng isang kakumpitensya na ang loop ay tumatakbo mula pa noong tag-araw at dapat bumagal ang lahat.

3:13 Tatlong pangungusap, ang parehong dalawang salita, tatlong magkakaibang makina. Kaya, Lunes, kung paano basahin ang susunod na RSI paper. Isa: tanungin kung anong object ang nagbabago, ang mga bigat, ang code, o ang mga setting ng paghahanap; Binabago ng Dream-RSI ang ikatlo. Dalawa: tanungin kung sino ang frozen; dito ay ang coder, ang hukom at ang tagasulat, lahat ng tatlo. Tatlo: tanungin kung anong yunit ang pangunahing numero. Ang compute na na-save ay optimisasyon; isang benchmark na hindi maabot ng modelo noon ay ang paglarga, at wala pang naglathala niyan.

3:40 Pasya, sa ilalim ng talukbong: kailangan ng pagsusuri. Ang loop ay totoo, ang mga pagtitipid ay nasusukat, at ang dalawang salita sa pabalat ay naglalarawan ng isang makina na wala sa papel. Kung mas gusto mong basahin ito kaysa pakinggan akong sabihin ito, ang diff ay dumarating sa iyong inbox tuwing umaga, libre sa the daily diff dot dev, link sa ibaba. Sabihin sa akin kung ano ang susunod na bubuksan sa mga komento. At iyon ang diff para sa araw na ito. Ako si Niko mula sa Axrisi.

4:00 Pagsamahin nang responsable.

Mga Pinagmulan

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Mga kaugnay na video