+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Давтагдсан өөрөө өөрийгөө сайжруулах нь, цаана юу байгаа вэ?

Google DeepMind "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" нэртэй өгүүлэл хэвлүүлсэн — үүнд код бичих загвар нь хэзээ ч өөрчлөгддөггүй.

Google DeepMind "Dream-RSI: Recursive Self-Improvement through Evolving Worlds" нэртэй өгүүлэл хэвлүүлсэн — үүнд код бичих загвар нь хэзээ ч өөрчлөгддөггүй. Цаана юу байгаа в2: энэ үг 60 жилийн турш юу гэсэн үг байв, Dream-RSI-д (бичигдсэн хайлтын модон дээр "мөрөөддөг" Python хайх бодлого) юу үнэхээр давтагддаг вэ, мөн яагаад 550 оронд 317 агентын дуудлага нь хөнгөлөлт болохоос биш, огцом өсөлт биш вэ. Дүгнэлт: ШИНЖЛЭХ ШААРДЛАГАТАЙ.

Бичмэл хувилбарыг унших (Англи) ↗

Энэ видео юуг хамардаг

  • 1965 → 2008: И. Ж. Гүүдийн "оюун ухааны тэсрэлт", Юдковскигийн анхдагч хиймэл оюун ухаан — өөрийн жингээ дахин бичдэг машин
  • 2025: AlphaEvolve — 48-н үржүүлэгтэй 4×4 матрицын үржүүлэг, Google-ийн тооцооллын 0.7% хэмнэгдсэн, Gemini кернел 23% хурдан
  • 2026: Dream-RSI — бодлого сайжирна, код бичигч, шүүгч, дахин бичигч бүгд хөлдсөн; тушаалд "Шинжлэх ухааны даалгаврыг бүү шийд" гэж бичсэн байна
  • X: "Google дөнгөж сая давтагдсан өөрөө өөрийгөө сайжруулалтыг шийдлээ" (819 таалагдсан) vs HN: "үүнийг RSI гэж нэрлэх нь төөрөгдүүлсэн мэт санагдаж байна"
  • Ашиглагдсан тоо: §4.1 Лассо 550 → 317 агентын дуудлага, 3587 → 2931 мс; Хүснэгт 1 тойргийн сав баглаа боодол 2.635983 = AlphaEvolveV2; §4.3 KernelBench 2.43× / 1.79× цөөн үе, 2.09× хүртэл хурдан; Хавсралт Б.2-ын тушаал (дээрх PDF-ээс)

Орчуулсан бичлэг

Англи хэл дээрх эх хувилбараас орчуулсан. Боломжтой дуу болон хадмал орчуулгыг YouTube хянадаг.

0:00 Давтагдсан өөрөө өөрийгөө сайжруулах нь хиймэл оюун ухаан өөрийгөө ухаалаг болгодог санаа юм, дараа нь ухаалаг өөрийгөө дахин ашиглан хийдэг, мөн энэ долоо хоногт Google гарчигт энэ хоёр үгийг агуулсан өгүүлэл хэвлүүлсэн, үүнд загварын жингүүд хэзээ ч хөдөлдөггүй. Гурван тоо. Anthropic-ийн гүйцэтгэх захирал энэ давталт зунаас хойш ажиллаж байна гэж хэлсэн, энэ нь түүний бүх салбарыг удаашруулах шалтгаан юм. Google дөнгөж сая үүнийг шийдлээ гэсэн жиргээ нэг өдрийн дотор найман зуун таалагдсан цуглуулжээ.

0:24 Мөн өгүүллийн өөрийнх нь гол үр дүн нь 550 оронд 317 загварын дуудлага юм, энэ нь хөнгөлөлт болохоос биш, огцом өсөлт биш юм. Гурван минутын дотор: энэ үг хаанаас гаралтай, Dream-RSI дотор юу үнэхээр давтагддаг мөн RSI-тэй дараагийн өгүүллийг хэрхэн унших талаар. Энэ бол The Daily Diff, дотор юу байгаа вэ. 1965 он. И. Ж. Гүүд, Тюрингтэй хамт ажиллаж байсан Блетчли Паркийн статистикч, хэт ухаалаг машин бүр илүү сайн машин зохион бүтээж чадна гэж бичсэн,

0:52 үүнийг оюун ухааны тэсрэлт болон хүн хэзээ нэгэн цагт хийх ёстой хамгийн сүүлийн нээлт гэж нэрлэсэн, хэрэв машин бидэнд үүнийг хэрхэн хянах талаар хэлэхэд хангалттай уян хатан байвал, энэ нь 'provided-that' хүмүүс таслалын дараа уншихаа больдог тэр хэсэг юм. Дөчин жилийн турш энэ үг яг ийм утгатай байсан: өөрийнхөө эх сурвалж эсвэл жинг засварлаж, алхам бүрт ухаалаг болдог систем. Элиезер Юдковскигийн 2008 оны эссе нь үүнийг хиймэл оюун ухааны аюулгүй байдлын гол үг болгосон, мөн хэн ч үүнийг турших машин байгаагүй, энэ нь тодорхойлолтын хувьд хамгийн тохиромжтой нөхцөл юм. Дараа нь 2025 оны 5-р сард DeepMind AlphaEvolve-ийг гаргасан,

1:23 энэ нь код санал болгож, үнэлэгдэж, ялагчдыг хадгалж, дахин хувиргадаг Gemini агент юм. Энэ нь дөрөв-дөрвөн комплекс матрицыг 48 алхамд үржүүлж, 1969 онд Страссены тогтоосон амжилтыг давсан, мөн Google-ийн дэлхий даяарх тооцооллын тэг цэгийн долоон хувийг нөхдөг, энэ нь Google-ийн хэмжээнд бол буйдан доороос олдсон мэдээллийн төв юм. Одоо Gemini нь Gemini-г сургахад тусалж байсан, мөн энэ үг аюулгүй байдлын блог хуудаснаас хэвлэлийн мэдээ рүү чимээгүйхэн шилжсэн. Dream-RSI нь тэр давталтын дээд талд хянагч суулгадаг.

1:52 Бодлого, жинхэнэ Python програм, хайх модны аль мөчрийг өргөжүүлэх, хэдэн ширхгийг зэрэгцээгээр, мөн хэзээ бууж өгөхөө шийддэг. Gemini нэр дэвшигчийн кодыг бичдэг, мөн тогтсон үнэлэгч үүнийг үнэлдэг. Гүйцэтгэл бүр юуг оролдсон болон юуг үнэлсэн тухай мод үлдээдэг. Тэр мод дахин тоглуулах симулятор болдог: хоёр дахь, адилхан хөлдсөн Gemini бодлогыг дахин бичдэг, мөн шинэ бодлогыг бодит GPU дээр биш харин бичигдсэн үр дүнгийн эсрэг туршдаг.

2:16 Өгүүлэл үүнийг мөрөөдөх гэж нэрлэдэг, мөн нэг бодит гүйцэтгэл нь мянга мянган мөрөөдсөн гүйцэтгэлийг тэг гүйцэтгэлийн өртгөөр төлдөг. Ялагч дахин онлайн болдог, бичигдсэн ертөнцүүдийн цуглуулга өсдөг, давтана. Мөн Хавсралт Б.2-ын тушаал өөрийгөө сайжруулагч хиймэл оюун ухаанд бичгээр: зөвхөн энэ файлыг засаж, шинжлэх ухааны даалгаврыг бүү шийд гэж хэлдэг. Хэмжсэн. Лассо шийдвэрлэх даалгавар дээр, тогтсон хайгуул 550 Gemini дуудлага ашиглан гурван цэг зургаан секундэд хүрсэн, Dream-RSI 317 дуудлага ашиглан хоёр цэг есөн секундэд хүрсэн, мөн хоёулаа scikit-learn-ийг давсан.

2:46 KernelBench дээр ижил кернел хурданд хоёр цэг дөрөв дахин цөөн үеэр хүрсэн. Мөн тойргийн сав баглаа боодол дээр хоёр цэг зургаа гурав тав ес найм гурав гэсэн оноо авсан, энэ нь яг, зургаан аравтын орноор, AlphaEvolve хоёрдугаар хувилбар өнгөрсөн жил авсан оноотой ижил. Тэгээд X гарчгийг уншсан: Google дөнгөж сая давтагдсан өөрөө өөрийгөө сайжруулалтыг шийдлээ. Hacker News PDF-ийг уншсан: үүнийг RSI гэж нэрлэх нь төөрөгдүүлсэн мэт санагдаж байна. Мөн тэр долоо хоногт өрсөлдөгчийн гүйцэтгэх захирал давталт зунаас хойш ажиллаж байна мөн бүх хүн удаашрах ёстой гэж хэлсэн.

3:13 Гурван өгүүлбэр, ижил хоёр үг, гурван өөр машин. Тэгэхээр, Даваа гарагт, дараагийн RSI өгүүллийг хэрхэн унших вэ. Нэг: юу өөрчлөгддөг вэ гэж асуух, жин, код, эсвэл хайлтын тохиргоо; Dream-RSI гурав дахьийг өөрчилдөг. Хоёр: хэн хөлдсөн байна вэ гэж асуух; энд бол код бичигч, шүүгч, дахин бичигч, бүгд гурвуулаа. Гурав: гарчгийн тоо юуны нэгж вэ гэж асуух. Хэмнэсэн тооцоолол нь оновчлол; загвар урьд өмнө хүрч чадаагүй жишиг нь огцом өсөлт юм, мөн хэн ч үүнийг хараахан нийтлээгүй байна.

3:40 Дүгнэлт, цаана юу байгаа вэ: шинжлэх шаардлагатай. Давталт бодит, хэмнэлтүүд хэмжигдсэн, мөн нүүрэн дээрх хоёр үг өгүүлэлд байхгүй машиныг тодорхойлдог. Хэрэв та үүнийг сонсохоос илүү уншихыг хүсвэл, The Daily Diff таны имэйл хайрцагт өглөө бүр үнэгүй ирдэг, daily diff dot dev хаягаар, холбоос доор байна. Дараа нь юуг нээхийг хүсэж байгаагаа сэтгэгдэл хэсэгт бичээрэй. Мөн энэ бол өнөөдрийн The Daily Diff. Би Axrisi-гийн Нико байна.

4:00 Хариуцлагатай нэгтгээрэй.

Эх сурвалжууд

  1. Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
  2. Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
  3. Hacker News thread (169 points)news.ycombinator.com
  4. Hugging Face papers (278 upvotes)huggingface.co
  5. I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
  6. Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
  7. Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
  8. Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
  9. Tweetx.com

Холбогдох видеонууд

under-the-hood · mn · 2026 оны 9-р сарын 24

SAML, дотоод хэсэгт: захидал доторх гарын үсэг

SAML нь таныг бараг бүх ажлын аппликейшнд нэвтрүүлдэг бөгөөд түүний гарын үсэг нь гарын үсэг зурсан XML дотор байрладаг. Дотоод хэсэгт: апп, хөтөч болон танилт олгогч хоорондын нэвтрэх үйлдэл, нотолго

3:02 ↗