# การพัฒนาตนเองแบบเรียกซ้ำ, เบื้องหลัง

Published: 2026-09-18

Google DeepMind ตีพิมพ์ "Dream-RSI: การพัฒนาตนเองแบบเรียกซ้ำผ่านโลกที่กำลังพัฒนา" – และโมเดลการเขียนโค้ดภายในนั้นไม่เคยเปลี่ยนแปลง เบื้องหลัง: วลีนี้มีความหมายอย่างไรมา 60 ปี, อะไรคือสิ่งที่วนซ้ำจริง ๆ ใน Dream-RSI (นโยบายการสำรวจด้วย Python ที่ "ฝัน" เหนือต้นไม้ค้นหาที่บันทึกไว้) และเหตุใดการเรียกเอเจนต์ 317 ครั้งแทนที่จะเป็น 550 ครั้งจึงเป็นส่วนลด ไม่ใช่การพุ่งทะยาน คำตัดสิน: NEEDS REVIEW.

Canonical: https://thedailydiff.dev/th/video/2026-09-18-self-improving-ai/

## วิดีโอนี้ครอบคลุมอะไรบ้าง

- 1965 → 2008: "การระเบิดของสติปัญญา" ของ I. J. Good, AI เริ่มต้นของ Yudkowsky — เครื่องจักรที่เขียนน้ำหนักของตัวเองใหม่
- 2025: AlphaEvolve — การคูณเมทริกซ์ 4×4 48 ครั้ง, ฟื้นคืนการคำนวณของ Google ได้ 0.7%, Gemini kernels เร็วขึ้น 23%
- 2026: Dream-RSI — นโยบายดีขึ้น, ตัวเขียนโค้ด, ผู้ตัดสิน และผู้เขียนใหม่ทั้งหมดถูกตรึง; ข้อความแจ้งเตือนระบุว่า "ห้ามแก้ปัญหางานทางวิทยาศาสตร์"
- X: "Google เพิ่งประสบความสำเร็จในการพัฒนาตนเองแบบเรียกซ้ำ" (819 ไลค์) vs HN: "การเรียกสิ่งนี้ว่า RSI ดูเหมือนจะทำให้เข้าใจผิด"
- ตัวเลขที่ใช้: §4.1 Lasso 550 → 317 การเรียกเอเจนต์, 3587 → 2931 มิลลิวินาที; ตารางที่ 1 การจัดเรียงวงกลม 2.635983 = AlphaEvolveV2; §4.3 KernelBench จำนวนรุ่นน้อยลง 2.43× / 1.79×, เร็วขึ้นสูงสุด 2.09×; ภาคผนวก B.2 ข้อความแจ้งเตือน (ทั้งหมดจากไฟล์ PDF ด้านบน)

## บทถอดเสียงที่แปลแล้ว

แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube

0:00 การพัฒนาตนเองแบบเรียกซ้ำคือแนวคิดที่ AI ทำให้ตัวเองฉลาดขึ้น จากนั้นใช้ตัวเองที่ฉลาดขึ้นเพื่อทำเช่นนั้นอีกครั้ง และสัปดาห์นี้ Google ได้เผยแพร่ บทความที่มีสองคำนี้ในชื่อเรื่อง ซึ่งน้ำหนักของโมเดลไม่เคย เคลื่อนที่ ตัวเลขสามตัว CEO ของ Anthropic กล่าวว่าลูปนี้ทำงานมาตั้งแต่ฤดูร้อน ซึ่งเป็นเหตุผลที่เขาต้องการชะลออุตสาหกรรมทั้งหมดลง ทวีตที่ประกาศว่า Google เพิ่งแก้ไขปัญหานี้ได้รวบรวมไลค์แปดร้อยไลค์ ในหนึ่งวัน

0:24 และผลลัพธ์ที่เป็นหัวข้อข่าวของบทความเองคือการเรียกโมเดล 317 ครั้งแทนที่จะเป็น 550 ครั้ง ซึ่งเป็นส่วนลด ไม่ใช่การพุ่งทะยาน ในสามนาที: วลีนี้มาจากไหน, อะไรคือสิ่งที่วนซ้ำอยู่ภายใน Dream-RSI และวิธีอ่านบทความถัดไปที่มี RSI บนหน้าปก นี่คือ The Daily Diff, เบื้องหลัง 1965. I. J. Good นักสถิติจาก Bletchley Park ผู้ทำงานข้าง Turing เขียนว่าเครื่องจักรที่ฉลาดเป็นพิเศษสามารถออกแบบเครื่องจักรที่ดีกว่าได้

0:52 เรียกสิ่งนี้ว่าการระเบิดของสติปัญญาและสิ่งประดิษฐ์สุดท้ายที่มนุษย์จะต้องสร้าง โดยมีเงื่อนไขว่าเครื่องจักรนั้นเชื่องพอที่จะบอกวิธีควบคุมมัน ซึ่งเป็นประเด็นที่คนหยุดอ่านหลังจากเครื่องหมายจุลภาค สี่สิบปีที่ผ่านมาวลีนี้มีความหมายอย่างนั้นเลย: ระบบที่แก้ไขตัวเอง ซอร์สโค้ดหรือน้ำหนักและฉลาดขึ้นทุกครั้งที่ผ่าน บทความของ Eliezer Yudkowsky ในปี 2008 ทำให้มันเป็นคำหลักที่สำคัญของ AI ความปลอดภัย และไม่มีใครมีเครื่องจักรให้ทดสอบ ซึ่งเป็นเงื่อนไขที่เหมาะสมสำหรับ คำจำกัดความ จากนั้นในเดือนพฤษภาคม 2025 DeepMind ได้เปิดตัว AlphaEvolve

1:23 เอเจนต์ Gemini ที่เสนอโค้ด, ให้คะแนน, เก็บผู้ชนะและกลายพันธุ์ พวกมันอีกครั้ง มันคูณเมทริกซ์เชิงซ้อนสี่คูณสี่ใน 48 ขั้นตอน ทำลายสถิติที่ Strassen ตั้งไว้ในปี 1969 และมันฟื้นคืนได้ประมาณศูนย์ จุดเจ็ดเปอร์เซ็นต์ของการคำนวณทั่วโลกของ Google ซึ่งในขนาดของ Google คือ ศูนย์ข้อมูลที่พบใต้โซฟา ตอนนี้ Gemini กำลังช่วยฝึก Gemini และวลีนี้ก็ย้ายจากบล็อกด้านความปลอดภัย ไปสู่ข่าวประชาสัมพันธ์อย่างเงียบ ๆ Dream-RSI ยึดคอนโทรลเลอร์ไว้ด้านบนของลูปนั้น

1:52 นโยบาย โปรแกรม Python จริงๆ ตัดสินใจ ว่ากิ่งไหนของต้นไม้ค้นหาที่จะ ขยาย, มีกี่กิ่งขนานกัน, และเมื่อไหร่จะยอมแพ้ Gemini เขียนโค้ดผู้สมัคร และตัวประเมินผลที่กำหนดไว้จะให้คะแนน ทุกครั้งที่รันจะทิ้งต้นไม้ของสิ่งที่ถูกลองและคะแนนไว้ ต้นไม้นั้นกลายเป็นตัวจำลองการเล่นซ้ำ: Gemini ตัวที่สองที่ถูกตรึงเช่นกันจะเขียนใหม่ นโยบาย และนโยบายใหม่จะถูกทดสอบกับผลลัพธ์ที่บันทึกไว้แทน ที่จะทดสอบบน GPU จริง

2:16 บทความนี้เรียกว่าการฝัน และการรันจริงหนึ่งครั้งจะคุ้มค่ากับการฝันเป็นพันครั้ง โดยไม่มีค่าใช้จ่ายในการดำเนินการ ผู้ชนะกลับเข้าสู่ระบบ, กลุ่มโลกที่บันทึกไว้เติบโตขึ้น, ทำซ้ำ และคำสั่งในภาคผนวก B.2 บอก AI ที่พัฒนาตนเองได้ว่า เป็นลายลักษณ์อักษร: แก้ไขไฟล์นี้ไฟล์เดียวเท่านั้น และห้ามแก้ปัญหางานทางวิทยาศาสตร์ วัดผล ในงาน Lasso solver การสำรวจแบบคงที่ใช้การเรียก Gemini 550 ครั้งเพื่อ ถึงสามจุดหกวินาที Dream-RSI ใช้ 317 ครั้งเพื่อถึงสองจุดเก้า และทั้งคู่เอาชนะ scikit-learn ได้

2:46 บน KernelBench มันถึงความเร็วเคอร์เนลเดียวกันโดยใช้จำนวนรุ่นน้อยลงประมาณสองจุดสี่เท่า และในการจัดเรียงวงกลมมันได้คะแนนสองจุดหกสามห้าเก้า แปดสาม ซึ่งก็คือ exactly, ถึงทศนิยมหกตำแหน่ง, เหมือนกับที่ AlphaEvolve รุ่นสอง ทำคะแนนได้เมื่อปีที่แล้ว ดังนั้น X อ่านชื่อเรื่อง: Google เพิ่งประสบความสำเร็จในการพัฒนาตนเองแบบเรียกซ้ำ Hacker News อ่านไฟล์ PDF: การเรียกสิ่งนี้ว่า RSI ดูเหมือนจะทำให้เข้าใจผิด และในสัปดาห์เดียวกัน CEO ของคู่แข่งกล่าวว่าลูปนี้ทำงานมาตั้งแต่ฤดูร้อน และทุกคนควรชะลอตัวลง

3:13 สามประโยค สองคำเดียวกัน เครื่องจักรสามเครื่องที่แตกต่างกัน ดังนั้น วันจันทร์ จะอ่านบทความ RSI ถัดไปอย่างไร หนึ่ง: ถามว่าวัตถุใดเปลี่ยนไป, น้ำหนัก, โค้ด, หรือการตั้งค่าการค้นหา; Dream-RSI เปลี่ยนแปลงตัวที่สาม สอง: ถามว่าใครถูกตรึง; ที่นี่คือผู้เขียนโค้ด, ผู้ตัดสิน และผู้เขียนใหม่, ทั้งสาม สาม: ถามว่าตัวเลขที่เป็นหัวข้อข่าวเป็นหน่วยของอะไร การประหยัดการคำนวณคือการปรับปรุง; เกณฑ์มาตรฐานที่โมเดลไม่สามารถเข้าถึงได้ก่อนหน้านี้คือ การพุ่งทะยาน และยังไม่มีใครเผยแพร่สิ่งนั้น

3:40 คำตัดสิน, เบื้องหลัง: NEEDS REVIEW. ลูปเป็นของจริง, การประหยัดถูกวัดได้, และสองคำบนหน้าปก อธิบายเครื่องจักรที่ไม่ได้อยู่ในบทความ หากคุณต้องการอ่านสิ่งนี้มากกว่าฟังผมพูด, The Daily Diff จะส่งถึงกล่องจดหมายของคุณ ทุกเช้า, ฟรีที่ the daily diff dot dev, ลิงก์ด้านล่าง บอกผมว่าควรเปิดอะไรต่อไปในความคิดเห็น และนั่นคือ The Daily Diff สำหรับวันนี้ ผม Niko จาก Axrisi

4:00 รวมโค้ดอย่างรับผิดชอบ

## แหล่งที่มา

- [Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)](https://arxiv.org/abs/2609.14858) — arxiv.org
- [Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project page](https://dream-rsi.com/) — dream-rsi.com
- [Hacker News thread (169 points)](https://news.ycombinator.com/item?id=49726955) — news.ycombinator.com
- [Hugging Face papers (278 upvotes)](https://huggingface.co/papers/2609.14858) — huggingface.co
- [I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"](https://en.wikipedia.org/wiki/I._J._Good) — en.wikipedia.org
- [Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008](https://www.lesswrong.com/posts/JBadX7rwdcRFzGuju/recursive-self-improvement) — www.lesswrong.com
- [Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-up](https://deepmind.google/discover/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/) — deepmind.google
- [Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)](https://darioamodei.com/post/we-must-pace-the-frontier) — darioamodei.com
- [Tweet](https://x.com/thesupermannx/status/2100153430849499395) — x.com
