שיפור עצמי רקורסיבי, מתחת למכסה המנוע
גוגל DeepMind פרסמו את "Dream-RSI: שיפור עצמי רקורסיבי באמצעות עולמות מתפתחים" — ומודל הקידוד שבתוכו אינו משתנה לעולם.
גוגל DeepMind פרסמו את "Dream-RSI: שיפור עצמי רקורסיבי באמצעות עולמות מתפתחים" — ומודל הקידוד שבתוכו אינו משתנה לעולם. מתחת למכסה המנוע: מה פירוש הביטוי במשך 60 שנה, מה באמת מסתובב ב-Dream-RSI (מדיניות חקר בפייתון ש"חולמת" על עצי חיפוש מתועדים), ומדוע 317 קריאות לסוכן במקום 550 הן הנחה, לא המראה. פסק דין: NEEDS REVIEW.
קראו את המהדורה הכתובה (אנגלית) ↗
מה מכסה הסרטון הזה
- 1965 ← 2008: 'פיצוץ אינטליגנציה' של I. J. Good, בינה מלאכותית מקורית של יודקובסקי – מכונה שכותבת מחדש את משקולותיה שלה
- 2025: AlphaEvolve – כפל מטריצות 4×4 עם 48 כפולות, 0.7% ממחשוב גוגל שוחזר, ליבות Gemini מהירות יותר ב-23%
- 2026: Dream-RSI – המדיניות משתפרת, המקודד, השופט והכותב מחדש כולם קפואים; ההנחיה אומרת "אל תפתור את המשימה המדעית"
- X: "גוגל בדיוק פיצחה שיפור עצמי רקורסיבי" (819 לייקים) לעומת HN: "לקרוא לזה RSI נראה מטעה"
- מספרים ששימשו: §4.1 Lasso 550 ← 317 קריאות סוכן, 3587 ← 2931 אלפיות שנייה; טבלה 1 אריזת מעגלים 2.635983 = AlphaEvolveV2; §4.3 KernelBench פי 2.43 / פי 1.79 פחות דורות, עד פי 2.09 מהר יותר; נספח B.2 הנחיה (הכל מה-PDF לעיל)
תמליל מתורגם
תורגם מהקריינות המקורית באנגלית. זמינות אודיו וכתוביות נשלטת על ידי YouTube.
0:00 שיפור עצמי רקורסיבי הוא הרעיון שבינה מלאכותית הופכת את עצמה לחכמה יותר, ואז משתמשת בעצמי החכם יותר כדי לעשות זאת שוב, והשבוע גוגל פרסמה מאמר עם שתי המילים האלה בכותרת, שבו משקולות המודל לעולם לא זזות. שלושה מספרים. מנכ"ל Anthropic אומר שהלולאה הזו רצה מאז הקיץ, וזו הסיבה שלו להאט את כל התעשייה. הציוץ שהודיע שגוגל בדיוק פיצחה את זה אסף שמונה מאות לייקים ביום.
0:24 ותוצאת הכותרת של המאמר עצמו היא 317 קריאות מודל במקום 550, וזו הנחה, לא המראה. תוך שלוש דקות: מאיפה הגיע הביטוי, מה באמת מסתובב בפנים Dream-RSI, וכיצד לקרוא את המאמר הבא עם RSI על הכריכה. זהו The Daily Diff, מתחת למכסה המנוע. 1965. I. J. גוד, סטטיסטיקאי מבלטצ'לי פארק שעבד ליד טיורינג, כותב שמכונה אולטרה-אינטליגנטית יכולה לתכנן מכונות טובות יותר,
0:52 קורא לזה פיצוץ אינטליגנציה וההמצאה האחרונה שאדם יצטרך אי פעם ליצור, בתנאי שהמכונה תהיה צייתנית מספיק כדי לומר לנו איך לשלוט בה, וזה ה'בתנאי ש...' שאנשים מפסיקים לקרוא אחרי הפסיק. במשך ארבעים שנה הביטוי התכוון בדיוק לזה: מערכת שעורכת את שלה קוד מקור או משקולות ויוצאת חכמה יותר בכל מעבר. מאמרו של אליעזר יודקובסקי מ-2008 הפך אותו למילה הנושאת עומס של בינה מלאכותית בטיחות, ולאף אחד לא הייתה מכונה לבדוק עליה, וזהו התנאי האידיאלי עבור הגדרה. ואז במאי 2025 DeepMind השיקה את AlphaEvolve,
1:23 סוכן ג'מיני שמציע קוד, מקבל ציון, שומר את הזוכים ומשנה אותם שוב. הוא הכפיל מטריצות מורכבות ארבע על ארבע ב-48 שלבים, שבר שיא שנקבע על ידי שטרסן ב-1969, והוא מחזיר בערך אפס נקודה שבעה אחוזים מהמחשוב העולמי של גוגל, שבקנה מידה של גוגל הוא מרכז נתונים שנמצא מתחת לספה. ג'מיני עזרה כעת לאמן את ג'מיני, והביטוי עבר בשקט מבלוגי בטיחות להודעות לעיתונות. Dream-RSI מחברת בקר מעל הלולאה הזו.
1:52 מדיניות, תוכנית פייתון אמיתית, מחליטה אילו ענפים בעץ החיפוש להרחיב, כמה במקביל, ומתי לוותר. ג'מיני כותבת את הקוד המועמד, ומעריך קבוע מדרג אותו. כל ריצה משאירה אחריה עץ של מה נוסה ומה ציון. העץ הזה הופך לסימולטור השמעה חוזרת: ג'מיני שני, קפוא באותה מידה, כותב מחדש את המדיניות, והמדיניות החדשה נבדקת מול התוצאות המתועדות במקום על מעבדי GPU אמיתיים.
2:16 המאמר קורא לזה חלימה, וריצה אמיתית אחת משלמת עבור אלפי ריצות חלומיות בעלות ביצוע אפסית. הזוכה חוזר לרשת, מאגר העולמות המתועדים גדל, חוזר על עצמו. וההנחיה בנספח B.2 אומרת לבינה המלאכותית המשפרת את עצמה, בכתב: ערוך רק קובץ אחד זה, ואל תפתור את המשימה המדעית. נמדד. במשימת פותר Lasso, חיפוש קבוע השתמש ב-550 קריאות Gemini כדי להגיע לשלוש נקודה שש שניות, Dream-RSI השתמש ב-317 כדי להגיע לשתיים נקודה תשע, ושניהם ניצחו את scikit-learn.
2:46 ב-KernelBench הוא הגיע לאותה מהירות ליבה עם בערך פי שניים נקודה ארבע פחות דורות. ובאריזת מעגלים הוא קיבל ציון של שתיים נקודה שש שלוש חמש תשע שמונה שלוש, שזה בדיוק, לשש ספרות אחרי הנקודה, מה ש-AlphaEvolve גרסה שתיים קיבלה בשנה שעברה. אז X קרא את הכותרת: גוגל בדיוק פיצחה שיפור עצמי רקורסיבי. Hacker News קרא את ה-PDF: לקרוא לזה RSI נראה מטעה. ובאותו שבוע מנכ"ל של מתחרה אמר שהלולאה רצה מאז הקיץ וכולם צריכים להאט.
3:13 שלושה משפטים, אותן שתי מילים, שלוש מכונות שונות. אז, ביום שני, איך לקרוא את מאמר ה-RSI הבא. אחד: שאל איזה אובייקט משתנה, המשקולות, הקוד, או הגדרות החיפוש; Dream-RSI משנה את השלישי. שניים: שאל מי קפוא; כאן זה המקודד, השופט והכותב מחדש, כולם שלושתם. שלוש: שאל מהו יחידת המספר בכותרת. חישוב שנחסך הוא אופטימיזציה; מדד שהמודל לא יכול היה להגיע אליו לפני כן הוא ההמראה, ואף אחד עדיין לא פרסם את זה.
3:40 פסק דין, מתחת למכסה המנוע: NEEDS REVIEW. הלולאה אמיתית, החיסכון נמדד, ושתי המילים על הכריכה מתארות מכונה שאינה במאמר. אם אתה מעדיף לקרוא את זה מאשר לשמוע אותי אומר את זה, הדיף נוחת בתיבת הדואר הנכנס שלך בכל בוקר, חינם ב-thedailydiff.dev, קישור למטה. ספר לי מה לפתוח הלאה בתגובות. וזה הדיף להיום. אני ניקו מ-Axrisi.
4:00 מזג באחריות.
מקורות
- Paper: Dream-RSI (Zheng et al., Google / Google DeepMind / UMD / UVA, 14 Sep 2026)arxiv.org
- Code (293 stars, no license) — https://github.com/zhengkid/Dream-RSI · project pagedream-rsi.com
- Hacker News thread (169 points)news.ycombinator.com
- Hugging Face papers (278 upvotes)huggingface.co
- I. J. Good, 1965, "Speculations Concerning the First Ultraintelligent Machine"en.wikipedia.org
- Eliezer Yudkowsky, "Recursive Self-Improvement", LessWrong, 1 Dec 2008www.lesswrong.com
- Google DeepMind, AlphaEvolve (14 May 2025): 0.7% compute, 48 multiplications, 23% kernel speed-updeepmind.google
- Dario Amodei, "We Must Pace the Frontier" (12 Sep 2026)darioamodei.com
- Tweetx.com



