# כיצד לזהות החלשה של Claude (עם נתונים אמיתיים)

Published: 2026-09-30

אנשים אומרים ש-Claude נהיה טיפש יותר כמה שבועות אחרי כל השקה. מפתח אחד הפעיל את Claude Opus 5.5 למשך 30 יום משבוע ההשקה, עם שאלות קפואות, קוד Claude מוצמד וכללים ציבוריים, וזה מראה מדוע אף אחד לא יכול היה לדעת קודם, ומדוע ספירת הטוקנים שלך היא הדבר שיש לשים לב אליו. פסק דין: SHIP IT.

Canonical: https://thedailydiff.dev/he/video/2026-09-30-opus-nerf-meter/

## מה מכסה הסרטון הזה

- Claude נהיה טיפש יותר לאחר ההשקה: התיאוריה פוגשת שעון יום אפס
- livenerf: שעון 30 יום על Opus 5.5 משבוע ההשקה
- איך לתפוס החלשה: 78 שאלות שלפעמים נכונות
- מה הוא יכול לראות: 7.5 נקודות, וספירת הטוקנים זזה קודם
- הנקודה העיוורת: החלפת Opus 5 ו-8 מפתחות תשובה שגויים

## פרקים

- 0:00 Claude נהיה טיפש יותר לאחר ההשקה: התיאוריה פוגשת שעון יום אפס
- 0:26 livenerf: שעון 30 יום על Opus 5.5 משבוע ההשקה
- 1:24 איך לתפוס החלשה: 78 שאלות שלפעמים נכונות
- 2:19 מה הוא יכול לראות: 7.5 נקודות, וספירת הטוקנים זזה קודם
- 2:53 הנקודה העיוורת: החלפת Opus 5 ו-8 מפתחות תשובה שגויים
- 3:08 Anthropic: אנחנו אף פעם לא מפחיתים את איכות המודל
- 3:45 מרכזי נתונים שומרים את המספרים שלהם בסוד; Backblaze מפרסמת
- 4:25 שורת הקרדיטים: Claude עזר לבנות את המונה
- 4:50 פסק דין: SHIP IT, ואל תצטטו אותו לפני 24 באוקטובר

## תמליל מתורגם

תורגם מהקריינות המקורית באנגלית. זמינות אודיו וכתוביות נשלטת על ידי YouTube.

### Claude נהיה טיפש יותר לאחר ההשקה: התיאוריה פוגשת שעון יום אפס

0:00 כולם יודעים ש-Claude נהיה טיפש יותר כמה שבועות אחרי ההשקה. אז מפתח אחד הפעיל את Opus 5.5 על שעון משבוע ההשקה, והשעון אומר שאף אחד לא יכול היה לדעת עדיין. בסרטון הזה, שלוש שאלות. איך תופסים החלשה? מה המונה הזה יכול לראות? ומה Anthropic אומרת? ושורה אחת בקרדיטים של הריפו גרמה לי לצחוק בקול רם.

0:20 אגיע לזה בסוף. היום יום רביעי, 30 בספטמבר, וזה The Daily Diff. שלושה סיפורים היום, והגדול שבהם הוא ריפו ב-GitHub בשם live nerf.

### livenerf: שעון 30 יום על Opus 5.5 משבוע ההשקה

0:30 במשך חודשים, אנשים אמרו ש-Anthropic מחלישה בשקט את המודלים שלה לאחר ההשקה. התיאוריות הרגילות הן מודל דחוס, מודל קטן יותר תחת אותו שם או פשוט פחות מחשבה. הריפו מכנה כל טענה עד כה 'וייבים מול וייבים'. Opus 5.5 הושק ב-22 בספטמבר, ולפני שבוע אמרתי לכם שהוא עמד בראש הלוח העצמאי תוך כדי כתיבת פי שלושה יותר מילים מהמודל הממוצע. לאחר יומיים וחצי, מפתח בשם ninja hawk הפעיל את השעון,

0:59 פעם ביום למשך שלושים יום, עם יומנים שאף אחד לא יכול לערוך. השרשור ב-Hacker News הגיע לכמעט שמונה מאות נקודות והתפצל כמו צ'אט קבוצתי. אחד המגיבים אומר שהחלשת מודלים אינה אמיתית ברוב המכריע של המקרים המדווחים. אחר אומר שאנשים פשוט מתרגלים לרמת האינטליגנציה החדשה. ומשתמש כוח אחד ב-Claude Code כעת מבטל את הקופץ 'דרג את ההפעלה הזו' בכל פעם, מכיוון שדירוג Claude נראה שהרע אותו. ביקורת עמיתים. אז, שאלה ראשונה, איך תופסים החלשה?

### איך לתפוס החלשה: 78 שאלות שלפעמים נכונות

1:27 אתה מתחיל עם כ-2,300 שאלות בחינה קשות, ו-Opus מקבל 93 אחוז נכון בניסיון הראשון, שזה חסר תועלת לגלאי, מכיוון ששאלה שתמיד נכונה לא יכולה לרדת. 97 אחוז היו תמיד נכונות או תמיד שגויות, וה-78 שלפעמים רק נכונות הפכו לצוות הבדיקה. אותה הנחיה, ללא כלים, ובדיקה מדויקת ללא שופט בינה מלאכותית, מכיוון שגם השופט היה סוטה. זה רץ על מנוי מקס באמצעות Claude Code ללא ממשק גרפי (headless),

1:55 מכיוון שגרסת ה-API תומחרה בכ-1,600 דולר לחודש. וגרסת Claude Code מוצמדת, מכיוון, במילות הריפו, רתימה ששונתה נראית בדיוק כמו מודל ששונה. הסטטיסטיקות מגיעות ממאמר בשם Adding Error Bars to Evals, מאת אוון מילר מ-Anthropic. אז המתמטיקה של Anthropic עצמה בודקת כעת את Anthropic, שזו הגרסה האקדמית של ציטוט תנאי השירות בחזרה לתמיכת הלקוחות.

### מה הוא יכול לראות: 7.5 נקודות, וספירת הטוקנים זזה קודם

2:19 שאלה שנייה, מה הוא יכול לראות? בחלון של עשרה ימים, ירידה של כ-7.5 נקודות. כדי להוכיח שהמערכת עובדת, המחבר הוריד בכוונה את מאמץ Claude. מאמץ בינוני קיצץ את התפוקה בכרבע, ואת הציון בארבע נקודות בלבד. מאמץ נמוך קיצץ את התפוקה בכמעט שני שלישים, לשמונה נקודות. זה החלק שצריך לגנוב. פחות חשיבה מופיעה בספירת הטוקנים לפני שהיא מופיעה בתשובות.

2:43 אז הצמידו את גרסת המודל שלכם, רשמו טוקני פלט לכל משימה, ושמרו כמה שאלות קפואות משלכם. אם הסוכן שלכם פתאום כותב קצר יותר, בדקו את היומנים שלכם לפני שאתם בודקים ב-Reddit. והנה החלק הכנה.

### הנקודה העיוורת: החלפת Opus 5 ו-8 מפתחות תשובה שגויים

2:54 החלפה שקטה של Opus 5 הישן הייתה שינוי קטן מדי כדי שהמערכת תוכל לזהות, והקובץ readme אומר זאת מראש. הבדיקה גם מצאה שמונה מפתחות תשובה שנראים שגויים, אז גלאי ההחלשה מצא באגים במבחן הביצועים לפני שמצא החלשה.

### Anthropic: אנחנו אף פעם לא מפחיתים את איכות המודל

3:08 שאלה שלישית, מה Anthropic אומרת? בשנה שעברה, לאחר גל של תלונות, Anthropic פרסמה דו"ח לאחר אירוע (postmortem). הוא אומר, ציטוט: אנחנו אף פעם לא מפחיתים את איכות המודל עקב ביקוש, שעת היום או עומס שרתים. אותו פוסט מודה ששלושה באגים פגעו ב-Claude, וכמעט שליש מ- משתמשי Claude Code פגעו בשרתים הלא נכונים לפחות פעם אחת. אז התלונות היו אמיתיות והסיבה הייתה באגים, זו הסיבה שהריפו מזהיר ששבוע ההשקה יכול להיות השבוע הגרוע ביותר.

3:35 שישה מתוך שלושים ימים עברו. הקריאה האפשרית הראשונה נוחתת בסביבות 24 באוקטובר, אז התשובה הכנה היא שאף אחד לא יודע, כולל כל מי שהיה בטוח. מדבר על מספרים שאף אחד לא מפרסם.

### מרכזי נתונים שומרים את המספרים שלהם בסוד; Backblaze מפרסמת

3:46 Lighthouse Reports והעיתון ההולנדי Trouw מצאו כי הרוב המכריע של מרכזי הנתונים האירופיים שומרים על צריכת החשמל והמים שלהם בסוד, למרות שכלל איחוד אירופאי חייב דיווח במשך שלוש שנים. בהולנד, פחות מרבע מפרסמים. מרכז נתונים אחד של מיקרוסופט לבדו משתמש בכאחוז אחד מהחשמל ההולנדי. בינתיים, Backblaze עשתה שוב את הדבר המשעמם. סטטיסטיקות הכוננים הרבעוניות שלה מכסות כשלוש מאות חמישים אלף כוננים קשיחים, ושיעור הכשלים עלה לאחוז נקודה שבעה שלושה,

4:16 הגבוה ביותר מזה זמן מה. שלושה דגמי Seagate לא נכשלו כלל. כך נראית נקודת ייחוס ציבורית, רבעון אחר רבעון, במשך שלוש עשרה שנה.

### שורת הקרדיטים: Claude עזר לבנות את המונה

4:25 עכשיו, שורת הקרדיטים הזו. הקובץ readme מודה שחלק גדול מהריפו נכתב בעזרת Claude, שזה המודל הנמדד. אז Claude עזר לבנות את המונה שבודק אם Claude נהיה טיפש יותר. זו הסיבה שהבודקים הם פונקציות פשוטות. במילות המחבר, 'אתה לא אמור לסמוך על המחבר,' אנושי או אחרת. אם אתם מעדיפים לקרוא את זה מאשר לשמוע אותי אומר את זה, הדיף נוחת בתיבת הדואר הנכנס

4:46 שלכם כל בוקר, בחינם ב-thedailydiff.dev, קישור למטה. אז, פסק הדין של היום על live nerf.

### פסק דין: SHIP IT, ואל תצטטו אותו לפני 24 באוקטובר

4:51 SHIP IT. הייתי שולח את זה כי זו הטענה הראשונה להחלשה שראיתי עם חותמת זמן, ספר חוקים ציבורי ונקודה עיוורת מוצהרת. רק אל תצטטו את זה לפני 24 באוקטובר. וזה הדיף להיום. אני ניקו מ-Axrisi. מזגו באחריות.

## מקורות

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
