# چگونه ضعیف شدن Claude را تشخیص دهیم (با داده‌های واقعی)

Published: 2026-09-30

مردم می‌گویند Claude چند هفته پس از هر راه‌اندازی کندتر می‌شود. یک توسعه‌دهنده Claude Opus 5.5 را از هفته‌ی راه‌اندازی روی یک ساعت 30 روزه قرار داد، با سؤالات ثابت، یک Claude Code پین‌شده و قوانین عمومی، و این نشان می‌دهد که چرا هیچ‌کس قبلاً نمی‌توانست بداند، و چرا تعداد توکن‌های شما چیزی است که باید به آن توجه کنید. نتیجه: SHIP IT.

Canonical: https://thedailydiff.dev/fa/video/2026-09-30-opus-nerf-meter/

## این ویدیو چه مواردی را پوشش می‌دهد

- Claude پس از راه‌اندازی کندتر می‌شود: نظریه با یک ساعت روز صفر مواجه می‌شود
- livenerf: یک ساعت 30 روزه روی Opus 5.5 از هفته‌ی راه‌اندازی
- چگونه ضعیف شدن را تشخیص دهیم: 78 سؤال گاهی اوقات درست
- چه چیزی می‌تواند ببیند: 7.5 امتیاز، و تعداد توکن‌ها اول حرکت می‌کند
- نقطه کور: یک تعویض Opus 5 و 8 کلید پاسخ اشتباه

## فصل‌ها

- 0:00 Claude پس از راه‌اندازی کندتر می‌شود: نظریه با یک ساعت روز صفر مواجه می‌شود
- 0:26 livenerf: یک ساعت 30 روزه روی Opus 5.5 از هفته‌ی راه‌اندازی
- 1:24 چگونه ضعیف شدن را تشخیص دهیم: 78 سؤال گاهی اوقات درست
- 2:19 چه چیزی می‌تواند ببیند: 7.5 امتیاز، و تعداد توکن‌ها اول حرکت می‌کند
- 2:53 نقطه کور: یک تعویض Opus 5 و 8 کلید پاسخ اشتباه
- 3:08 Anthropic: ما هرگز کیفیت مدل را کاهش نمی‌دهیم
- 3:45 مراکز داده اعداد خود را مخفی نگه می‌دارند؛ Backblaze منتشر می‌کند
- 4:25 خط اعتبارات: Claude به ساخت سنجش‌گر کمک کرد
- 4:50 نتیجه: SHIP IT، و قبل از 24 اکتبر آن را نقل قول نکنید

## رونوشت ترجمه شده

ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویس‌های موجود توسط YouTube کنترل می‌شوند.

### Claude پس از راه‌اندازی کندتر می‌شود: نظریه با یک ساعت روز صفر مواجه می‌شود

0:00 همه می‌دانند که Claude چند هفته پس از راه‌اندازی کندتر می‌شود. بنابراین یک توسعه‌دهنده Opus 5.5 را از هفته‌ی راه‌اندازی روی یک ساعت قرار داد، و ساعت می‌گوید که هیچ‌کس هنوز نمی‌توانسته بداند. در این ویدئو، سه سؤال. چگونه یک ضعیف شدن را تشخیص می‌دهید؟ این سنجش‌گر چه چیزی را می‌تواند ببیند؟ و Anthropic چه می‌گوید؟ و یک خط در اعتبارات مخزن مرا به خنده انداخت.

0:20 در آخر به آن خواهم پرداخت. چهارشنبه 30 سپتامبر است و این The Daily Diff است. امروز سه داستان، و داستان بزرگ یک مخزن GitHub به نام livenerf است.

### livenerf: یک ساعت 30 روزه روی Opus 5.5 از هفته‌ی راه‌اندازی

0:30 ماه‌هاست که مردم می‌گویند Anthropic مدل‌های خود را پس از راه‌اندازی بی‌سروصدا ضعیف می‌کند. نظریه‌های معمول یک مدل فشرده‌شده، یک مدل کوچک‌تر با همان نام یا به سادگی تفکر کمتر است. این مخزن هر استدلال تاکنون را «فضاسازی در برابر فضاسازی» می‌نامد. Opus 5.5 در 22 سپتامبر منتشر شد، و یک هفته پیش به شما گفتم که در حالی که سه برابر بیشتر از مدل متوسط کلمه می‌نوشت، در صدر جدول مستقل قرار گرفت. دو و نیم روز بعد، توسعه‌دهنده‌ای به نام ninja hawk ساعت را آغاز کرد،

0:59 روزی یک بار به مدت سی روز، با گزارش‌هایی که هیچ‌کس نمی‌تواند ویرایش کند. رشته Hacker News تقریباً به 800 امتیاز رسید و مانند یک چت تیمی تقسیم شد. یک نظردهنده می‌گوید ضعیف کردن مدل‌ها در اکثریت قریب به اتفاق موارد گزارش‌شده واقعی نیست. دیگری می‌گوید مردم فقط به سطح جدیدی از هوش عادت می‌کنند. و یک کاربر حرفه‌ای Claude Code اکنون هر بار پاپ‌آپ «امتیاز به این جلسه» را رد می‌کند، زیرا امتیاز دادن به Claude به نظر می‌رسید آن را بدتر می‌کند. بازبینی همتا. پس، سؤال اول، چگونه یک ضعیف شدن را تشخیص می‌دهید؟

### چگونه ضعیف شدن را تشخیص دهیم: 78 سؤال گاهی اوقات درست

1:27 با حدود 2300 سؤال امتحانی دشوار شروع می‌کنید، و Opus 93 درصد را در اولین تلاش درست جواب می‌دهد، که برای یک آشکارساز بی‌فایده است، زیرا سؤالی که همیشه درست جواب می‌دهد نمی‌تواند کاهش یابد. 97 درصد همیشه درست یا همیشه غلط بودند، و 78 سؤالی که فقط گاهی اوقات درست جواب می‌دهد، پنل را تشکیل داد. همان پرامپت، بدون ابزار، و درجه‌بندی تطابق دقیق بدون داور هوش مصنوعی، زیرا داور هم تغییر می‌کرد. روی اشتراک Max از طریق headless Claude Code اجرا می‌شود،

1:55 زیرا نسخه‌ی API با قیمت حدود 1600 دلار در ماه بود. و نسخه‌ی Claude Code پین شده است، زیرا، به گفته‌ی مخزن، یک مهار تغییر یافته دقیقاً شبیه یک مدل تغییر یافته به نظر می‌رسد. آمار از مقاله‌ای به نام «اضافه کردن میله‌های خطا به ارزیابی‌ها» می‌آید، توسط ایوان میلر در Anthropic. بنابراین ریاضیات خود Anthropic اکنون Anthropic را ممیزی می‌کند، که نسخه‌ی آکادمیک استناد به شرایط خدمات به پشتیبانی مشتری است.

### چه چیزی می‌تواند ببیند: 7.5 امتیاز، و تعداد توکن‌ها اول حرکت می‌کند

2:19 سؤال دوم، چه چیزی را می‌تواند ببیند؟ در هر پنجره 10 روزه، کاهشی حدود هفت و نیم امتیاز. برای اثبات کارکرد دستگاه، نویسنده عمداً تلاش Claude را کاهش داد. تلاش متوسط خروجی را حدود یک چهارم و امتیاز را فقط چهار امتیاز کاهش داد. تلاش کم خروجی را تقریباً دو سوم کاهش داد، برای هشت امتیاز. این قسمتی است که باید دزدید. تفکر کمتر در تعداد توکن‌ها قبل از ظاهر شدن در پاسخ‌ها نمایان می‌شود.

2:43 پس نسخه‌ی مدل خود را پین کنید، توکن‌های خروجی را برای هر کار ثبت کنید، و چند سؤال ثابت خود را نگه دارید. اگر عامل شما ناگهان کوتاه‌تر می‌نویسد، قبل از بررسی Reddit، گزارش‌های خود را بررسی کنید. و این قسمت صادقانه است.

### نقطه کور: یک تعویض Opus 5 و 8 کلید پاسخ اشتباه

2:54 تعویض بی‌سروصدا با Opus 5 قدیمی‌تر تغییر کوچکی بود که دستگاه آن را تشخیص دهد، و فایل readme این را از ابتدا می‌گوید. ممیزی همچنین هشت کلید پاسخ را پیدا کرد که اشتباه به نظر می‌رسند، بنابراین آشکارساز ضعیف شدن، باگ‌هایی را در بنچمارک قبل از یافتن یک ضعیف شدن پیدا کرد.

### Anthropic: ما هرگز کیفیت مدل را کاهش نمی‌دهیم

3:08 سؤال سوم، Anthropic چه می‌گوید؟ سال گذشته، پس از موجی از شکایات، Anthropic یک پس از مرگ منتشر کرد. آن می‌گوید، نقل قول: «ما هرگز کیفیت مدل را به دلیل تقاضا، زمان روز یا بار سرور کاهش نمی‌دهیم.» همان پست اعتراف می‌کند که سه باگ Claude را تخریب کرده بودند، و تقریباً یک سوم از کاربران Claude Code حداقل یک بار به سرورهای اشتباه متصل شدند. بنابراین شکایات واقعی بودند و علت آن باگ‌ها بود، به همین دلیل مخزن هشدار می‌دهد که هفته‌ی راه‌اندازی می‌تواند بدترین هفته باشد.

3:35 شش از سی روز گذشته است. اولین تماس ممکن حدود 24 اکتبر اتفاق می‌افتد، بنابراین پاسخ صادقانه این است که هیچ‌کس نمی‌داند، از جمله همه‌ی کسانی که مطمئن بودند. صحبت از اعدادی که هیچ‌کس منتشر نمی‌کند.

### مراکز داده اعداد خود را مخفی نگه می‌دارند؛ Backblaze منتشر می‌کند

3:46 Lighthouse Reports و روزنامه هلندی Trouw دریافتند که اکثریت قریب به اتفاق مراکز داده اروپایی مصرف برق و آب خود را مخفی نگه می‌دارند، اگرچه یک قانون اتحادیه اروپا گزارش‌دهی را به مدت سه سال الزامی کرده است. در هلند، کمتر از یک چهارم منتشر می‌کنند. فقط یک مرکز داده مایکروسافت حدود یک درصد از برق هلند را مصرف می‌کند. در همین حال، Backblaze دوباره کار خسته‌کننده را انجام داد. آمار فصلی درایو آن حدود 350,000 هارد دیسک را پوشش می‌دهد، و نرخ خرابی به 1.73 درصد افزایش یافت،

4:16 بالاترین نرخ در مدتی طولانی. سه مدل Seagate خرابی صفر داشتند. این چیزی است که یک خط پایه عمومی، سه‌ماهه به سه‌ماهه، به مدت سیزده سال به نظر می‌رسد.

### خط اعتبارات: Claude به ساخت سنجش‌گر کمک کرد

4:25 حالا، آن خط اعتبارات. فایل readme اعتراف می‌کند که بخش زیادی از مخزن با کمک Claude نوشته شده است، که همان مدلی است که اندازه‌گیری می‌شود. بنابراین Claude به ساخت سنجش‌گری که بررسی می‌کند آیا Claude کندتر شده است کمک کرد. به همین دلیل است که درجه‌بندها توابع ساده‌ای هستند. به گفته‌ی نویسنده، «نباید به نویسنده اعتماد کنید، انسانی یا غیرانسانی.» اگر ترجیح می‌دهید این را بخوانید تا از من بشنوید، The Daily Diff هر روز صبح

4:46 به صورت رایگان در صندوق ورودی شما قرار می‌گیرد، در thedailydiff.dev، لینک زیر. پس، نتیجه‌ی امروز در مورد livenerf.

### نتیجه: SHIP IT، و قبل از 24 اکتبر آن را نقل قول نکنید

4:51 SHIP IT. من آن را SHIP IT می‌کنم زیرا این اولین استدلال ضعیف شدن است که من با یک برچسب زمانی، یک کتاب قوانین عمومی و یک نقطه کور مشخص دیده‌ام. فقط قبل از 24 اکتبر آن را نقل قول نکنید. و این The Diff برای امروز است. من نیکو از Axrisi هستم. مسئولانه ادغام کنید.

## منابع

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
