+− THE DAILY DIFFdev & AI news
SHIP IT

كيف تكتشف تخفيض أداء Claude (ببيانات حقيقية)

يقول الناس إن Claude يصبح أقل ذكاءً بعد أسابيع قليلة من كل إطلاق.

يقول الناس إن Claude يصبح أقل ذكاءً بعد أسابيع قليلة من كل إطلاق. وضع أحد المطورين Claude Opus 5.5 على مؤقت لمدة 30 يومًا من أسبوع الإطلاق، مع أسئلة ثابتة، ورمز Claude Code مثبت وقواعد عامة، ويظهر هذا سبب عدم تمكن أحد من المعرفة من قبل، ولماذا عدد الرموز الخاص بك هو الشيء الذي يجب مراقبته. الحكم: SHIP IT.

اقرأ النسخة المكتوبة (الإنجليزية) ↗

ما يغطيه هذا الفيديو

  • Claude يصبح أقل ذكاءً بعد الإطلاق: النظرية تواجه مؤقت اليوم صفر
  • livenerf: مؤقت 30 يومًا على Opus 5.5 من أسبوع الإطلاق
  • كيف تكتشف التخفيض: 78 سؤالًا تكون إجاباتها صحيحة أحيانًا
  • ما يمكن أن يراه: 7.5 نقطة، وعدد الرموز يتحرك أولاً
  • النقطة العمياء: تبديل Opus 5 و 8 مفاتيح إجابة خاطئة

النص المترجم

مترجم من السرد الإنجليزي الأصلي. يتم التحكم في الصوت والتعليقات التوضيحية المتاحة بواسطة YouTube.

Claude يصبح أقل ذكاءً بعد الإطلاق: النظرية تواجه مؤقت اليوم صفر

0:00 الجميع يعلم أن Claude يصبح أقل ذكاءً بعد أسابيع قليلة من الإطلاق. لذا وضع أحد المطورين Opus 5.5 على مؤقت من أسبوع الإطلاق، ويقول المؤقت إنه لم يكن بإمكان أحد أن يعرف بعد. في هذا الفيديو، ثلاثة أسئلة. كيف تكتشف تخفيض الأداء؟ ماذا يمكن لهذا المقياس أن يرى؟ وماذا تقول Anthropic؟ وخط واحد في إشارات الريبو جعلني أضحك بصوت عالٍ.

0:20 سأصل إلى ذلك في النهاية. إنه الأربعاء، الثلاثون من سبتمبر، وهذا هو The Daily Diff. ثلاث قصص اليوم، والقضية الكبيرة هي مستودع GitHub يسمى live nerf.

livenerf: مؤقت 30 يومًا على Opus 5.5 من أسبوع الإطلاق

0:30 لأشهر، قال الناس إن Anthropic تخفض بهدوء من أداء نماذجها بعد الإطلاق. النظريات المعتادة هي نموذج مضغوط، نموذج أصغر تحت نفس الاسم أو ببساطة تفكير أقل. يطلق الريبو على كل حجة حتى الآن اسم "مشاعر مقابل مشاعر". تم شحن Opus 5.5 في الثاني والعشرين من سبتمبر، وقبل أسبوع أخبرتك أنه تصدر اللوحة المستقلة بينما كتب ثلاثة أضعاف عدد الكلمات مقارنة بالنموذج المتوسط. بعد يومين ونصف، بدأ مطور يُدعى "ninja hawk" المؤقت،

0:59 مرة واحدة يوميًا لمدة ثلاثين يومًا، مع سجلات لا يمكن لأحد تعديلها. وصل موضوع Hacker News إلى ما يقرب من ثمانمائة نقطة وانقسم مثل دردشة الفريق. يقول أحد المعلقين إن تخفيض أداء النماذج ليس حقيقيًا في الغالبية العظمى من الحالات المبلغ عنها. ويقول آخر إن الناس يعتادون للتو على المستوى الجديد من الذكاء. ويقوم مستخدم قوي لـ Claude Code الآن بتجاهل النافذة المنبثقة "تقييم هذه الجلسة" في كل مرة، لأن تقييم Claude بدا وكأنه يجعله أسوأ. مراجعة الأقران. إذن، السؤال الأول، كيف تكتشف تخفيض الأداء؟

كيف تكتشف التخفيض: 78 سؤالًا تكون إجاباتها صحيحة أحيانًا

1:27 تبدأ بحوالي 2300 سؤال امتحان صعب، ويحصل Opus على 93% صحيحًا في المحاولة الأولى، وهو أمر عديم الفائدة للكاشف، نظرًا لأن السؤال الذي يجيب عليه دائمًا بشكل صحيح لا يمكن أن ينخفض. 97% كانت دائمًا صحيحة أو دائمًا خاطئة، والـ 78 سؤالًا التي تكون إجاباتها صحيحة أحيانًا فقط أصبحت اللوحة. نفس الموجه، بدون أدوات، وتصنيف المطابقة الدقيقة بدون حكم ذكاء اصطناعي، لأن الحكم سينجرف أيضًا. يعمل على اشتراك Max من خلال Claude Code بدون واجهة مستخدم رسومية (headless)،

1:55 نظرًا لأن نسخة API كان سعرها حوالي 1600 دولار شهريًا. ونسخة Claude Code مثبتة، لأنه، بكلمات الريبو، تبدو الأداة المتغيرة تمامًا مثل النموذج المتغير. تأتي الإحصائيات من ورقة بحثية تسمى "إضافة أشرطة الخطأ إلى التقييمات"، لإيفان ميلر في Anthropic. لذا فإن حسابات Anthropic الخاصة بها تقوم الآن بتدقيق Anthropic، وهي النسخة الأكاديمية من استشهاد شروط الخدمة لخدمة العملاء.

ما يمكن أن يراه: 7.5 نقطة، وعدد الرموز يتحرك أولاً

2:19 السؤال الثاني، ماذا يمكن أن يرى؟ لكل نافذة عشرة أيام، انخفاض بحوالي سبع نقاط ونصف. لإثبات أن النظام يعمل، قام المؤلف بتخفيض جهد Claude عمدًا. الجهد المتوسط قلل من المخرجات بحوالي الربع، والنتيجة بأربع نقاط فقط. الجهد المنخفض قلل من المخرجات بما يقرب من الثلثين، بثماني نقاط. هذا هو الجزء الذي يجب سرقته. يظهر التفكير الأقل في عدد الرموز قبل أن يظهر في الإجابات.

2:43 لذا قم بتثبيت إصدار النموذج الخاص بك، وسجل رموز الإخراج لكل مهمة، واحتفظ ببعض الأسئلة الثابتة الخاصة بك. إذا كتب وكيلك فجأة أقصر، تحقق من سجلاتك قبل أن تتحقق من Reddit. وهنا الجزء الصادق.

النقطة العمياء: تبديل Opus 5 و 8 مفاتيح إجابة خاطئة

2:54 كان التبديل بهدوء إلى Opus 5 الأقدم تغييرًا صغيرًا جدًا بحيث لا يمكن للنظام أن يستدعيه، ويذكر ملف README ذلك صراحةً. ووجد التدقيق أيضًا ثمانية مفاتيح إجابة تبدو خاطئة، لذا وجد كاشف التخفيض أخطاء في المعيار قبل أن يجد تخفيضًا.

Anthropic: لا نقلل أبدًا من جودة النموذج

3:08 السؤال الثالث، ماذا تقول Anthropic؟ في العام الماضي، بعد موجة من الشكاوى، نشرت Anthropic تقرير ما بعد الكارثة. تقول، "نحن لا نقلل أبدًا من جودة النموذج بسبب الطلب، وقت اليوم أو حمل الخادم." يعترف نفس المنشور بأن ثلاثة أخطاء أدت إلى تدهور Claude، وما يقرب من ثلث مستخدمي Claude Code وصلوا إلى الخوادم الخاطئة مرة واحدة على الأقل. لذا كانت الشكاوى حقيقية وكان السبب هو الأخطاء، وهذا هو السبب في أن الريبو يحذر من أن أسبوع الإطلاق قد يكون الأسوأ.

3:35 ستة من ثلاثين يومًا قد انقضت. أول إشارة محتملة تظهر حوالي الرابع والعشرين من أكتوبر، لذا فإن الإجابة الصادقة هي أن لا أحد يعلم، بما في ذلك كل من كان متأكدًا. بمناسبة الحديث عن الأرقام التي لا ينشرها أحد.

مراكز البيانات تحافظ على سرية أرقامها؛ Backblaze تنشر

3:46 Lighthouse Reports والصحيفة الهولندية Trouw وجدتا أن الغالبية العظمى من مراكز البيانات الأوروبية تحافظ على سرية استخدامها للطاقة والمياه، على الرغم من أن قاعدة الاتحاد الأوروبي تتطلب الإبلاغ لمدة ثلاث سنوات. في هولندا، أقل من ربع المراكز تنشر البيانات. يستخدم مركز بيانات Microsoft واحدًا فقط حوالي 1% من الكهرباء الهولندية. في هذه الأثناء، قامت Backblaze بالشيء الممل مرة أخرى. تغطي إحصائيات الأقراص الفصلية حوالي 350 ألف قرص صلب، وارتفع معدل الفشل إلى 1.73%،

4:16 وهو الأعلى منذ فترة. ثلاثة نماذج Seagate لم تشهد أي أعطال. هذا ما تبدو عليه البيانات الأساسية العامة، ربعًا بعد ربع، لمدة ثلاثة عشر عامًا.

سطر الإشارة: ساعد Claude في بناء المقياس

4:25 الآن، سطر الإشارة ذاك. يعترف ملف README بأن الكثير من الريبو كُتب بمساعدة Claude، وهو النموذج الذي يتم قياسه. لذا ساعد Claude في بناء المقياس الذي يتحقق مما إذا كان Claude قد أصبح أقل ذكاءً. لهذا السبب فإن المصححين وظائف بسيطة. بكلمات المؤلف، "لا يجب عليك أن تثق بالمؤلف، بشريًا كان أم غير ذلك." إذا كنت تفضل قراءة هذا بدلاً من سماعي أقوله، فإن الفرق يصل إلى صندوق بريدك

4:46 كل صباح، مجانًا على the daily diff dot dev، الرابط أدناه. إذن، حكم اليوم على live nerf.

الحكم: SHIP IT، ولا تستشهد به قبل 24 أكتوبر

4:51 SHIP IT. سأشحنها لأنها أول حجة تخفيض أداء رأيتها مع طابع زمني، ودليل قواعد عام، ونقطة عمياء معلنة. فقط لا تقتبس منها قبل الرابع والعشرين من أكتوبر. وهذا هو الفارق لليوم. أنا نيكو من Axrisi. ادمج بمسؤولية.

المصادر

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

فيديوهات ذات صلة

daily · ar · 16‏/09‏/2026

رئيس قسم الذكاء الاصطناعي في مايكروسوفت يصف دستور كلود بالخطير.

نشر مصطفى سليمان، الرئيس التنفيذي لشركة مايكروسوفت للذكاء الاصطناعي، مقالًا من 3000 كلمة يجادل فيه بأن دستور كلود الخاص بشركة أنثروبيك يدرب النموذج على الاعتقاد بأنه "قد يكون واعيًا" ويستحق "رعاية الن

5:19 ↗