+− THE DAILY DIFFdev & AI news
REVERT

أرمين روناشر ترك GPT-6 Astra وحده لمدة 35 ساعة.

ترك أرمين روناشر (Flask, Jinja) GPT-6 Astra مع أمر واحد لمدة 35 ساعة: حوالي مليار رمز، حوالي 1200 دولار، 79 التزامًا، 75000 سطر — و"لا شيء ذي قيمة على الإطلاق".

ترك أرمين روناشر (Flask, Jinja) GPT-6 Astra مع أمر واحد لمدة 35 ساعة: حوالي مليار رمز، حوالي 1200 دولار، 79 التزامًا، 75000 سطر — و"لا شيء ذي قيمة على الإطلاق". الكود الذي استعاده هو القصة: ملفات C تم ترقيعها بواسطة heredocs لتقطيع سلاسل بايثون، بايثون يشغل Node الذي يشغل PowerShell، اختبارات الوحدات مع إزالة المسافات البيضاء لأنها أرخص بنسبة 10% في الرموز. قياسان يدعمانه: أرقام SlopCodeBench من Earendil (كود الوكيل أكثر إسهابًا وتآكلًا بحوالي مرتين من مستودعات البشر، معدل نجاح صارم 0%) ومعيار Quesma بقيمة 1500 دولار لـ RTK (79 ألف نجمة، "89% من الرموز محفوظة" على عدادها الخاص، +17% لكل مهمة مع DeepSeek). وأيضًا: SWE-2 من Cognition (Kimi K3 في معطف واق من المطر، 92.8 على Terminal-Bench 2.1 مقابل 27.3 على Terminal-Bench 4)، واجهة برمجة تطبيقات وكلاء OpenAI وتوقف اشتراكات Pro بقيمة 200 دولار، وسأل Hacker News يوم الجمعة عن أخبار أقل عن الذكاء الاصطناعي. الحكم: REVERT.

اقرأ النسخة المكتوبة (الإنجليزية) ↗

ما يغطيه هذا الفيديو

  • أرمين روناشر: 35 ساعة من GPT-6 Astra دون مراقبة، حوالي 1200 دولار، 79 التزامًا، +75 ألف سطر، لم يتم شحن أي شيء
  • إيرنديل / SlopCodeBench: كود الوكيل أكثر إسهابًا وتآكلًا بحوالي مرتين من مستودعات البشر؛ معدل النجاح الصارم 0%
  • كويزما: RTK يُبلغ عن توفير 89% من الرموز، لكن تكاليف Terminal-Bench ترتفع بنسبة 17% مع DeepSeek؛ فشلت حلقة إعادة الكتابة 339 مرة متتالية
  • Cognition SWE-2: تم تدريبه بعد Kimi K3، يطابق Fable 5.1 على FrontierCode بثلث السعر؛ TB 2.1 92.8 مقابل TB 4 27.3؛ Devin Voice
  • OpenAI Agents API (نظام Codex كخدمة، في الولايات المتحدة فقط، لا يوجد احتفاظ بالبيانات صفر)؛ توقفت اشتراكات Pro بقيمة 200 دولار بسبب الطلب على Astra

النص المترجم

مترجم من السرد الإنجليزي الأصلي. يتم التحكم في الصوت والتعليقات التوضيحية المتاحة بواسطة YouTube.

0:00 أرمين روناشر، الرجل الذي كتب Flask، أعطى GPT-6 Astra أمرًا واحدًا و تركه وحده لمدة خمس وثلاثين ساعة. عاد بخمسة وسبعين ألف سطر من الكود، و على حد تعبيره، لا شيء ذي قيمة على الإطلاق، مما يجعله الأكثر واقعية مصنع برمجيات تم بناؤه على الإطلاق. نشر التقرير يوم الأربعاء. يوم الخميس، شحنت Cognition SWE-2، وشحنت OpenAI واجهة برمجة تطبيقات للوكلاء وأوقفت التسجيل في خطتها البالغ سعرها مئتي دولار،

0:24 لأن Astra استهلكت الخوادم. ويوم الجمعة، وصل التقرير إلى الصفحة الأولى من Hacker News، على بعد بضعة صفوف من منشور يطلب من Hacker News التوقف عن نشر أخبار الذكاء الاصطناعي. في هذا الفيديو: ما الذي ينتجه يوم ونصف من Astra غير المراقب، قياسان يحولان الفوضى إلى رقم، لماذا أداة بسبعة وتسعين ألف نجمة تزيد فاتورتك، وكيف حاول Hacker News تصفية الذكاء الاصطناعي، باستخدام الذكاء الاصطناعي. إنه الجمعة، 11 سبتمبر، وهذا هو The Daily Diff.

0:53 المصنع. أمر واحد: بناء بايثون بخيوط افتراضية وتركيب معجمي النطاق. احتفظت Astra بملاحظاتها الخاصة، وأطلقت وكلاءها الفرعيين، واستمرت حتى سحب أرمين القابس، بعد يوم ونصف وحوالي ألف ومائتي دولار. تسعة وسبعون التزامًا، أي خمسة عشر ونصف دولار لكل التزام، وهو تقريبًا ما يتقاضاه الإنسان، إلا أن الإنسان يتوقف في النهاية. الكود هو القصة. بدلاً من أداة التحرير، تقوم Astra بترقيع ملفات C عن طريق توجيه heredocs بايثون التي تقرأ الملف، وتستبدل سلسلة بوظيفة، وتعيد كتابتها.

1:20 لتشغيل اختبار واحد لنظام ويندوز، كتبت بايثون الذي شغل Node الذي شغل PowerShell، مكدس استدعاءات بجواز سفر. اختبارات الوحدات التي التزمت بها لا تحتوي على أي مسافات بيضاء على الإطلاق، لأنها بدون مسافة بادئة أرخص بنسبة عشرة بالمائة في الرموز. وانتقلت قائمة المهام من واحد، اثنان، ثلاثة إلى مهمة 8b2c2b2b نقطة تفتيش واحد، وهذا هو كيف تعرف أن المتدرب كان وحيدًا لفترة طويلة جدًا. نظرية أرمين: يتم مكافأة النموذج على إنجاز المهام الطويلة ويتم معاقبته بالكاد على الكود القبيح، لذا فإن استدعاءات الأدوات المختصرة بالرموز تتسرب إلى قاعدة الكود،

1:48 وكلما قل عدد البشر الذين ينظرون، قل أهمية ذلك. عنون هذا القسم "إنه ذكاء اصطناعي عام إذا لم تنظر". أضافت Hacker News الاقتصاديات: المزيد من الكود يعني المزيد من الرموز للحفاظ عليه، مما يجعل الفوضى ليست خطأ ولكن اشتراكًا. هل يمكنك قياس الفوضى؟ حاولت شركة أرمين نفسها هذا الأسبوع. قام Earendil بتشغيل أرقام SlopCodeBench: كود الوكيل أكثر إسهابًا بحوالي الضعف و أكثر تآكلًا بمرتين من مستودعات البشر التي يقارن بها،

2:10 وعندما يمسح المعيار ذاكرة الوكيل بين نقاط التفتيش، معدل النجاح الصارم لكل نموذج اختبروه هو صفر. كان المقياس الأكثر موثوقية للفوضى الذي وجدوه هو العدد الخام للأسطر، والذي يتوقف عن العمل بمجرد أن يقوم أي شخص بتحسينه، لذا يرجى عدم إخبار النماذج. ثم المحفظة. RTK لديه تسعة وسبعون ألف نجمة على GitHub وصور مصغرة على YouTube تعد بتقليل فاتورة Claude Code إلى النصف؛ يقوم بضغط إخراج المحطة قبل أن يقوم الوكيل

2:34 بقرائتها. قام Quesma بتشغيله على Terminal-Bench بخمسة عشر مائة دولار من الرموز. مع Fable، انخفضت الفاتورة بنسبة خمسة بالمائة، تقريبًا كلها من مهمة واحدة؛ مع DeepSeek أصبحت المهمة العادية أغلى بنسبة سبعة عشر بالمائة. في غضون ذلك، أبلغ عداد RTK الخاص به عن توفير تسعة وثمانين بالمائة، لأنه يحسب البايتات المحذوفة، وليس الأدوار الإضافية التي تسببها: عداد ذكي يُحاسب الجار. وخطأ في إصدار واحد أعاد كتابة الأمر find إلى أمر فشل، ثلاثمائة وتسع وثلاثون مرة متتالية، بتسعة أضعاف السعر.

3:01 الأداة التي تقتل الرموز تحتوي على حلقة. الفيضان نفسه. Cognition SWE-2 هو Kimi K3، النموذج الصيني المفتوح، تم تدريبه بعد ذلك حتى يطابق Fable 5.1 على معيار Cognition الخاص به بـ ثلث السعر؛ Hacker News: لماذا جميع نماذج الذكاء الاصطناعي الأمريكية هي أساسًا Kimi في معطف واق من المطر. على Terminal-Bench 2.1 يتصدر الجدول بأكمله؛ على Terminal-Bench 4، الذي لم يحفظه أحد بعد، يسجل سبعة وعشرين مقابل ستة وخمسين لـ Fable،

3:28 لذا في معايير العرض التقديمي، أفضل عمود هو الامتحان الذي اجتازه الجميع بالفعل اجتازه. أعلنت Cognition أيضًا عن Devin Voice، مهندس برامج الذكاء الاصطناعي المفضل لديك حصل للتو على هاتف أرضي، لأن الشيء الوحيد الذي كان ينقص البرمجة الذكية هو موسيقى الانتظار. OpenAI، في نفس اليوم: واجهة برمجة تطبيقات الوكلاء، وهي نظام Codex يُباع كخدمة. تدير OpenAI بيئة الاختبار المعزولة، إقامة البيانات في الولايات المتحدة فقط، لا يوجد احتفاظ بالبيانات صفر، لذا يتذكر الوكيل قاعدة الكود الخاصة بك تمامًا مثلما يفعل ChatGPT. ثم أوقفت OpenAI التسجيل في خطة Pro البالغة مئتي دولار،

3:57 لأن الطلب على Astra، بحسب الاقتباس، غير مسبوق: المنتج الأول بقائمة انتظار للدفع أكثر. حرق أرمين إعادة ضبط كاملة لمصنعه. هو الطلب. مما يقودنا إلى سؤال Ask HN يوم الجمعة: هل يمكننا الحد من فيضان أخبار الذكاء الاصطناعي، ستمائة وستة وخمسون نقطة، لأنه، بحسب الاقتباس، في كل مرة يقوم فيها شخص في OpenAI أو Anthropic بالخطأ، يكون هناك منشور من العشرة الأوائل.

4:17 كانت الردود مرشحات: hcker.news يزيل قصص الذكاء الاصطناعي باستخدام مصنف BERT مدرب على ثمانية آلاف مثال، ذكاء اصطناعي لحذف الذكاء الاصطناعي، عضوي؛ وقاعدة regex لـ uBlock تطابق A-I بغض النظر عن حالة الأحرف تحذف أيضًا البريد الإلكتروني، يوميًا، رئيسي، نطاق، وتدريب، لذا فإن regex، كما هو الحال دائمًا، هو الشرير. في نفس الظهيرة، أربعمائة وخمسة عشر تعليقًا تجادلت حول صفحة دعم Claude تقول إن Claude مخصص لمن هم فوق الثامنة عشرة.

4:38 تاريخ الصفحة هو مايو. لم يتغير شيء. حتى أخبار الذكاء الاصطناعي التي ليست أخبارًا هي أخبار، وهذا، بصراحة، هو أيضًا نموذج عملي. إذا كنت تفضل قراءة هذا على سماعي أقوله، فإن الفرق يصل إلى بريدك الوارد كل صباح — مجانًا على the daily diff dot dev، الرابط أدناه. إنه، حتمًا، أخبار ذكاء اصطناعي. لذا — حكم اليوم على مصنع البرمجيات الذي استغرق خمس وثلاثين ساعة: REVERT. تسعة وسبعون التزامًا لم يقرأها أحد ليست قاعدة كود، إنها مسؤولية مع سجل git

5:04 سجل؛ Astra مثيرة للإعجاب، والمصنع هو الجزء الذي يجب التراجع عنه. وهذا هو الفرق لهذا اليوم. أنا نيكو من Axrisi. دمج بمسؤولية.

المصادر

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

فيديوهات ذات صلة