# आर्मिन रोनाकर ने GPT-6 Astra को 35 घंटे तक अकेला छोड़ दिया।

Published: 2026-09-12

आर्मिन रोनाकर (Flask, Jinja) ने GPT-6 Astra को एक प्रॉम्प्ट दिया और उसे 35 घंटे तक अकेला छोड़ दिया: लगभग एक अरब टोकन, लगभग $1,200, 79 कमिट्स, 75,000 लाइनें — और "बिल्कुल कुछ भी मूल्यवान नहीं"। उसने जो कोड पुनर्प्राप्त किया वह कहानी है: Python स्ट्रिंग-स्प्लिसिंग heredocs द्वारा पैच की गई C फ़ाइलें, Python द्वारा Node और Node द्वारा PowerShell का स्पॉनिंग, यूनिट टेस्ट्स जिनमें से व्हाइटस्पेस हटा दिया गया क्योंकि यह टोकन में 10% सस्ता है। दो माप उसके दावे का समर्थन करते हैं: Earendil के SlopCodeBench नंबर (एजेंट कोड मानव रेपो की तुलना में लगभग दोगुना शब्दाडंबरपूर्ण और खराब, 0% सख्त पास दर) और Quesma का RTK का $1,500 बेंचमार्क (79k सितारे, अपने स्वयं के काउंटर पर "89% टोकन बचाए गए", DeepSeek के साथ प्रति कार्य +17%)। इसके अलावा: Cognition का SWE-2 (ट्रेच कोट में Kimi K3, टर्मिनल-बेंच 2.1 पर 92.8 बनाम टर्मिनल-बेंच 4 पर 27.3), OpenAI का एजेंट्स API और $200 प्रो साइन-अप्स को रोका गया, और शुक्रवार को Hacker News ने कम AI समाचारों के लिए कहा। फैसला: REVERT।

Canonical: https://thedailydiff.dev/hi/video/2026-09-11-astra-slop-factory/

## इस वीडियो में क्या शामिल है

- आर्मिन रोनाकर: 35 घंटे का अकेला GPT-6 Astra, ~$1,200, 79 कमिट्स, +75k लाइनें, कुछ भी शिप नहीं हुआ
- Earendil / SlopCodeBench: एजेंट कोड मानव रेपो की तुलना में ~2× अधिक शब्दाडंबरपूर्ण और खराब; सख्त पास दर 0%
- Quesma: RTK 89% टोकन बचाए जाने की रिपोर्ट करता है, लेकिन DeepSeek के साथ Terminal-Bench की लागत 17% बढ़ जाती है; एक रीराइट लूप लगातार 339 बार विफल रहा
- Cognition SWE-2: Kimi K3 से पोस्ट-ट्रेन्ड, FrontierCode पर Fable 5.1 से मेल खाता है, एक-तिहाई कीमत पर; TB 2.1 92.8 बनाम TB 4 27.3; Devin Voice
- OpenAI एजेंट्स API (Codex हार्नेस एक सेवा के रूप में, केवल US-में, कोई ZDR नहीं); Astra की मांग के कारण $200 प्रो साइन-अप्स रोके गए

## अनुवादित प्रतिलेख

मूल अंग्रेजी कथन से अनुवादित। उपलब्ध ऑडियो और कैप्शन YouTube द्वारा नियंत्रित होते हैं।

0:00 आर्मिन रोनाकर, वह व्यक्ति जिसने Flask लिखा, ने GPT-6 Astra को एक प्रॉम्प्ट दिया और उसे पैंतीस घंटे तक अकेला छोड़ दिया। यह पचहत्तर हजार लाइनों के कोड के साथ लौटा और, उसके शब्दों में, बिल्कुल कुछ भी मूल्यवान नहीं, जो इसे सबसे यथार्थवादी बनाता है सॉफ्टवेयर फैक्ट्री कभी बनी। उसने बुधवार को राइट-अप पोस्ट किया। गुरुवार को, Cognition ने SWE-2 शिप किया, और OpenAI ने एक एजेंट्स API शिप किया और अपने दो सौ डॉलर के प्लान के लिए साइन-अप्स को रोक दिया,

0:24 क्योंकि Astra ने सर्वर खा लिए। और शुक्रवार को राइट-अप Hacker News के पहले पेज पर पहुँच गया, एक पोस्ट के कुछ पंक्तियों नीचे जिसमें Hacker News से AI के बारे में पोस्ट करना बंद करने का अनुरोध किया गया था। इस वीडियो में: एक-डेढ़ दिन का अनसुपरवाइज्ड Astra क्या उत्पन्न करता है, दो माप जो स्लोप को एक संख्या में बदलते हैं, क्यों उनहत्तर हजार सितारों वाला एक उपकरण आपका बिल बड़ा बनाता है, और कैसे Hacker News ने AI का उपयोग करके AI को फ़िल्टर करने की कोशिश की। AI का उपयोग करके AI को फ़िल्टर करने की कोशिश की। आज शुक्रवार, 11 सितंबर है, और यह The Daily Diff है।

0:53 फैक्ट्री। एक प्रॉम्प्ट: वर्चुअल थ्रेड्स और लेक्सिकल के साथ एक Python बनाएं। स्कोपिंग। Astra ने अपने नोट्स रखे, अपने सबएजेंट्स को स्पिन किया, और तब तक चला जब तक आर्मिन ने प्लग नहीं निकाला, एक-डेढ़ दिन और लगभग बारह सौ डॉलर बाद में। उनहत्तर कमिट्स, तो प्रति कमिट पंद्रह और आधा डॉलर, जो मोटे तौर पर एक मानव शुल्क लेता है, सिवाय इसके कि मानव अंततः रुक जाता है। कोड कहानी है। एडिट टूल के बजाय, Astra C फ़ाइलों को Python heredocs को पाइप करके पैच करता है जो फ़ाइल को पढ़ता है, एक फ़ंक्शन को स्ट्रिंग-रिप्लेस करता है, और उसे वापस लिखता है।

1:20 एक Windows टेस्ट चलाने के लिए उसने Python लिखा जिसने Node को स्पॉन किया जिसने PowerShell को स्पॉन किया, एक पासपोर्ट के साथ एक कॉल स्टैक। उसने जो यूनिट टेस्ट्स कमिट किए उनमें बिल्कुल भी व्हाइटस्पेस नहीं है, क्योंकि इंडेंटेशन के बिना वे टोकन में दस प्रतिशत सस्ते होते हैं। और कार्य सूची एक, दो, तीन से टास्क 8b2c2b2b चेकपॉइंट एक पर चली गई, जिससे आपको पता चलता है कि इंटर्न बहुत देर तक अकेला रहा है। आर्मिन का सिद्धांत: मॉडल को लंबे कार्यों को पूरा करने के लिए पुरस्कृत किया जाता है और गंदे कोड के लिए मुश्किल से दंडित किया जाता है, इसलिए टोकन-गोल्फेड टूल कॉल कोडबेस में लीक हो जाते हैं,

1:48 और जितने कम इंसान देखते हैं, उतना ही कम मायने रखता है। उसने उस अनुभाग का शीर्षक दिया It's AGI If You Don't Look। Hacker News ने अर्थशास्त्र जोड़ा: अधिक कोड का मतलब इसे बनाए रखने के लिए अधिक टोकन, जो स्लोप को एक बग नहीं बल्कि एक सदस्यता बनाता है। क्या आप स्लोप को माप सकते हैं? आर्मिन की अपनी कंपनी ने इस सप्ताह कोशिश की। Earendil ने SlopCodeBench नंबर चलाए: एजेंट कोड लगभग दोगुना शब्दाडंबरपूर्ण और मानव रेपो की तुलना में दोगुना खराब है जिसकी तुलना की गई है,

2:10 और जब बेंचमार्क चेकपॉइंट्स के बीच एजेंट की मेमोरी को मिटा देता है, उनके द्वारा परीक्षण किए गए हर मॉडल के लिए सख्त पास दर शून्य है। सबसे विश्वसनीय स्लोप मेट्रिक उन्हें कच्ची लाइन गणना मिली, जो किसी के भी इसके लिए अनुकूलन करते ही काम करना बंद कर देती है, तो कृपया मॉडलों को मत बताना। फिर वॉलेट। RTK में उनहत्तर हजार GitHub सितारे और YouTube थंबनेल हैं जो आपके Claude Code बिल को आधा करने का वादा करते हैं; यह एजेंट के इसे पढ़ने से पहले टर्मिनल आउटपुट को संपीड़ित करता है। Quesma ने इसे Terminal-Bench पर पंद्रह सौ डॉलर के टोकन के लिए चलाया।

2:34 Quesma ने इसे Terminal-Bench पर पंद्रह सौ डॉलर के टोकन के लिए चलाया। Fable के साथ बिल पांच प्रतिशत गिर गया, लगभग सभी एक कार्य से; DeepSeek के साथ औसत कार्य सत्रह प्रतिशत अधिक महंगा हो गया। इस बीच RTK के अपने काउंटर ने उनहत्तर प्रतिशत बचाए जाने की रिपोर्ट की, क्योंकि यह हटाई गई बाइट्स को गिनता है, न कि अतिरिक्त टर्न के कारण: एक स्मार्ट मीटर जो पड़ोसी को बिल भेजता है। और एक संस्करण बग ने find को एक कमांड में बदल दिया जो विफल रहा, लगातार तीन सौ उनहत्तर बार, नौ गुना कीमत पर।

3:01 टोकन को मारने वाले उपकरण में एक लूप होता है। बाढ़ ही। Cognition का SWE-2 Kimi K3 है, खुला चीनी मॉडल, पोस्ट-ट्रेन्ड जब तक यह Cognition के अपने बेंचमार्क पर Fable 5.1 से मेल नहीं खाता, एक-तिहाई कीमत पर; Hacker News: सभी अमेरिकी AI मॉडल मूल रूप से ट्रेच कोट में Kimi क्यों हैं। एक ट्रेच कोट में। Terminal-Bench 2.1 पर यह पूरी तालिका में शीर्ष पर है; Terminal-Bench 4 पर, वह जिसे किसी ने अभी तक याद नहीं किया है, यह Fable के छप्पन के मुकाबले सत्ताईस स्कोर करता है,

3:28 तो स्लाइड-डेक बेंचमार्क पर सबसे अच्छा कॉलम वह परीक्षा है जिसे हर कोई पहले ही पास कर चुका है। Cognition ने Devin Voice की भी घोषणा की, आपका पसंदीदा AI सॉफ्टवेयर इंजीनियर को अभी एक लैंडलाइन मिला है, क्योंकि एकमात्र चीज जो एजेंटिक कोडिंग में गायब थी, वह होल्ड संगीत था। OpenAI, उसी दिन: एजेंट्स API, जो एक सेवा के रूप में बेचा जाने वाला Codex हार्नेस है। OpenAI सैंडबॉक्स चलाता है, केवल अमेरिकी डेटा रेजिडेंसी, कोई शून्य-डेटा-प्रतिधारण नहीं, तो एजेंट आपके कोडबेस को बिल्कुल वैसे ही याद रखता है जैसे ChatGPT करता है। फिर OpenAI ने दो सौ डॉलर के प्रो प्लान के लिए साइन-अप्स को रोक दिया,

3:57 क्योंकि Astra की मांग, उद्धरण, अभूतपूर्व है: वेटलिस्ट वाला पहला उत्पाद अधिक भुगतान करने के लिए। आर्मिन ने अपनी फैक्ट्री पर एक पूर्ण रीसेट जला दिया। वही मांग है। जो हमें शुक्रवार के Ask HN पर लाता है: क्या हम कृपया AI समाचारों की बाढ़ को सीमित कर सकते हैं, छह सौ छप्पन पॉइंट, क्योंकि, उद्धरण, हर बार जब OpenAI या Anthropic में कोई फ़ार्ट करता है, तो एक शीर्ष-दस पोस्ट होती है।

4:17 जवाब फिल्टर थे: hcker डॉट न्यूज़ एक BERT क्लासिफायर के साथ AI कहानियों को हटाता है आठ हजार उदाहरणों पर प्रशिक्षित, AI को हटाने के लिए AI, ग्रास-फेड; और एक uBlock रेगुलर एक्सप्रेशन जो A-I केस-असंवेदनशील रूप से मेल खाता है, भी हटा देता है ईमेल, दैनिक, मुख्य, डोमेन और ट्रेन, तो रेगुलर एक्सप्रेशन, हमेशा की तरह, खलनायक है। उसी दोपहर, चार सौ पंद्रह टिप्पणियाँ Claude सपोर्ट पेज के बारे में बहस की कह रहे हैं कि Claude अठारह-प्लस है।

4:38 पेज मई का है। कुछ भी नहीं बदला। यहां तक कि AI समाचार जो समाचार नहीं है, वह भी समाचार है, जो, निष्पक्ष होने के लिए, मेरा व्यवसाय मॉडल भी है। यदि आप इसे सुनने के बजाय पढ़ना पसंद करते हैं, तो diff हर सुबह आपके इनबॉक्स में आता है — daily diff डॉट dev पर मुफ्त, लिंक नीचे। यह, अनिवार्य रूप से, AI समाचार है। तो — पैंतीस घंटे की सॉफ्टवेयर फैक्ट्री पर आज का फैसला: REVERT। उनहत्तर कमिट्स जिन्हें किसी ने नहीं पढ़ा वह कोडबेस नहीं है, यह एक git के साथ एक दायित्व है

5:04 लॉग; Astra प्रभावशाली है, और फैक्ट्री वह हिस्सा है जिसे रोल बैक करना है। और आज के लिए यही diff है। मैं Axrisi से निको हूँ। जिम्मेदारी से मर्ज करें।

## स्रोत

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
