+− THE DAILY DIFFdev & AI news
REVERT

आर्मिन रोनाचरने GPT-6 अस्त्रला ३५ तास एकटे सोडले.

आर्मिन रोनाचर (फ्लास्क, जिंजा) यांनी GPT-6 अस्त्रला एक सूचना दिली आणि ३५ तास एकटे सोडले: सुमारे एक अब्ज टोकन, सुमारे $1,200, ७९ कमिट, ७५,००० ओळी — आणि "अगदी काहीही उपयुक्त नाही".

आर्मिन रोनाचर (फ्लास्क, जिंजा) यांनी GPT-6 अस्त्रला एक सूचना दिली आणि ३५ तास एकटे सोडले: सुमारे एक अब्ज टोकन, सुमारे $1,200, ७९ कमिट, ७५,००० ओळी — आणि "अगदी काहीही उपयुक्त नाही". तिने परत मिळवलेला कोड हीच कथा आहे: पायथन स्ट्रिंग-स्प्लाइसिंग हेरेडॉक्सने पॅच केलेल्या C फाइल्स, पायथन नोड स्पॉनिंग पॉवरशेल तयार करत आहे, व्हाइटस्पेस काढून टाकलेले युनिट टेस्ट्स कारण ते टोकनमध्ये १०% स्वस्त आहेत. दोन मापन त्याला दुजोरा देतात: एरेंडिलचे स्लोपकोडबेंच नंबर (एजंट कोड मानवी रेपोसपेक्षा सुमारे दुप्पट अधिक विस्तृत आणि खराब झालेला, ०% कठोर पास दर) आणि क्वेस्माचे RTK चे $1,500 चे बेंचमार्क (७९k तारे, त्याच्या स्वतःच्या काउंटरवर "८९% टोकन वाचले", डीपसीकसह प्रति कार्यावर +१७%). तसेच: कॉग्निशनचे SWE-2 (ट्रेन्च कोटमधील किमी K3, टर्मिनल-बेंच २.१ वर ९२.८ विरुद्ध टर्मिनल-बेंच ४ वर २७.३), OpenAI चे एजंट्स API आणि थांबलेले $200 प्रो साइन-अप, आणि शुक्रवार हॅकर न्यूसने कमी AI बातम्यांची मागणी केली. निकाल: REVERT.

लिखित आवृत्ती वाचा (इंग्रजी) ↗

या व्हिडिओमध्ये काय समाविष्ट आहे

  • आर्मिन रोनाचर: GPT-6 अस्त्रचे ३५ तास दुर्लक्षित, ~$1,200, ७९ कमिट, +७५k ओळी, काहीही पाठवले नाही
  • एरेंडिल / स्लोपकोडबेंच: एजंट कोड मानवी रेपोसपेक्षा ~2 पट अधिक विस्तृत आणि खराब झाला; कठोर पास दर 0%
  • क्वेस्मा: RTK ने 89% टोकन वाचवल्याची नोंद केली, परंतु डीपसीकसह टर्मिनल-बेंच खर्च 17% वाढतो; एक रीराइट लूप सलग 339 वेळा अयशस्वी झाला
  • कॉग्निशन SWE-2: किमी K3 मधून पोस्ट-प्रशिक्षित, फ्रंटियरकोडवर फॅबल 5.1 शी एक तृतीयांश किमतीत जुळतो; TB 2.1 92.8 विरुद्ध TB 4 27.3; डेव्हिन व्हॉइस
  • OpenAI एजंट्स API (सेवा म्हणून कोडक्स हार्नेस, केवळ US, ZDR नाही); अस्त्र मागणीमुळे $200 प्रो साइन-अप थांबवले

अनुवादित प्रतिलेख

मूळ इंग्रजी निवेदनातून अनुवादित. उपलब्ध ऑडिओ आणि मथळे YouTube द्वारे नियंत्रित आहेत.

0:00 आर्मिन रोनाचर, ज्याने फ्लास्क लिहिले, त्याने GPT-6 अस्त्रला एकच सूचना दिली आणि ते पस्तीस तास एकटे सोडले. ते पंच्याहत्तर हजार ओळींच्या कोडसह परत आले आणि, त्याच्या शब्दात, "अगदी काहीही उपयुक्त नाही", ज्यामुळे ते सर्वात वास्तववादी बनते आजपर्यंत तयार केलेला सॉफ्टवेअर कारखाना. त्याने बुधवारी लेख पोस्ट केला. गुरुवारी, कॉग्निशनने SWE-2 पाठवले, आणि OpenAI ने एक एजंट्स API पाठवले आणि त्याच्या दोनशे डॉलरच्या योजनेसाठी साइन-अप थांबवले,

0:24 कारण अस्त्रने सर्व्हर खाल्ले. आणि शुक्रवारी हा लेख हॅकर न्यूजच्या पहिल्या पानावर पोहोचला, हॅकर न्यूसला कृपया AI बद्दल पोस्ट करणे थांबवण्यास सांगणाऱ्या पोस्टच्या काही ओळी खाली. या व्हिडिओमध्ये: दीड दिवसाचे अनियंत्रित अस्त्र काय तयार करते, गोंधळाचे संख्यात्मक मापन करणारे दोन मापन, एकोणऐंशी हजार तारे असलेले साधन तुमचे बिल का वाढवते, आणि हॅकर न्यूजने AI वापरून AI फिल्टर करण्याचा प्रयत्न कसा केला. AI वापरून AI. आज शुक्रवार, ११ सप्टेंबर आहे, आणि हे आहे The Daily Diff.

0:53 कारखाना. एक सूचना: व्हर्च्युअल थ्रेड्स आणि लेक्सिकल स्कोपिंगसह पायथन तयार करा. अस्त्रने स्वतःच्या नोंदी ठेवल्या, स्वतःचे सबएजंट तयार केले, आणि आर्मिनने प्लग काढेपर्यंत चालले, दीड दिवस आणि सुमारे बाराशे डॉलर नंतर. एकोणऐंशी कमिट, म्हणजे प्रति कमिट पंधरा आणि दीड डॉलर, जी मानवी व्यक्तीच्या शुल्कासारखीच आहे, फक्त मानवी व्यक्ती शेवटी थांबते. कोड हीच कथा आहे. एडिट टूलऐवजी, अस्त्र C फाइल्सना पायथन हेरेडॉक्स पाइप करून पॅच करते जे फाइल वाचतात, एका फंक्शनमध्ये स्ट्रिंग-रिप्लेस करतात आणि ते परत लिहितात.

1:20 एक विंडोज टेस्ट चालवण्यासाठी त्याने पायथन लिहिले ज्याने नोड स्पॉन केले ज्याने पॉवरशेल स्पॉन केले, पासपोर्टसह एक कॉल स्टॅक. त्याने कमिट केलेल्या युनिट टेस्ट्समध्ये कोणतीही व्हाइटस्पेस नाही, कारण इंडेंटेशनशिवाय ते टोकनमध्ये दहा टक्के स्वस्त आहेत. आणि कार्य सूची एक, दोन, तीन वरून कार्य 8b2c2b2b चेकपॉइंट एकपर्यंत सरकली, जेव्हा तुम्हाला कळते की इंटर्न खूप काळ एकटा होता. आर्मिनचा सिद्धांत: मॉडेलला लांब कार्ये पूर्ण करण्यासाठी पुरस्कृत केले जाते आणि कुरुप कोडसाठी क्वचितच शिक्षा दिली जाते, त्यामुळे टोकन-गोल्फ केलेले टूल कॉल्स कोडबेसमधून बाहेर पडतात,

1:48 आणि जितके कमी मानव पाहतात, तितके ते कमी महत्त्वाचे असते. त्याने त्या विभागाला "ते AGI आहे जर तुम्ही पाहिले नाही" असे शीर्षक दिले. हॅकर न्यूजने अर्थशास्त्र जोडले: अधिक कोड म्हणजे ते राखण्यासाठी अधिक टोकन, जे गोंधळाला बग नव्हे तर सदस्यता बनवते. तुम्ही गोंधळ मोजू शकता का? आर्मिनच्या स्वतःच्या कंपनीने या आठवड्यात प्रयत्न केला. एरेंडिलने स्लोपकोडबेंच नंबर चालवले: एजंट कोड मानवी रेपोसपेक्षा सुमारे दुप्पट विस्तृत आणि दुप्पट खराब झाला आहे ज्याच्याशी त्याची तुलना केली जाते,

2:10 आणि जेव्हा बेंचमार्क चेकपॉइंट्स दरम्यान एजंटची मेमरी पुसून टाकतो, त्यांनी तपासलेल्या प्रत्येक मॉडेलचा कठोर पास दर शून्य आहे. त्यांना सापडलेला सर्वात विश्वसनीय गोंधळ मेट्रिक म्हणजे कच्ची ओळ गणना, जो कोणीही त्यासाठी ऑप्टिमाइझ करताच काम करणे थांबवतो, म्हणून कृपया मॉडेल्सना सांगू नका. मग वॉलेट. RTK ला एकोणऐंशी हजार GitHub तारे आणि YouTube लघुप्रतिमा आहेत जे तुमचे क्लॉड कोड बिल अर्धे करण्याचे वचन देतात; ते एजंटने वाचण्यापूर्वी टर्मिनल आउटपुट संकुचित करते.

2:34 क्वेस्माने पंधराशे डॉलरच्या टोकनसाठी टर्मिनल-बेंचवर ते चालवले. फॅबलसह बिल पाच टक्क्यांनी कमी झाले, जवळजवळ सर्व एका कार्यामुळे; डीपसीकसह सरासरी कार्य सतरा टक्के अधिक महाग झाले. दरम्यान RTK च्या स्वतःच्या काउंटरने एकोणऐंशी टक्के बचत झाल्याची नोंद केली, कारण ते काढलेल्या बाइट्सची गणना करते, अतिरिक्त फेऱ्यांची नाही: एक स्मार्ट मीटर जो शेजाऱ्याला बिल देतो. आणि एका आवृत्ती बगने find ला एका कमांडमध्ये पुन्हा लिहिले जे अयशस्वी झाले, सलग तीनशे एकोणचाळीस वेळा, नऊ पट किमतीत.

3:01 टोकन नष्ट करणाऱ्या साधनात एक लूप आहे. पूर स्वतः. कॉग्निशनचे SWE-2 हे किमी K3 आहे, खुले चीनी मॉडेल, पोस्ट-प्रशिक्षित होईपर्यंत ते कॉग्निशनच्या स्वतःच्या बेंचमार्कवर फॅबल 5.1 शी जुळते एक तृतीयांश किमतीत; हॅकर न्यूज: सर्व अमेरिकन AI मॉडेल्स मूलतः ट्रेन्च कोटमधील किमी का आहेत. ट्रेन्च कोटमधील किमी का आहेत. टर्मिनल-बेंच 2.1 वर ते संपूर्ण टेबलमध्ये अव्वल आहे; टर्मिनल-बेंच 4 वर, जे अजून कोणालाही आठवत नाही, त्यात फॅबलच्या छप्पन्न विरुद्ध सत्तावीस गुण आहेत,

3:28 म्हणून स्लाइड-डेक बेंचमार्कवर सर्वोत्तम स्तंभ म्हणजे ती परीक्षा जी प्रत्येकाने आधीच पास केली आहे. कॉग्निशनने डेविन व्हॉइसचीही घोषणा केली, तुमचा आवडता AI सॉफ्टवेअर इंजिनियरला नुकतीच लँडलाइन मिळाली आहे, कारण एजंटिक कोडिंगला एकच गोष्ट कमी होती ती म्हणजे होल्ड म्युझिक. OpenAI, त्याच दिवशी: एजंट्स API, जे सेवा म्हणून विकले जाणारे कोडक्स हार्नेस आहे. OpenAI सँडबॉक्स चालवते, केवळ US डेटा रेसिडेन्सी, शून्य-डेटा-रिटेंशन नाही, त्यामुळे एजंट तुमच्या कोडबेसची ChatGPT इतकीच अचूकपणे आठवण ठेवतो. मग OpenAI ने दोनशे डॉलरच्या प्रो योजनेसाठी साइन-अप थांबवले,

3:57 कारण अस्त्रची मागणी, अवतरण, "अभूतपूर्व" आहे: वेटलिस्ट असलेले पहिले उत्पादन अधिक पैसे देण्यासाठी. आर्मिनने त्याच्या कारखान्यावर पूर्ण रीसेट बर्न केला. तोच मागणी आहे. यामुळे आपण शुक्रवारच्या Ask HN कडे येतो: कृपया आपण AI बातम्यांचा पूर मर्यादित करू शकतो का, सहाशे छप्पन्न गुण, कारण, अवतरण, "जेव्हा OpenAI किंवा अँथ्रोपिकमधील कोणीतरी फार्ट करतो, तेव्हा एक टॉप-टेन पोस्ट असते."

4:17 प्रत्युत्तरे फिल्टर्स होती: hcker dot news आठ हजार उदाहरणांवर प्रशिक्षित BERT क्लासिफायर वापरून AI कथा काढून टाकते, AI ला AI हटवण्यासाठी, ग्रास-फेड; आणि A-I ला केस-इनसेन्सिटिव्हली जुळवणारे uBlock रेग्युलर एक्सप्रेशन ईमेल, दैनिक, मुख्य, डोमेन आणि ट्रेन देखील हटवते, त्यामुळे रेग्युलर एक्सप्रेशन, नेहमीप्रमाणे, खलनायक आहे. त्याच दुपारी, चारशे पंधरा टिप्पण्या क्लॉड सपोर्ट पेजबद्दल वाद घालत होत्या क्लॉड अठरा-अधिक असल्याचे सांगत.

4:38 पेज मे महिन्याचे आहे. काहीही बदलले नाही. ज्या AI बातम्या बातम्या नाहीत त्याही बातम्या आहेत, जे, प्रामाणिकपणे, माझा व्यवसाय मॉडेल देखील आहे. तुम्हाला मी बोलण्याऐवजी हे वाचायचे असल्यास, diff तुमच्या इनबॉक्समध्ये दररोज सकाळी येते — thedailydiff.dev वर विनामूल्य, लिंक खाली. ते, अपरिहार्यपणे, AI बातम्या आहेत. तर — पस्तीस तासांच्या सॉफ्टवेअर कारखान्यावरील आजचा निकाल: REVERT. कोणीही न वाचलेले एकोणऐंशी कमिट हा कोडबेस नाही, ती git लॉगसह एक जबाबदारी आहे;

5:04 अस्त्र प्रभावी आहे, आणि कारखाना हा भाग परत घेण्यासारखा आहे. आणि आजसाठी हेच diff आहे. मी Axrisi मधून निको आहे. जबाबदारीने विलीन करा.

स्रोत

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

संबंधित व्हिडिओ

daily · mr · ३० सप्टें, २०२६

OpenAI DevDay 2026: 20+ घोषणा, डॉट्सपासून GPT-6.1 Sol पर्यंत

OpenAI च्या DevDay 2026 कीनोटचे स्पष्टीकरण: डॉट्स (स्वतःच्या क्लाउड संगणकासह नेहमी-सक्रिय एजंट), ChatGPT Space आणि Pages, GPT-6.1 Sol $2 / $10 प्रति दशलक्ष टोकन दराने, Ultrafast आणि Pro 500 योजना, Dec

8:13 ↗
daily · mr · १ ऑक्टो, २०२६

जेमिनी 4 आर्गॉन हे Google चे सर्वोत्तम मॉडेल आहे. तुम्ही ते अजून वापरू शकत नाही.

Google ने जेमिनी 4 आर्गॉन, त्याचे नवीन फ्रंटियर मॉडेल घोषित केले, आणि केवळ विश्वसनीय सायबर डिफेंडर्सच ते वापरू शकतात. Google च्या स्वतःच्या 19-पंक्तींच्या बेंचमार्क टेबलमध्ये काय दाखवले आहे, स्वतंत्र

4:53 ↗
daily · mr · २ ऑक्टो, २०२६

Git चे नवीन हॅश डीफॉल्ट – याचा अर्थ काय

Git चे प्रस्तावित SHA-256 डीफॉल्ट नवीन रिपॉझिटरीजसाठी सुसंगतता मर्यादा निर्माण करते. आम्ही अधिकृत योजना, स्कॉट चकॉनचा आक्षेप आणि कार्यशील GitHub पूर्वावलोकन अपवाद तपासतो, त्यानंतर Pi 1.0 आणि SvelteKit

4:52 ↗
daily · mr · ३० सप्टें, २०२६

Claude nerf कसा ओळखायचा (वास्तविक डेटासह)

प्रत्येक लॉन्च झाल्यावर काही आठवड्यांनी Claude अधिक मूर्ख बनतो असे लोक म्हणतात. एका विकासकाने Claude Opus 5.5 ला लॉन्च आठवड्यापासून 30 दिवसांच्या घड्याळावर ठेवले, ज्यात प्रश्न गोठवले होते, Claude Code

5:07 ↗