Армин Ронахер остави GPT-6 Astra сама за 35 часа.
Армин Ронахер (Flask, Jinja) даде на GPT-6 Astra един промпт и я остави сама за 35 часа: около милиард токена, около $1,200, 79 коммита, 75,000 реда — и "абсолютно нищо ценно".
Армин Ронахер (Flask, Jinja) даде на GPT-6 Astra един промпт и я остави сама за 35 часа: около милиард токена, около $1,200, 79 коммита, 75,000 реда — и "абсолютно нищо ценно". Кодът, който възстанови, е историята: C файлове, пачнати чрез Python string-splicing heredocs, Python, който стартира Node, който стартира PowerShell, модулни тестове с премахнати интервали, защото е 10% по-евтино като токени. Две измервания го подкрепят: числата от SlopCodeBench на Earendil (кодът на агента е около два пъти по-сложен и ерозирал от човешките репота, 0% строг процент на преминаване) и бенчмаркът на Quesma за $1,500 на RTK (79k звезди, "89% спестени токени" по собствен брояч, +17% на задача с DeepSeek). Също така: SWE-2 на Cognition (Kimi K3 в шлифер, 92.8 на Terminal-Bench 2.1 срещу 27.3 на Terminal-Bench 4), Agents API на OpenAI и спрени регистрации за $200 Pro, и петъчната Hacker News поиска по-малко новини за AI. Присъда: REVERT.
Прочетете писменото издание (английски) ↗
Какво обхваща този видеоклип
- Армин Ронахер: 35 часа на незабелязана GPT-6 Astra, ~$1,200, 79 коммита, +75k реда, нищо не е пуснато
- Earendil / SlopCodeBench: кодът на агента е ~2× по-сложен и ерозирал от човешките репота; строг процент на преминаване 0%
- Quesma: RTK отчита 89% спестени токени, но разходите за Terminal-Bench нарастват със 17% с DeepSeek; цикълът на презаписване се провали 339 пъти подред
- Cognition SWE-2: пост-трениран от Kimi K3, съвпада с Fable 5.1 на FrontierCode на една трета от цената; TB 2.1 92.8 срещу TB 4 27.3; Devin Voice
- OpenAI Agents API (Codex harness като услуга, само за САЩ, без ZDR); регистрациите за $200 Pro са спрени поради търсенето на Astra
Преведен препис
Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.
0:00 Армин Ронахер, човекът, който написа Flask, даде на GPT-6 Astra един-единствен промпт и я остави сама за тридесет и пет часа. Тя се върна със седемдесет и пет хиляди реда код и, по неговите думи, абсолютно нищо ценно, което я прави най-реалистичната софтуерна фабрика, създавана някога. Той публикува доклада в сряда. В четвъртък Cognition пусна SWE-2, а OpenAI пусна Agents API и спря регистрациите за своя план от двеста долара,
0:24 защото Astra изяде сървърите. И в петък докладът достигна първа страница на Hacker News, няколко реда под публикация, която молеше Hacker News да спре да публикува за AI. В това видео: какво произвежда ден и половина ненадзиравана Astra, две измервания, които превръщат бъркотията в число, защо инструмент със седемдесет и девет хиляди звезди увеличава сметката ви, и как Hacker News се опита да филтрира AI, използвайки AI. Днес е петък, 11 септември, и това е The Daily Diff.
0:53 Фабриката. Един промпт: изграждане на Python с виртуални нишки и лексикално обхват. Astra водеше собствени бележки, стартира собствени под-агенти, и работеше, докато Армин не дръпна щепсела, ден и половина и около хиляда и двеста долара по-късно. Седемдесет и девет коммита, така че петнадесет и половина долара на коммит, което е приблизително колкото таксува човек, само че човекът в крайна сметка спира. Кодът е историята. Вместо инструмента за редактиране, Astra пачва C файлове, като предава Python heredocs, които четат файла, заместват функция и го записват обратно.
1:20 За да изпълни един Windows тест, той написа Python, който стартира Node, който стартира PowerShell, стек на извикванията с паспорт. Модулните тестове, които е коммитна, нямат никакви интервали, защото без отстъпи са десет процента по-евтини като токени. И списъкът със задачи се отклони от едно, две, три до задача 8b2c2b2b контролна точка едно, което е начин да разберете, че стажантът е бил сам твърде дълго. Теорията на Армин: моделът е възнаграден за завършване на дълги задачи и почти не е наказан за грозен код, така че извикванията на инструменти, оптимизирани за токени, изтичат в кодовата база,
1:48 и колкото по-малко хора гледат, толкова по-малко значение има. Той озаглави този раздел „Това е AGI, ако не гледате“. Hacker News добави икономическия аспект: повече код означава повече токени за поддържането му, което прави бъркотията не бъг, а абонамент. Можете ли да измерите бъркотията? Собствената компания на Армин опита това тази седмица. Earendil изчисли числата на SlopCodeBench: кодът на агента е около два пъти по-многословен и два пъти по-ерозирал от човешките репозитори, с които е сравняван,
2:10 и когато бенчмаркът изтрива паметта на агента между контролните точки, стриктният процент на преминаване за всеки тестван модел е нула. Най-надеждният показател за бъркотия, който откриха, беше суровият брой редове, който спира да работи в момента, в който някой оптимизира за него, така че, моля, не казвайте на моделите. После портфейлът. RTK има седемдесет и девет хиляди звезди в GitHub и миниатюри в YouTube, обещаващи да намалят наполовина сметката ви за Claude Code; той компресира изхода на терминала, преди агентът
2:34 да го прочете. Quesma го пусна на Terminal-Bench за хиляда и петстотин долара токени. С Fable сметката падна с пет процента, почти изцяло от една задача; с DeepSeek средната задача стана със седемнадесет процента по-скъпа. Междувременно собственият брояч на RTK отчете осемдесет и девет процента спестени, защото брои премахнати байтове, а не причинени допълнителни завъртания: интелигентен електромер, който таксува съседа. И една грешка във версията пренаписа find в команда, която се провали, триста тридесет и девет пъти подред, на девет пъти по-висока цена.
3:01 Инструментът, който убива токени, има цикъл. Самият потоп. SWE-2 на Cognition е Kimi K3, отвореният китайски модел, пост-трениран, докато не съвпадне с Fable 5.1 на собствения бенчмарк на Cognition на една трета от цената; Hacker News: защо всички американски AI модели са по същество Kimi в шлифер. На Terminal-Bench 2.1 той е на върха на цялата таблица; на Terminal-Bench 4, този, който никой още не е запомнил, той отбелязва двадесет и седем срещу петдесет и шест на Fable,
3:28 така че на бенчмарковете на слайд-дековете най-добрата колона е изпитът, който всички вече са издържали. Cognition също така обяви Devin Voice, вашият любим AI софтуерен инженер току-що се сдоби със стационарен телефон, защото единственото, което липсваше на агентното кодиране, беше музика за изчакване. OpenAI, същия ден: Agents API, който е системата Codex, продавана като услуга. OpenAI управлява пясъчника, само за данни в САЩ, без запазване на данни с нулев капацитет, така че агентът помни вашата кодова база точно толкова добре, колкото ChatGPT. След това OpenAI спря регистрациите за плана Pro от двеста долара,
3:57 защото търсенето на Astra е, цитирам, безпрецедентно: първият продукт със списък на чакащи да плати повече. Армин направи пълен рестарт на фабриката си. Той е търсенето. Което ни води до петъчната Ask HN: можем ли, моля, да ограничим потока от новини за AI, шестстотин петдесет и шест точки, защото, цитирам, всеки път, когато някой от OpenAI или Anthropic пръдне, има публикация в топ десет.
4:17 Отговорите бяха филтри: hcker dot news премахва AI истории с BERT класификатор, обучен на осем хиляди примера, AI за изтриване на AI, хранени с трева; и uBlock регулярен израз, който съвпада с A-I, без да отчита регистъра, също изтрива имейл, ежедневно, главно, домейн и влак, така че регуларният израз, както винаги, е злодеят. Същия следобед, четиристотин петнадесет коментара спореха за страница за поддръжка на Claude, която казваше, че Claude е за осемнадесет плюс.
4:38 Страницата е датирана от май. Нищо не се промени. Дори новините за AI, които не са новини, са новини, което, честно казано, е и моят бизнес модел. Ако предпочитате да прочетете това, отколкото да ме чуете да го казвам, диференциалът пристига във входящата ви поща всяка сутрин – безплатно на the daily diff dot dev, линк по-долу. Това е, неизбежно, новина за AI. И така – днешната присъда за тридесет и пет часовата софтуерна фабрика: REVERT. Седемдесет и девет коммита, които никой не е прочел, не са кодова база, това е пасив с git
5:04 лог; Astra е впечатляваща, а фабриката е частта за връщане назад. И това е диференциалът за днес. Аз съм Нико от Axrisi. Обединявайте отговорно.
Източници
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



