Armin Ronacher liet GPT-6 Astra 35 uur alleen.
Armin Ronacher (Flask, Jinja) gaf GPT-6 Astra één prompt en liet het 35 uur alleen: ongeveer een miljard tokens, ongeveer $1.200, 79 commits, 75.000 regels — en "absoluut niets van waarde".
Armin Ronacher (Flask, Jinja) gaf GPT-6 Astra één prompt en liet het 35 uur alleen: ongeveer een miljard tokens, ongeveer $1.200, 79 commits, 75.000 regels — en "absoluut niets van waarde". De code die het terugkreeg is het verhaal: C-bestanden gepatcht met Python string-splicing heredocs, Python dat Node spawnt dat PowerShell spawnt, unit tests waarbij de witruimte is verwijderd omdat het 10% goedkoper is in tokens. Twee metingen ondersteunen hem: Earendils SlopCodeBench-nummers (agentcode ongeveer twee keer zo breedsprakig en geërodeerd als menselijke repositories, 0% strikt slagingspercentage) en Quesma's $1.500 benchmark van RTK (79k sterren, "89% tokens bespaard" op zijn eigen teller, +17% per taak met DeepSeek). Ook: Cognition's SWE-2 (Kimi K3 in een trenchcoat, 92.8 op Terminal-Bench 2.1 vs 27.3 op Terminal-Bench 4), OpenAI's Agents API en gepauzeerde $200 Pro aanmeldingen, en de vrijdag waarop Hacker News vroeg om minder AI-nieuws. Oordeel: REVERT.
Lees de geschreven editie (Engels) ↗
Wat deze video behandelt
- Armin Ronacher: 35 uur onbewaakte GPT-6 Astra, ~$1.200, 79 commits, +75k regels, niets geleverd
- Earendil / SlopCodeBench: agentcode ~2× zo breedsprakig en geërodeerd als menselijke repositories; strikt slagingspercentage 0%
- Quesma: RTK meldt 89% bespaarde tokens, maar de kosten van Terminal-Bench stijgen met 17% met DeepSeek; een herschrijflus mislukte 339 keer op rij
- Cognition SWE-2: na-getraind van Kimi K3, komt overeen met Fable 5.1 op FrontierCode tegen een derde van de prijs; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (de Codex-harnas als service, alleen VS, geen ZDR); $200 Pro-aanmeldingen gepauzeerd vanwege Astra-vraag
Vertaald transcript
Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.
0:00 Armin Ronacher, de man die Flask schreef, gaf GPT-6 Astra een enkele prompt en liet het vijfendertig uur alleen. Het kwam terug met vijfenzeventigduizend regels code en, in zijn woorden, absoluut niets van waarde, wat het de meest realistische softwarefabriek ooit maakt. Hij plaatste de notitie op woensdag. Op donderdag verscheepte Cognition SWE-2, en OpenAI verscheepte een Agents API en pauzeerde aanmeldingen voor zijn tweehonderd-dollar-plan,
0:24 omdat Astra de servers opvrat. En op vrijdag bereikte de notitie de voorpagina van Hacker News, een paar rijen onder een bericht waarin Hacker News werd gevraagd om alsjeblieft niet meer over AI te posten. In deze video: wat anderhalve dag onbeheerde Astra produceert, twee metingen die knoeiboel in een getal veranderen, waarom een tool met negenenzeventigduizend duizend sterren je rekening groter maakt, en hoe Hacker News probeerde AI te filteren, met behulp van AI. Het is vrijdag 11 september, en dit is The Daily Diff.
0:53 De fabriek. Eén prompt: bouw een Python met virtuele threads en lexicale bereik. Astra hield zijn eigen notities bij, startte zijn eigen subagents, en draaide totdat Armin de stekker eruit trok, anderhalve dag en ongeveer twaalfhonderd dollar later. Negenenzeventig commits, dus vijftien en een halve dollar per commit, wat ongeveer is wat een mens vraagt, behalve dat de mens uiteindelijk stopt. De code is het verhaal. In plaats van het bewerkingsprogramma, patcht Astra C-bestanden door Python-heredocs te pijpen die het bestand lezen, een functie erin string-vervangen en het terugschrijven.
1:20 Om één Windows-test uit te voeren, schreef het Python dat Node opstartte dat PowerShell opstartte, een aanroepstapel met een paspoort. De unit tests die het heeft gecommit hebben helemaal geen witruimte, want zonder inspringing zijn ze tien procent goedkoper in tokens. En de takenlijst verschoof van één, twee, drie naar taak 8b2c2b2b controlepunt één, en zo weet je dat de stagiair te lang alleen is geweest. Armins theorie: het model wordt beloond voor het voltooien van lange taken en nauwelijks gestraft voor lelijke code, dus getokeniseerde toolaanroepen lekken in de codebase,
1:48 en hoe minder mensen kijken, hoe minder het uitmaakt. Hij noemde dat gedeelte Het is AGI als je niet kijkt. Hacker News voegde de economie toe: meer code betekent meer tokens om het te onderhouden, wat knoeiboel niet tot een bug maar tot een abonnement maakt. Kun je knoeiboel meten? Armins eigen bedrijf probeerde het deze week. Earendil voerde de SlopCodeBench-nummers uit: agentcode is ongeveer twee keer zo breedsprakig en twee keer zo geërodeerd als de menselijke repositories waarmee het wordt vergeleken,
2:10 en wanneer de benchmark het geheugen van de agent tussen controlepunten wist, is het strikte slagingspercentage voor elk model dat ze testten nul. De meest betrouwbare knoeiboel-metriek die ze vonden, was het onbewerkte regelaantal, wat stopt met werken zodra iemand ervoor optimaliseert, dus vertel het de modellen alsjeblieft niet. Dan de portemonnee. RTK heeft negenenzeventigduizend GitHub-sterren en YouTube-thumbnails die beloven je Claude Code-rekening te halveren; het comprimeert de terminaluitvoer voordat de agent
2:34 het leest. Quesma draaide het op Terminal-Bench voor vijftienhonderd dollar aan tokens. Met Fable daalde de rekening met vijf procent, bijna allemaal door één taak; met DeepSeek werd de gemiddelde taak zeventien procent duurder. Ondertussen meldde RTK's eigen teller negenentachtig procent bespaard, omdat het verwijderde bytes telt, niet extra beurten veroorzaakt: een slimme meter die de buurman factureert. En een versiebug herschreef find naar een commando dat mislukte, driehonderdnegenendertig keer achter elkaar, tegen negen keer de prijs.
3:01 De tool die tokens doodt, heeft een lus. De overstroming zelf. Cognition's SWE-2 is Kimi K3, het open Chinese model, na-getraind totdat het overeenkomt met Fable 5.1 op Cognition's eigen benchmark tegen een derde van de prijs; Hacker News: waarom zijn alle Amerikaanse AI-modellen eigenlijk Kimi in een trenchcoat. Op Terminal-Bench 2.1 staat het bovenaan de hele tabel; op Terminal-Bench 4, degene die niemand nog heeft onthouden, scoort het zevenentwintig tegen Fable's zesenvijftig,
3:28 dus op de slide-deck benchmarks is de beste kolom het examen dat iedereen al heeft gehaald. Cognition kondigde ook Devin Voice aan, je favoriete AI-software engineer heeft nu een vaste lijn, want het enige wat agentic coding miste was wachtmuziek. OpenAI, dezelfde dag: de Agents API, wat de Codex-harnas is die als een service wordt verkocht. OpenAI runt de sandbox, alleen Amerikaanse gegevensresidentie, geen nul-gegevensretentie, dus de agent onthoudt je codebase precies zo goed als ChatGPT. Toen pauzeerde OpenAI de aanmeldingen voor het tweehonderd-dollar Pro-plan,
3:57 omdat de Astra-vraag, ik citeer, ongekend is: het eerste product met een wachtlijst om meer te betalen. Armin heeft een volledige reset uitgevoerd op zijn fabriek. Hij is de vraag. Wat ons brengt bij Vrijdag's Ask HN: kunnen we alsjeblieft de stroom AI-nieuws beperken, zeshonderdzesenvijftig punten, omdat, ik citeer, elke keer dat iemand bij OpenAI of Anthropic een scheet laat, er een top-tien post is.
4:17 De antwoorden waren filters: hcker dot news verwijdert AI-verhalen met een BERT classificeerder getraind op achtduizend voorbeelden, AI om AI te verwijderen, grasgevoerd; en een uBlock regex die A-I hoofdletterongevoelig matcht, verwijdert ook e-mail, dagelijks, hoofd, domein en trein, dus de regex, zoals altijd, is de schurk. Diezelfde middag, vierhonderdvijftien reacties discussieerden over een Claude supportpagina die zegt dat Claude achttien-plus is.
4:38 De pagina is gedateerd in mei. Er is niets veranderd. Zelfs het AI-nieuws dat geen nieuws is, is nieuws, wat, eerlijk gezegd, ook mijn businessmodel is. Als je dit liever leest dan mij het hoort zeggen, dan landt de diff elke ochtend in je inbox — gratis op the daily diff dot dev, link hieronder. Het is, onvermijdelijk, AI-nieuws. Dus – het oordeel van vandaag over de vijfendertig uur durende softwarefabriek: REVERT. Negenenzeventig commits die niemand heeft gelezen, is geen codebase, het is een aansprakelijkheid met een git
5:04 log; Astra is indrukwekkend, en de fabriek is het deel dat moet worden teruggedraaid. En dat is de diff voor vandaag. Ik ben Niko van Axrisi. Verantwoord samenvoegen.
Bronnen
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



