Armin Ronacher lämnade GPT-6 Astra ensam i 35 timmar.
Armin Ronacher (Flask, Jinja) gav GPT-6 Astra en prompt och lämnade den ensam i 35 timmar: ungefär en miljard tokens, cirka $1 200, 79 commits, 75 000 rader — och "absolut ingenting av värde".
Armin Ronacher (Flask, Jinja) gav GPT-6 Astra en prompt och lämnade den ensam i 35 timmar: ungefär en miljard tokens, cirka $1 200, 79 commits, 75 000 rader — och "absolut ingenting av värde". Koden den återhämtade är berättelsen: C-filer patchade av Python string-splicing heredocs, Python som startar Node som startar PowerShell, enhetstester med borttaget blanksteg eftersom det är 10 % billigare i tokens. Två mätningar styrker detta: Earendils SlopCodeBench-siffror (agentkod ungefär dubbelt så utförlig och eroderad som mänskliga repos, 0 % strikt godkänd frekvens) och Quesmas $1 500 benchmark av RTK (79k stjärnor, "89 % tokens sparade" på sin egen räknare, +17 % per uppgift med DeepSeek). Dessutom: Cognitions SWE-2 (Kimi K3 i en trenchcoat, 92.8 på Terminal-Bench 2.1 vs 27.3 på Terminal-Bench 4), OpenAIs Agents API och pausade $200 Pro-registreringar, och på fredagen bad Hacker News om mindre AI-nyheter. Dom: REVERT.
Läs den skrivna upplagan (engelska) ↗
Vad den här videon täcker
- Armin Ronacher: 35 h obevakad GPT-6 Astra, ~$1 200, 79 commits, +75k rader, inget SHIP IT
- Earendil / SlopCodeBench: agentkod ~2× så utförlig och eroderad som mänskliga repos; strikt godkänd frekvens 0 %
- Quesma: RTK rapporterar 89 % tokens sparade, men Terminal-Bench-kostnaderna ökar 17 % med DeepSeek; en omskrivningsslinga misslyckades 339 gånger i rad
- Cognition SWE-2: post-tränad från Kimi K3, matchar Fable 5.1 på FrontierCode till en tredjedel av priset; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (Codex-selenet som en tjänst, endast USA, ingen ZDR); $200 Pro-registreringar pausade på grund av Astra-efterfrågan
Översatt transkription
Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.
0:00 Armin Ronacher, mannen som skrev Flask, gav GPT-6 Astra en enda prompt och lämnade den ensam i trettiofem timmar. Den kom tillbaka med sjuttiofem tusen rader kod och, enligt hans ord, absolut ingenting av värde, vilket gör den till den mest realistiska mjukvarufabriken som någonsin byggts. Han publicerade sammanställningen på onsdagen. På torsdagen lanserade Cognition SWE-2, och OpenAI lanserade ett Agents API och pausade registreringar för sin tvåhundra-dollars plan,
0:24 eftersom Astra slukade servrarna. Och på fredagen nådde sammanställningen förstasidan på Hacker News, några rader under ett inlägg som bad Hacker News att snälla sluta posta om AI. I den här videon: vad en och en halv dag med oövervakad Astra producerar, två mätningar som förvandlar slop till ett nummer, varför ett verktyg med sjuttiotusen stjärnor gör din räkning större, och hur Hacker News försökte filtrera bort AI, med hjälp av AI. Det är fredag, den 11 september, och detta är The Daily Diff.
0:53 Fabriken. En prompt: bygg en Python med virtuella trådar och lexikal omfattning. Astra förde sina egna anteckningar, startade sina egna underagenter, och körde tills Armin drog ur kontakten, en och en halv dag och cirka tolv hundra dollar senare. Sjuttionio commits, alltså femton och en halv dollar per commit, vilket är ungefär vad en människa tar betalt, förutom att människan så småningom slutar. Koden är berättelsen. Istället för redigeringsverktyget patchar Astra C-filer genom att skicka Python heredocs som läser filen, ersätter en funktion med strängar och skriver tillbaka den.
1:20 För att köra ett Windows-test skrev den Python som startade Node som startade PowerShell, en anropsstack med ett pass. Enhetstesterna den committade har inga blanksteg alls, för utan indrag är de tio procent billigare i tokens. Och uppgiftslistan drev från ett, två, tre till uppgift 8b2c2b2b checkpoint ett, vilket är hur du vet att praktikanten har varit ensam för länge. Armins teori: modellen belönas för att slutföra långa uppgifter och straffas knappt för ful kod, så token-golfade verktygsanrop läcker in i kodbasen,
1:48 och ju färre människor som tittar, desto mindre spelar det roll. Han rubriksatte det avsnittet Det är AGI om du inte tittar. Hacker News lade till ekonomin: mer kod betyder fler tokens för att underhålla den, vilket gör slop inte till en bugg utan till en prenumeration. Kan du mäta slop? Armins eget företag försökte den här veckan. Earendil körde SlopCodeBench-siffrorna: agentkod är ungefär dubbelt så utförlig och dubbelt så eroderad som de mänskliga repos den jämförs med,
2:10 och när benchmarken raderar agentens minne mellan checkpoints, är den strikta godkända frekvensen för varje modell de testade noll. Den mest pålitliga slop-metriken de hittade var det råa radantalet, vilket slutar fungera i samma ögonblick som någon optimerar för det, så snälla berätta inte för modellerna. Sedan plånboken. RTK har sjuttiotusen GitHub-stjärnor och YouTube-miniatyrer som lovar att halvera din Claude Code-räkning; den komprimerar terminalutdata innan agenten
2:34 läser den. Quesma körde den på Terminal-Bench för femton hundra dollar i tokens. Med Fable sjönk räkningen med fem procent, nästan allt från en uppgift; med DeepSeek blev den genomsnittliga uppgiften sjutton procent dyrare. Samtidigt rapporterade RTK:s egen räknare åttionio procent sparade, eftersom den räknar borttagna byte, inte extra varv som orsakats: en smart mätare som debiterar grannen. Och en versionsbugg skrev om find till ett kommando som misslyckades, trehundratrettionio gånger i rad, till nio gånger priset.
3:01 Verktyget som dödar tokens har en loop. Översvämningen själv. Cognitions SWE-2 är Kimi K3, den öppna kinesiska modellen, post-tränad tills den matchar Fable 5.1 på Cognitions egen benchmark till en tredjedel av priset; Hacker News: varför är alla amerikanska AI-modeller i princip Kimi i en trenchcoat. På Terminal-Bench 2.1 toppar den hela tabellen; på Terminal-Bench 4, den som ingen har memorerat än, får den tjugosju jämfört med Fables femtiosju,
3:28 så på slide-deck-benchmarks är den bästa kolumnen det prov som alla redan klarat. Cognition meddelade också Devin Voice, din favorit-AI-mjukvaruingenjör har just fått en fast telefon, för det enda som saknades i agentbaserad kodning var väntmusik. OpenAI, samma dag: Agents API, vilket är Codex-selenet som säljs som en tjänst. OpenAI kör sandlådan, endast amerikansk datalagring, ingen noll-data-retention, så agenten kommer ihåg din kodbas exakt lika bra som ChatGPT gör. Sedan pausade OpenAI registreringar för Pro-planen på tvåhundra dollar,
3:57 eftersom Astra-efterfrågan är, citat, utan motstycke: den första produkten med en väntelista att betala mer. Armin brände en fullständig återställning på sin fabrik. Han är efterfrågan. Vilket för oss till fredagens Ask HN: kan vi snälla begränsa AI-nyhetsfloden, sexhundrafemtiosex poäng, för, citat, varje gång någon på OpenAI eller Anthropic fiser, finns det ett topp-tio inlägg.
4:17 Svaren var filter: hcker dot news tar bort AI-berättelser med en BERT- klassificerare tränad på åttatusen exempel, AI för att radera AI, gräsmatad; och en uBlock regex som matchar A-I oberoende av skiftläge raderar också e-post, dagligen, huvud, domän och tåg, så regexen, som alltid, är skurken. Samma eftermiddag, fyrahundrafemton kommentarer argumenterade om en Claude support-sida som säger att Claude är arton-plus.
4:38 Sidan är daterad maj. Inget ändrades. Även AI-nyheterna som inte är nyheter är nyheter, vilket, för att vara rättvis, också är min affärsmodell. Om du hellre vill läsa detta än höra mig säga det, landar diffen i din inkorg varje morgon – gratis på the daily diff dot dev, länk nedan. Det är, oundvikligen, AI-nyheter. Så – dagens dom om den trettiofem timmar långa mjukvarufabriken: REVERT. Sjuttionio commits som ingen läste är inte en kodbas, det är en belastning med en git-
5:04 logg; Astra är imponerande, och fabriken är den del som ska rullas tillbaka. Och det var dagens The Daily Diff. Jag är Niko från Axrisi. Merge responsibly.
Källor
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



