# Armin Ronacher forlot GPT-6 Astra alene i 35 timer.

Published: 2026-09-12

Armin Ronacher (Flask, Jinja) ga GPT-6 Astra ett enkelt spørsmål og lot den være i fred i 35 timer: omtrent en milliard tokens, omtrent $1200, 79 commits, 75 000 linjer – og "absolutt ingenting av verdi". Koden den gjenopprettet er historien: C-filer lappet av Python-string-splicing heredocs, Python som startet Node som startet PowerShell, enhetstester med fjernet mellomrom fordi det er 10 % billigere i tokens. To målinger støtter ham: Earendils SlopCodeBench-tall (agentkode omtrent dobbelt så omfattende og erodert som menneskelige repos, 0 % streng bestått rate) og Quesmas $1500 benchmark av RTK (79k stjerner, "89 % tokens spart" på egen teller, +17 % per oppgave med DeepSeek). Også: Cognitions SWE-2 (Kimi K3 i trenchcoat, 92,8 på Terminal-Bench 2.1 vs 27,3 på Terminal-Bench 4), OpenAIs Agents API og stoppet $200 Pro-registreringer, og fredagens Hacker News ba om mindre AI-nyheter. Dom: REVERT.

Canonical: https://thedailydiff.dev/no/video/2026-09-11-astra-slop-factory/

## Hva denne videoen dekker

- Armin Ronacher: 35 timer med uovervåket GPT-6 Astra, ~1200 $, 79 commits, +75k linjer, ingenting SHIP IT.
- Earendil / SlopCodeBench: agentkode ~2× så omfattende og erodert som menneskelige repos; streng bestått rate 0 %
- Quesma: RTK rapporterer 89 % tokens spart, men Terminal-Bench-kostnadene øker med 17 % med DeepSeek; en omskrivningssløyfe mislyktes 339 ganger på rad
- Cognition SWE-2: post-trent fra Kimi K3, matcher Fable 5.1 på FrontierCode til en tredjedel av prisen; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (Codex-sele som tjeneste, kun USA, ingen ZDR); $200 Pro-registreringer satt på pause på grunn av Astra-etterspørsel

## Oversatt transkripsjon

Oversatt fra den originale engelske fortellingen. Tilgjengelig lyd og undertekster kontrolleres av YouTube.

0:00 Armin Ronacher, mannen som skrev Flask, ga GPT-6 Astra en enkelt instruksjon og lot den være i fred i trettifem timer. Den kom tilbake med syttifem tusen kodelinjer og, med hans ord, absolutt ingenting av verdi, noe som gjør den til den mest realistiske programvarefabrikken som noensinne er bygget. Han publiserte rapporten på onsdag. På torsdag lanserte Cognition SWE-2, og OpenAI lanserte et Agents API og stoppet påmeldinger for sin tohundre-dollarsplan,

0:24 fordi Astra spiste serverne. Og på fredag nådde rapporten forsiden av Hacker News, noen rader under et innlegg som ba Hacker News om å slutte å legge ut om AI. I denne videoen: hva en og en halv dag med uovervåket Astra produserer, to målinger som gjør søl til et tall, hvorfor et verktøy med syttini tusen stjerner gjør regningen din større, og hvordan Hacker News prøvde å filtrere ut AI, ved å bruke AI. Det er fredag 11. september, og dette er The Daily Diff.

0:53 Fabrikken. Én instruksjon: bygg en Python med virtuelle tråder og leksikalt omfang. Astra tok sine egne notater, startet sine egne underagenter, og kjørte til Armin trakk ut kontakten, halvannen dag og omtrent tolv hundre dollar senere. Syttini commits, så femten og en halv dollar per commit, som er omtrent hva et menneske tar betalt, bortsett fra at mennesket til slutt stopper. Koden er historien. I stedet for redigeringsverktøyet, lapper Astra C-filer ved å sende Python-heredocs som leser filen, erstatter en funksjon, og skriver den tilbake.

1:20 For å kjøre en Windows-test skrev den Python som startet Node som startet PowerShell, en anropsstakk med pass. Enhetstestene den committet har ingen mellomrom i det hele tatt, fordi uten innrykk er de ti prosent billigere i tokens. Og oppgavelisten drev fra én, to, tre til oppgave 8b2c2b2b sjekkpunkt én, som er hvordan du vet at praktikanten har vært alene for lenge. Armins teori: modellen belønnes for å fullføre lange oppgaver og blir knapt straffet for stygg kode, så token-optimaliserte verktøy-kall lekker inn i kodebasen,

1:48 og jo færre mennesker som ser, jo mindre betyr det. Han kalte den delen "Det er AGI hvis du ikke ser". Hacker News la til økonomien: mer kode betyr flere tokens for å vedlikeholde den, noe som gjør søl ikke til en feil, men et abonnement. Kan du måle søl? Armins eget selskap prøvde denne uken. Earendil kjørte SlopCodeBench-tallene: agentkode er omtrent dobbelt så omstendelig og dobbelt så erodert som de menneskelige lagrene den sammenlignes med,

2:10 og når benchmarken sletter agentens minne mellom sjekkpunktene, er den strenge passraten for hver modell de testet null. Den mest pålitelige søl-metrikken de fant var rå linjetelling, som slutter å fungere i det øyeblikket noen optimerer for den, så ikke fortell modellene det. Så lommeboken. RTK har syttini tusen GitHub-stjerner og YouTube-miniatyrbilder som lover å halvere Claude Code-regningen din; den komprimerer terminalutdata før agenten

2:34 leser den. Quesma kjørte den på Terminal-Bench for femten hundre dollar i tokens. Med Fable falt regningen fem prosent, nesten alt fra én oppgave; med DeepSeek ble den gjennomsnittlige oppgaven sytten prosent dyrere. Samtidig rapporterte RTKs egen teller åttini prosent spart, fordi den teller fjernede bytes, ikke ekstra runder forårsaket: en smartmåler som fakturerer naboen. Og en versjonsfeil omskrev find til en kommando som mislyktes, tre hundre trettini ganger på rad, til ni ganger prisen.

3:01 Verktøyet som dreper tokens har en sløyfe. Selve flommen. Cognitions SWE-2 er Kimi K3, den åpne kinesiske modellen, post-trent til den matcher Fable 5.1 på Cognitions egen benchmark til en tredjedel av prisen; Hacker News: hvorfor er alle amerikanske AI-modeller i bunn og grunn Kimi i trenchcoat. På Terminal-Bench 2.1 topper den hele tabellen; på Terminal-Bench 4, den ingen har memorert ennå, scorer den tjuesju mot Fables femtiseks,

3:28 så på slide-deck-benchmarkene er den beste kolonnen eksamen alle allerede har bestått. Cognition annonserte også Devin Voice, din favoritt AI-programvare ingeniør fikk akkurat en fasttelefon, fordi det eneste agentbasert koding manglet var ventemusikk. OpenAI, samme dag: Agents API, som er Codex-selen solgt som en tjeneste. OpenAI driver sandkassen, kun amerikansk datalagring, ingen null-datalagring, så agenten husker kodebasen din nøyaktig like godt som ChatGPT gjør. Så satte OpenAI påmeldinger for tohundre-dollars Pro-planen på pause,

3:57 fordi Astra-etterspørselen er, sitat, uten sidestykke: det første produktet med en venteliste for å betale mer. Armin brant en full tilbakestilling på fabrikken sin. Han er etterspørselen. Noe som bringer oss til fredagens Ask HN: kan vi vær så snill å begrense AI-nyhetsflommen, seks hundre femtiseks poeng, fordi, sitat, hver gang noen hos OpenAI eller Anthropic promper, er det et topp ti-innlegg.

4:17 Svarene var filtre: hcker dot news fjerner AI-historier med en BERT klassifikator trent på åtte tusen eksempler, AI for å slette AI, gressfôret; og et uBlock regex som matcher A-I ufølsomt for store og små bokstaver sletter også e-post, daglig, hoved, domene og tog, så regexen, som alltid, er skurken. Samme ettermiddag, fire hundre femten kommentarer diskuterte en Claude-supportside som sa at Claude er atten pluss.

4:38 Siden er datert mai. Ingenting endret seg. Selv AI-nyhetene som ikke er nyheter er nyheter, som, for å være ærlig, også er forretningsmodellen min. Hvis du heller vil lese dette enn å høre meg si det, lander diffen i innboksen din hver morgen – gratis på the daily diff dot dev, lenke under. Det er, uunngåelig, AI-nyheter. Så – dagens dom over trettifem-timers programvarefabrikken: REVERT. Syttini commits ingen leste er ikke en kodebase, det er en forpliktelse med en git

5:04 logg; Astra er imponerende, og fabrikken er delen som skal rulles tilbake. Og det er diffen for i dag. Jeg er Niko fra Axrisi. Merge responsibly.

## Kilder

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
