+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher lod GPT-6 Astra være alene i 35 timer.

Armin Ronacher (Flask, Jinja) gav GPT-6 Astra én prompt og lod den være alene i 35 timer: omkring en milliard tokens, omkring $1.200, 79 commits, 75.000 linjer – og "absolut intet af værdi".

Armin Ronacher (Flask, Jinja) gav GPT-6 Astra én prompt og lod den være alene i 35 timer: omkring en milliard tokens, omkring $1.200, 79 commits, 75.000 linjer – og "absolut intet af værdi". Koden den genskabte er historien: C-filer patchet af Python string-splicing heredocs, Python der spawner Node der spawner PowerShell, enhedstests med fjernet whitespace fordi det er 10% billigere i tokens. To målinger bakker ham op: Earendils SlopCodeBench-tal (agentkode omkring dobbelt så verbose og eroderet som menneskelige repos, 0% strikt beståelsesrate) og Quesmas $1.500 benchmark af RTK (79k stjerner, "89% tokens sparet" på dens egen tæller, +17% per opgave med DeepSeek). Også: Cognitions SWE-2 (Kimi K3 i en trenchcoat, 92,8 på Terminal-Bench 2.1 vs 27,3 på Terminal-Bench 4), OpenAIs Agents API og pausede $200 Pro-tilmeldinger, og fredagens Hacker News bad om mindre AI-nyheder. Dom: REVERT.

Læs den skriftlige udgave (engelsk) ↗

Hvad denne video dækker

  • Armin Ronacher: 35 t med uovervåget GPT-6 Astra, ~$1.200, 79 commits, +75k linjer, intet SHIP IT
  • Earendil / SlopCodeBench: agentkode ~2× så verbose og eroderet som menneskelige repos; strikt beståelsesrate 0%
  • Quesma: RTK rapporterer 89% tokens sparet, men Terminal-Bench-omkostninger stiger 17% med DeepSeek; en omskrivningsløkke mislykkedes 339 gange i træk
  • Cognition SWE-2: eftertrænet fra Kimi K3, matcher Fable 5.1 på FrontierCode til en tredjedel af prisen; TB 2.1 92,8 vs TB 4 27,3; Devin Voice
  • OpenAI Agents API (Codex-harnessen som en tjeneste, kun US, ingen ZDR); $200 Pro-tilmeldinger pauset på grund af Astra-efterspørgsel

Oversat udskrift

Oversat fra den originale engelske fortælling. Tilgængelig lyd og undertekster styres af YouTube.

0:00 Armin Ronacher, manden der skrev Flask, gav GPT-6 Astra en enkelt prompt og lod den være alene i femogtredive timer. Den kom tilbage med femoghalvfjerds tusind linjer kode og, med hans ord, absolut intet af værdi, hvilket gør den til den mest realistiske softwarefabrik nogensinde bygget. Han postede redegørelsen onsdag. Torsdag lancerede Cognition SWE-2, og OpenAI lancerede en Agents API og pausede tilmeldinger til sin tohundrede-dollars plan,

0:24 fordi Astra spiste serverne. Og fredag nåede redegørelsen forsiden af Hacker News, et par rækker under et indlæg der bad Hacker News om at stoppe med at poste om AI. I denne video: hvad halvanden dag med uovervåget Astra producerer, to målinger der gør sjusk til et tal, hvorfor et værktøj med nioghalvfjerds tusind stjerner gør din regning større, og hvordan Hacker News forsøgte at filtrere AI fra, ved hjælp af AI. Det er fredag den 11. september, og dette er The Daily Diff.

0:53 Fabrikken. Én prompt: byg en Python med virtuelle tråde og leksikal scoping. Astra førte sine egne noter, oprettede sine egne subagenter, og kørte indtil Armin trak stikket, halvanden dag og omkring tolv hundrede dollars senere. Nioghalvfjerds commits, altså femten og en halv dollar per commit, hvilket er omtrent hvad et menneske tager, bortset fra at mennesket til sidst stopper. Koden er historien. I stedet for redigeringsværktøjet patchede Astra C-filer ved at pipe Python heredocs der læser filen, streng-erstatter en funktion ind, og skriver den tilbage.

1:20 For at køre en Windows-test skrev den Python der spwanede Node der spwanede PowerShell, en kaldestak med et pas. Enhedstestsene den committede har slet ingen whitespace, fordi uden indrykning er de ti procent billigere i tokens. Og opgavelisten drev fra en, to, tre til opgave 8b2c2b2b checkpoint et, hvilket er sådan du ved at praktikanten har været alene for længe. Armins teori: modellen belønnes for at afslutte lange opgaver og straffes knap nok for grim kode, så token-golfede værktøjskald lækker ind i kodebasen,

1:48 og jo færre mennesker kigger, jo mindre betyder det. Han kaldte den sektion Det er AGI Hvis Du Ikke Kigger. Hacker News tilføjede økonomien: mere kode betyder flere tokens til at vedligeholde det, hvilket gør sjusk ikke til en fejl, men et abonnement. Kan man måle sjusk? Armins eget firma prøvede denne uge. Earendil kørte SlopCodeBench-tallene: agentkode er omkring dobbelt så verbose og dobbelt så eroderet som de menneskelige repos den sammenlignes med,

2:10 og når benchmarken sletter agentens hukommelse mellem checkpoints, er den strikte beståelsesrate for hver model de testede nul. Den mest pålidelige sjusk-metrik de fandt var det rå linjetal, som holder op med at virke i det øjeblik nogen optimerer for det, så fortæl det venligst ikke til modellerne. Så pungen. RTK har nioghalvfjerds tusind GitHub-stjerner og YouTube-miniaturebilleder der lover at halvere din Claude Code-regning; den komprimerer terminaloutput før agenten

2:34 læser det. Quesma kørte den på Terminal-Bench for femten hundrede dollars tokens. Med Fable faldt regningen fem procent, næsten alt fra én opgave; med DeepSeek blev den gennemsnitlige opgave sytten procent dyrere. Imens rapporterede RTK's egen tæller otteoghalvfirs procent sparet, fordi den tæller fjernede bytes, ikke forårsagede ekstra ture: en smartmåler der opkræver naboen. Og en versionsfejl omskrev find til en kommando der mislykkedes, tre hundrede niogtredive gange i træk, til ni gange prisen.

3:01 Værktøjet der dræber tokens har en løkke. Selve strømmen. Cognitions SWE-2 er Kimi K3, den åbne kinesiske model, eftertrænet indtil den matcher Fable 5.1 på Cognitions egen benchmark til en tredjedel af prisen; Hacker News: hvorfor er alle amerikanske AI-modeller basalt set Kimi i en trenchcoat. På Terminal-Bench 2.1 topper den hele tabellen; på Terminal-Bench 4, den ingen endnu har memoriseret, scorer den syvogtyve mod Fables seksoghalvtreds,

3:28 så på slide-deck benchmarks er den bedste kolonne eksamen alle allerede bestod. Cognition annoncerede også Devin Voice, din foretrukne AI-software ingeniør fik lige en fastnettelefon, fordi den eneste ting agentbaseret kodning manglede var ventemusik. OpenAI, samme dag: Agents API'en, som er Codex-harnessen solgt som en tjeneste. OpenAI kører sandkassen, kun amerikansk dataopbevaring, ingen nul-datalagring, så agenten husker din kodebase præcis lige så godt som ChatGPT gør. Så satte OpenAI tilmeldingerne til den tohundrede-dollars Pro-plan på pause,

3:57 fordi Astra-efterspørgslen er, citat, hidtil uset: det første produkt med en venteliste for at betale mere. Armin brændte en fuld nulstilling på sin fabrik. Han er efterspørgslen. Hvilket bringer os til fredagens Ask HN: kan vi venligst begrænse AI-nyhedsstrømmen, seks hundrede seksoghalvtreds point, fordi, citat, hver gang nogen hos OpenAI eller Anthropic prutter, er der et top-ti indlæg.

4:17 Svarene var filtre: hcker dot news fjerner AI-historier med en BERT klassificering trænet på otte tusind eksempler, AI til at slette AI, græsfodret; og en uBlock regex der matcher A-I ufølsomt over for store/små bogstaver sletter også email, daily, main, domain og train, så regex'en, som altid, er skurken. Samme eftermiddag, fire hundrede femten kommentarer diskuterede en Claude-supportside der sagde at Claude er atten-plus.

4:38 Siden er dateret maj. Intet ændrede sig. Selv AI-nyheder der ikke er nyheder, er nyheder, hvilket, for at være retfærdig, også er min forretningsmodel. Hvis du hellere vil læse dette end høre mig sige det, lander diff'en i din indbakke hver morgen — gratis på the daily diff dot dev, link nedenfor. Det er uundgåeligt AI-nyheder. Så — dagens dom over den femogtredive-timers softwarefabrik: revert. Nioghalvfjerds commits ingen læste er ikke en kodebase, det er en forpligtelse med en git

5:04 log; Astra er imponerende, og fabrikken er den del der skal rulles tilbage. Og det er diff'en for i dag. Jeg er Niko fra Axrisi. Merge ansvarligt.

Kilder

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Relaterede videoer