# Armin Ronacher je GPT-6 Astra pustil samo 35 ur.

Published: 2026-09-12

Armin Ronacher (Flask, Jinja) je dal GPT-6 Astra en poziv in jo pustil samo 35 ur: približno milijardo žetonov, približno 1.200 $, 79 potrditev, 75.000 vrstic — in »absolutno nič vrednega«. Koda, ki jo je pridobila, je zgodba: C datoteke, popravljene s Python string-splicing heredoci, Python, ki sproži Node, ki sproži PowerShell, enotski testi z odstranjenimi presledki, ker so 10 % cenejši v žetonih. Podpirata ga dve meritvi: Earendilove številke SlopCodeBench (agentska koda približno dvakrat bolj obsežna in erodirana kot človeški repozitoriji, 0 % stopnja strogega uspeha) in Quesmin test RTK za 1.500 $ (79k zvezdic, "89 % prihranjenih žetonov" na lastnem števcu, +17 % na nalogo z DeepSeek). Prav tako: Cognitionov SWE-2 (Kimi K3 v trenč plašču, 92.8 na Terminal-Bench 2.1 proti 27.3 na Terminal-Bench 4), OpenAI-jev Agents API in začasno ustavljene prijave za 200 $ Pro, ter petek, ko je Hacker News prosil za manj novic o AI. Sodba: REVERT.

Canonical: https://thedailydiff.dev/sl/video/2026-09-11-astra-slop-factory/

## Kaj zajema ta videoposnetek

- Armin Ronacher: 35 ur brez nadzora GPT-6 Astra, ~1.200 $, 79 potrditev, +75k vrstic, nič poslanega
- Earendil / SlopCodeBench: agentska koda ~2× bolj obsežna in erodirana kot človeški repozitoriji; stopnja strogega uspeha 0 %
- Quesma: RTK poroča o 89 % prihranjenih žetonih, vendar se stroški Terminal-Bench povečajo za 17 % z DeepSeek; zanka prepisovanja je 339-krat zaporedoma odpovedala
- Cognition SWE-2: naknadno usposobljen iz Kimi K3, ustreza Fable 5.1 na FrontierCode po tretjini cene; TB 2.1 92.8 proti TB 4 27.3; Devin Voice
- OpenAI Agents API (Codex pas kot storitev, samo ZDA, brez ZDR); prijave za 200 $ Pro ustavljene zaradi povpraševanja po Astri

## Preveden prepis

Prevedeno iz izvirnega angleškega pripovedovanja. Razpoložljivi zvok in podnapisi so nadzorovani s strani YouTuba.

0:00 Armin Ronacher, človek, ki je napisal Flask, je dal GPT-6 Astra en sam poziv in jo pustil samo petintrideset ur. Vrnil se je s petinsedemdeset tisoč vrsticami kode in, po njegovih besedah, popolnoma ničvredno, kar jo dela najbolj realistično programsko tovarno, ki je bila kdajkoli zgrajena. Poročilo je objavil v sredo. V četrtek je Cognition izdal SWE-2, OpenAI pa Agents API in ustavil prijave za svoj dvestodolarski načrt,

0:24 ker je Astra pojedla strežnike. In v petek je poročilo doseglo naslovnico Hacker News, nekaj vrstic pod objavo, ki je prosila Hacker News, naj prosim preneha objavljati o AI. V tem videu: kaj proizvede dan in pol nenadzorovane Astre, dve meritvi, ki neurejenost spremenita v številko, zakaj orodje s sedemindevetdeset tisoč zvezdicami poveča vaš račun in kako je Hacker News poskušal filtrirati AI, z uporabo AI. Petek, 11. september, in to je The Daily Diff.

0:53 Tovarna. En poziv: zgradite Python z navideznimi nitmi in leksikalnim obsegom. Astra je shranjevala lastne zapiske, zagnala lastne podagente, in tekla, dokler Armin ni potegnil vtiča, dan in pol ter približno dvanajst sto dolarjev kasneje. Devetinsedemdeset potrditev, torej petnajst in pol dolarjev na potrditev, kar je približno toliko, kot zaračuna človek, le da se človek sčasoma ustavi. Koda je zgodba. Namesto orodja za urejanje, Astra popravi datoteke C z uporabo Python heredocov, ki preberejo datoteko, nadomestijo funkcijo in jo zapišejo nazaj.

1:20 Za izvedbo enega Windows testa je napisala Python, ki je zagnal Node, ki je zagnal PowerShell, klicni sklad s potnim listom. Enotski testi, ki jih je potrdila, nimajo sploh nobenih presledkov, ker so brez zamika deset odstotkov cenejši v žetonih. In seznam nalog je prešel iz ena, dva, tri na nalogo 8b2c2b2b kontrolna točka ena, kar je znak, da je pripravnik preveč časa sam. Arminova teorija: model je nagrajen za dokončanje dolgih nalog in komaj kaznovan za grdo kodo, zato se žetoni, prihranjeni z orodji, prelijejo v bazo kode,

1:48 in manj kot jih ljudje pregledujejo, manj je pomembno. Ta del je naslovil To je AGI, če ne pogledaš. Hacker News je dodal ekonomijo: več kode pomeni več žetonov za vzdrževanje, kar dela neurejenost ne hrošč, ampak naročnino. Ali lahko merite neurejenost? Arminovo podjetje je poskusilo ta teden. Earendil je izvedel številke SlopCodeBench: koda agenta je približno dvakrat bolj obsežna in dvakrat bolj erodirana kot človeški repozitoriji, s katerimi se primerja,

2:10 in ko merilo izbriše agentov spomin med kontrolnimi točkami, je stopnja strogega uspeha za vsak model, ki so ga testirali, nič. Najbolj zanesljiv parameter neurejenosti, ki so ga našli, je bilo število vrstic, ki preneha delovati v trenutku, ko ga kdo optimizira, zato prosim, ne povejte modelom. Potem denarnica. RTK ima devetinsedemdeset tisoč GitHub zvezdic in YouTube sličice, ki obljubljajo razpolovitev vašega računa Claude Code; stisne izhod terminala, preden ga agent

2:34 prebere. Quesma ga je zagnala na Terminal-Bench za petnajst sto dolarjev žetonov. Z Fable se je račun zmanjšal za pet odstotkov, skoraj vse zaradi ene naloge; z DeepSeek je povprečna naloga postala sedemnajst odstotkov dražja. Medtem je RTK-ov lastni števec poročal o devetindevetdesetih odstotkih prihranka, ker šteje odstranjene bajte, ne povzročenih dodatnih obratov: pametni števec, ki računa sosedu. In ena napaka v različici je prepisala 'find' v ukaz, ki je odpovedal, tristo devetintridesetkrat zapored, po devetkratni ceni.

3:01 Orodje, ki ubija žetone, ima zanko. Poplava sama. Cognitionov SWE-2 je Kimi K3, odprti kitajski model, naknadno usposobljen, dokler se ne ujema z Fable 5.1 na Cognitionovem lastnem merilu po tretjini cene; Hacker News: zakaj so vsi ameriški AI modeli v bistvu Kimi v trenč plašču. Na Terminal-Bench 2.1 je na vrhu celotne tabele; na Terminal-Bench 4, ki si ga nihče še ni zapomnil, doseže sedemindvajset proti Fablejevim šestinpetdesetim,

3:28 tako da je na predstavitvenih merilih najboljši stolpec izpit, ki so ga vsi že opravili. Cognition je napovedal tudi Devin Voice, vaš najljubši inženir programske opreme AI je pravkar dobil stacionarni telefon, ker je edina stvar, ki je manjkala agentnemu kodiranju, bila glasba za čakanje. OpenAI, isti dan: Agents API, kar je Codex pas, prodan kot storitev. OpenAI poganja peskovnik, samo prebivališče podatkov v ZDA, brez shranjevanja nič podatkov, tako da si agent zapomni vašo bazo kode natanko tako dobro kot ChatGPT. Potem je OpenAI ustavil prijave za dvestodolarski Pro načrt,

3:57 ker je povpraševanje po Astri, citiram, brez primere: prvi izdelek s čakalno listo za plačilo več. Armin je na svoji tovarni izvedel popolno ponastavitev. On je povpraševanje. Kar nas pripelje do petkovega Ask HN: ali lahko prosim omejimo poplavo novic o AI, šeststo šestinpetdeset točk, ker, citiram, vsakič, ko nekdo pri OpenAI ali Anthropic prdne, je objavljen prispevek med prvih deset.

4:17 Odgovori so bili filtri: hcker.news odstranjuje AI zgodbe z BERT klasifikatorjem, usposobljenim na osem tisočih primerih, AI za brisanje AI, paša; in uBlock regex, ki se ujema z A-I brez upoštevanja velikih in malih črk, briše tudi email, daily, main, domain in train, zato je regex, kot vedno, zlobnež. Istega popoldneva, štiristo petnajst komentarjev se je prepiralo o strani za podporo Claude ki pravi, da je Claude osemnajst-plus.

4:38 Stran je datirana maja. Nič se ni spremenilo. Tudi AI novice, ki niso novice, so novice, kar je, pošteno povedano, tudi moj poslovni model. Če bi raje to prebrali, kot pa slišali mene, se diff znajde v vašem nabiralniku vsako jutro — brezplačno na the daily diff dot dev, povezava spodaj. Je, neizogibno, novica o AI. Torej — današnja sodba o petintrideseturni tovarni programske opreme: revert. Sedemindevetdeset potrditev, ki jih nihče ni prebral, ni koda, je odgovornost z git

5:04 zapisom; Astra je impresivna, tovarna pa je del, ki ga je treba razveljaviti. In to je diff za danes. Sem Niko iz Axrisi. Odgovorno združevanje.

## Viri

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
