# Armin Ronacher 35 órára magára hagyta a GPT-6 Astrát.

Published: 2026-09-12

Armin Ronacher (Flask, Jinja) adott a GPT-6 Astrának egyetlen promptot, és 35 órára magára hagyta: mintegy egymilliárd token, körülbelül 1200 dollár, 79 commit, 75 000 sor – és „abszolút semmi értékes”. A kinyert kód a történet: C fájlok Python string-splicing heredoc-okkal foltozva, Python Node-ot indít, Node PowerShell-t indít, egységtesztek szóközök nélkül, mert az 10%-kal olcsóbb tokenben. Két mérés támasztja alá: Earendil SlopCodeBench számai (az ügynök kódja körülbelül kétszer olyan terjengős és erodált, mint az emberi adattárak, 0%-os szigorú átmeneti arány) és Quesma 1500 dolláros RTK benchmarkja (79k csillag, „89% token megtakarítás” a saját számlálója szerint, +17% feladatonként DeepSeek-kel). Továbbá: a Cognition SWE-2 (Kimi K3 ballonkabátban, 92,8 a Terminal-Bench 2.1-en vs 27,3 a Terminal-Bench 4-en), az OpenAI Agents API és a felfüggesztett 200 dolláros Pro előfizetések, és a pénteki Hacker News kevesebb AI hírt kért. Ítélet: REVERT.

Canonical: https://thedailydiff.dev/hu/video/2026-09-11-astra-slop-factory/

## Amit ez a videó tartalmaz

- Armin Ronacher: 35 óra felügyelet nélküli GPT-6 Astra, ~1200 dollár, 79 commit, +75k sor, semmi nem került kiadásra
- Earendil / SlopCodeBench: az ügynök kódja ~2× terjengősebb és erodáltabb, mint az emberi adattárak; szigorú átmeneti arány 0%
- Quesma: az RTK 89% token megtakarítást jelent, de a Terminal-Bench költségei 17%-kal növekednek a DeepSeek-kel; egy újraírási ciklus 339-szer egymás után megbukott
- Cognition SWE-2: Kimi K3-ból utótanított, harmadáron megegyezik a Fable 5.1-gyel a FrontierCode-on; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (a Codex keretrendszer mint szolgáltatás, csak USA, nincs ZDR); 200 dolláros Pro előfizetések felfüggesztve az Astra iránti kereslet miatt

## Lefordított átirat

Az eredeti angol narrációból fordítva. A rendelkezésre álló hangot és feliratokat a YouTube vezérli.

0:00 Armin Ronacher, a Flask megalkotója, egyetlen promptot adott a GPT-6 Astrának és harmincöt órára magára hagyta. Hetvenötezer sor kóddal tért vissza, és az ő szavaival élve, abszolút semmi értékes, ami a legrealisztikusabbá teszi valaha épített szoftvergyárrá. Szerdán tette közzé az írást. Csütörtökön a Cognition kiadta az SWE-2-t, az OpenAI pedig egy Agents API-t és felfüggesztette a kétszáz dolláros csomagjának előfizetéseit,

0:24 mert az Astra megette a szervereket. És pénteken az írás elérte a Hacker News címlapját, néhány sorral egy olyan poszt alatt, ami arra kérte a Hacker News-t, hogy ne posztoljon több AI hírt. Ebben a videóban: mit produkál egy másfél napos felügyelet nélküli Astra, két mérés, ami számba fordítja a lazaságot, miért növeli a számládat egy hetvenkilenc ezer csillagos eszköz, és hogyan próbálta meg a Hacker News kiszűrni az AI-t, AI használatával. Péntek van, szeptember 11-e, és ez a The Daily Diff.

0:53 A gyár. Egy prompt: építs egy Pythont virtuális szálakkal és lexikális hatókörrel. Az Astra saját jegyzeteket vezetett, saját alügynököket indított, és addig futott, amíg Armin kihúzta a dugót, másfél nappal és körülbelül ezerkétszáz dollárral később. Hetvenkilenc commit, azaz tizenöt és fél dollár commitenként, ami nagyjából annyi, amennyit egy ember kér, kivéve, hogy az ember végül megáll. A kód a történet. Az edit eszköz helyett az Astra C fájlokat javít Python heredoc-okkal, amik olvassák a fájlt, string-cserével beírnak egy függvényt, és visszaírják.

1:20 Egy Windows teszt futtatásához olyan Pythont írt, ami Node-ot indított, ami PowerShell-t indított, egy hívásverem útlevéllel. Az általa committelt egységtesztekben egyáltalán nincs szóköz, mert behúzás nélkül tíz százalékkal olcsóbbak a tokenekben. És a feladatlista egy, kettő, háromból átcsúszott a 8b2c2b2b ellenőrzőpont egy feladatra, amiből tudod, hogy a gyakornok túl sokáig volt egyedül. Armin elmélete: a modell jutalmat kap a hosszú feladatok befejezéséért, és alig büntetik a csúnya kódért, így a token-optimalizált eszközhívások beszivárognak a kódbázisba,

1:48 és minél kevesebb ember nézi, annál kevésbé számít. Ezt a szakaszt „AGI, ha nem nézed” címmel látta el. A Hacker News hozzátette a gazdasági szempontokat: több kód több tokent jelent a karbantartáshoz, ami a lazaságot nem hibává, hanem előfizetéssé teszi. Mérhető a lazaság? Armin saját cége próbálta meg ezen a héten. Earendil futtatta a SlopCodeBench számokat: az ügynök kódja körülbelül kétszer olyan terjengős és kétszer annyira erodált, mint az összehasonlított emberi adattárak,

2:10 és amikor a benchmark törli az ügynök memóriáját az ellenőrzőpontok között, minden tesztelt modell szigorú átmeneti aránya nulla. A legmegbízhatóbb lazasági metrikának a nyers sorok számát találták, ami abban a pillanatban megszűnik működni, amint valaki optimalizálja érte, szóval kérlek, ne mondjátok el a modelleknek. Aztán a pénztárca. Az RTK-nak hetvenkilencezer GitHub csillaga van és YouTube bélyegképei ígérik, hogy megfelezik a Claude Code számláját; tömöríti a terminál kimenetet, mielőtt az ügynök

2:34 elolvasná. Quesma futtatta a Terminal-Bench-en ezerötszáz dollár értékű tokenért. A Fable-lel a számla öt százalékkal csökkent, majdnem mind egy feladatból; a DeepSeek-kel az átlagos feladat tizenhét százalékkal drágább lett. Eközben az RTK saját számlálója nyolcvankilenc százalék megtakarítást jelentett, mert az eltávolított bájtokat számolja, nem az extra köröket: egy okosmérő, ami a szomszédnak számláz. És egy verzióhiba átírta a find-ot egy olyan parancsra, ami megbukott, háromszázharminckilencszer egymás után, kilencszeres áron.

3:01 A tokent elpusztító eszköznek van egy ciklusa. Maga az árvíz. A Cognition SWE-2 a Kimi K3, a nyílt kínai modell, utólagosan kiképezve, amíg meg nem egyezik a Fable 5.1-gyel a Cognition saját benchmarkján harmadáron; Hacker News: miért van az, hogy az összes amerikai AI modell lényegében Kimi ballonkabátban. A Terminal-Bench 2.1-en az egész táblázat élén áll; a Terminal-Bench 4-en, amit még senki sem memorizált, huszonhét pontot ér el a Fable ötvenhatjával szemben,

3:28 szóval a diasori benchmarkokon a legjobb oszlop az a vizsga, amit mindenki már letett. A Cognition bejelentette a Devin Voice-t is, a kedvenc AI szoftver mérnököd most kapott egy vezetékes telefont, mert az egyetlen dolog, ami hiányzott az ügynöki kódolásból, az a várakozási zene volt. OpenAI, ugyanazon a napon: az Agents API, ami a Codex keretrendszer szolgáltatásként értékesítve. Az OpenAI futtatja a sandboxot, csak amerikai adatok tárolása, nincs nulla adatmegőrzés, így az ügynök pontosan úgy emlékszik a kódbázisodra, mint a ChatGPT. Aztán az OpenAI felfüggesztette a kétszáz dolláros Pro előfizetésre való regisztrációt,

3:57 mert az Astra iránti kereslet, idézem, példátlan: az első termék várólistával többet fizetni. Armin egy teljes visszaállítást égetett el a gyárán. Ő a kereslet. Ami elvezet minket a pénteki Ask HN-hez: korlátozhatjuk-e az AI híráradatot, hatszázötvenhat pont, mert, idézem, minden alkalommal, amikor valaki az OpenAI-nál vagy az Anthropic-nál fingik, van egy top tíz poszt.

4:17 A válaszok szűrők voltak: a hcker.news eltávolítja az AI történeteket egy BERT osztályozóval, amit nyolcezer példán képeztek, AI az AI törlésére, füves takarmányú; és egy A-I kisbetű-érzéketlenül egyező uBlock regex is törli az e-mailt, napi, fő, domain és vonat szavakat, így a regex, mint mindig, a gonosz. Ugyanezen a délutánon négyszáztizenöt hozzászólás vitatkozott egy Claude támogatási oldalon arról, hogy Claude tizennyolc éven felüli.

4:38 Az oldal májusi keltezésű. Semmi sem változott. Még az AI hírek is hírek, amik nem hírek, ami, hogy őszinte legyek, az én üzleti modellem is. Ha inkább olvasnád ezt, mint hallanád tőlem, a diff minden reggel a postaládádba érkezik – ingyen a the daily diff dot dev címen, link lent. Ez elkerülhetetlenül AI hír. Szóval – a mai ítélet a harmincöt órás szoftvergyárról: REVERT. Hetvenkilenc commit, amit senki sem olvasott, nem egy kódbázis, hanem egy kötelezettség egy git

5:04 naplóval; az Astra lenyűgöző, és a gyár az a rész, amit vissza kell állítani. És ennyi a mai diff. Niko vagyok az Axrisi-tól. Felelősségteljesen egyesítsd.

## Források

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
