# Armin Ronacher zostawił GPT-6 Astra w spokoju na 35 godzin.

Published: 2026-09-12

Armin Ronacher (Flask, Jinja) dał GPT-6 Astra jedno polecenie i zostawił go w spokoju na 35 godzin: około miliard tokenów, około 1200 dolarów, 79 commitów, 75 000 linii — i „absolutnie nic wartościowego”. Odzyskany kod to historia: pliki C poprawiane przez heredoci Pythona z łączeniem stringów, Python uruchamiający Node, który uruchamia PowerShell, testy jednostkowe z usuniętymi białymi znakami, ponieważ są o 10% tańsze w tokenach. Potwierdzają to dwa pomiary: liczby SlopCodeBench Earendila (kod agenta około dwa razy bardziej szczegółowy i zniszczony niż repozytoria ludzkie, 0% wskaźnik ścisłego zaliczenia) oraz benchmark Quesmy za 1500 dolarów dla RTK (79 tys. gwiazdek, „89% tokenów zaoszczędzonych” na własnym liczniku, +17% za zadanie z DeepSeek). Ponadto: SWE-2 Cognition (Kimi K3 w prochowcu, 92,8 na Terminal-Bench 2.1 vs 27,3 na Terminal-Bench 4), API Agentów OpenAI i wstrzymane zapisy na $200 Pro, oraz prośba Hacker News z piątku o mniej wiadomości AI. Werdykt: REVERT.

Canonical: https://thedailydiff.dev/pl/video/2026-09-11-astra-slop-factory/

## Co obejmuje ten film

- Armin Ronacher: 35 h bezobsługowego GPT-6 Astra, ~1200 USD, 79 commitów, +75 tys. linii, nic nie wysłane
- Earendil / SlopCodeBench: kod agenta ~2× bardziej szczegółowy i zniszczony niż repozytoria ludzkie; wskaźnik ścisłego zaliczenia 0%
- Quesma: RTK raportuje 89% zaoszczędzonych tokenów, ale koszty Terminal-Bench rosną o 17% z DeepSeek; pętla przepisywania zakończyła się niepowodzeniem 339 razy z rzędu
- Cognition SWE-2: potrenowany z Kimi K3, dorównuje Fable 5.1 na FrontierCode za jedną trzecią ceny; TB 2.1 92,8 vs TB 4 27,3; Devin Voice
- OpenAI Agents API (uprząż Codex jako usługa, tylko USA, brak ZDR); wstrzymano zapisy na $200 Pro ze względu na zapotrzebowanie na Astrę

## Przetłumaczona transkrypcja

Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.

0:00 Armin Ronacher, człowiek, który napisał Flask, dał GPT-6 Astra jedno polecenie i zostawił go w spokoju na trzydzieści pięć godzin. Wrócił z siedemdziesięciu pięciu tysiącami linii kodu i, według jego słów, absolutnie niczym wartościowym, co czyni go najbardziej realistyczną fabryką oprogramowania, jaka kiedykolwiek powstała. Opublikował opis w środę. W czwartek Cognition wypuściło SWE-2, a OpenAI wypuściło API Agentów i wstrzymało zapisy na swój plan za dwieście dolarów,

0:24 ponieważ Astra zjadła serwery. A w piątek opis trafił na pierwszą stronę Hacker News, kilka rzędów poniżej posta, w którym prosi się Hacker News, aby przestało publikować o AI. W tym filmie: co wytwarza półtora dnia nienadzorowanej Astry, dwa pomiary, które przekształcają niechlujstwo w liczbę, dlaczego narzędzie z siedemdziesięciu dziewięciu tysiącami gwiazdek zwiększa rachunek i jak Hacker News próbowało odfiltrować AI, używając AI. Jest piątek, 11 września, i to jest The Daily Diff.

0:53 Fabryka. Jedno polecenie: zbuduj Pythona z wirtualnymi wątkami i leksykalnym zakresem. Astra prowadziła własne notatki, uruchamiała własne subagenty, i działała, dopóki Armin nie odłączył zasilania, półtora dnia i około tysiąc dwustu dolarów później. Siedemdziesiąt dziewięć commitów, czyli piętnaście i pół dolara za commit, co jest mniej więcej tym, co pobiera człowiek, z tym że człowiek w końcu się zatrzymuje. Kod jest historią. Zamiast narzędzia do edycji, Astra poprawia pliki C, przesyłając heredoki Pythona, które czytają plik, wstawiają funkcję zamieniając ciąg znaków i zapisują go z powrotem.

1:20 Aby uruchomić jeden test Windows, napisała Pythona, który uruchomił Node, który uruchomił PowerShell, stos wywołań z paszportem. Testy jednostkowe, które zatwierdziła, nie mają wcale białych znaków, ponieważ bez wcięć są o dziesięć procent tańsze w tokenach. A lista zadań dryfowała z jeden, dwa, trzy do zadania 8b2c2b2b punkt kontrolny jeden, co oznacza, że stażysta był zbyt długo sam. Teoria Armina: model jest nagradzany za ukończenie długich zadań i ledwo karany za brzydki kod, więc narzędzia token-golfed przeciekają do bazy kodu,

1:48 a im mniej ludzi patrzy, tym mniej to ma znaczenia. Zatytułował tę sekcję „To AGI, jeśli nie spojrzysz”. Hacker News dodało ekonomię: więcej kodu oznacza więcej tokenów do jego utrzymania, co sprawia, że niechlujstwo nie jest błędem, ale subskrypcją. Czy można zmierzyć niechlujstwo? Własna firma Armina próbowała tego w tym tygodniu. Earendil uruchomił liczby SlopCodeBench: kod agenta jest około dwa razy bardziej szczegółowy i dwa razy bardziej zniszczony niż repozytoria ludzkie, z którymi jest porównywany,

2:10 a gdy benchmark czyści pamięć agenta między punktami kontrolnymi, wskaźnik ścisłego zaliczenia dla każdego testowanego modelu wynosi zero. Najbardziej wiarygodnym miernikiem niechlujstwa, jaki znaleźli, była surowa liczba linii, która przestaje działać w momencie, gdy ktoś ją zoptymalizuje, więc proszę, nie mówcie modelom. Następnie portfel. RTK ma siedemdziesiąt dziewięć tysięcy gwiazdek na GitHubie i miniatury na YouTube, obiecujące zmniejszenie o połowę rachunku za Claude Code; kompresuje wyjście terminala zanim agent

2:34 je przeczyta. Quesma uruchomił to na Terminal-Bench za piętnaście tysięcy dolarów tokenów. Z Fable rachunek spadł o pięć procent, prawie wszystko z jednego zadania; z DeepSeek średnie zadanie stało się o siedemnaście procent droższe. W międzyczasie własny licznik RTK zgłaszał osiemdziesiąt dziewięć procent oszczędności, ponieważ liczy usunięte bajty, a nie dodatkowe obroty: inteligentny licznik, który obciąża sąsiada. A błąd w wersji przepisał find na polecenie, które zakończyło się niepowodzeniem, trzysta trzydzieści dziewięć razy z rzędu, dziewięć razy drożej.

3:01 Narzędzie, które zabija tokeny, ma pętlę. Sama powódź. SWE-2 Cognition to Kimi K3, otwarty chiński model, potrenowany, aż dorówna Fable 5.1 w własnym benchmarku Cognition za jedną trzecią ceny; Hacker News: dlaczego wszystkie amerykańskie modele AI to w zasadzie Kimi w prochowcu. Na Terminal-Bench 2.1 zajmuje pierwsze miejsce w całej tabeli; na Terminal-Bench 4, tym, którego jeszcze nikt nie zapamiętał, zdobywa dwadzieścia siedem punktów wobec pięćdziesięciu sześciu Fable,

3:28 więc na benchmarkach prezentacji najlepsza kolumna to egzamin, który wszyscy już zdali. Cognition ogłosiło również Devin Voice, twój ulubiony inżynier oprogramowania AI właśnie dostał telefon stacjonarny, bo jedyną rzeczą, której brakowało w agentowym kodowaniu, była muzyka na czekanie. OpenAI, tego samego dnia: API Agentów, które jest uprzężą Codex sprzedawaną jako usługa. OpenAI uruchamia sandbox, tylko rezydencja danych w USA, brak zerowego przechowywania danych, więc agent pamięta twoją bazę kodu dokładnie tak samo dobrze, jak ChatGPT. Następnie OpenAI wstrzymało zapisy na plan Pro za dwieście dolarów,

3:57 ponieważ zapotrzebowanie na Astrę jest, cytuję, bezprecedensowe: pierwszy produkt z listą oczekujących na zapłacenie więcej. Armin spalił pełny reset w swojej fabryce. On jest popytem. Co prowadzi nas do piątkowego Ask HN: czy możemy ograniczyć zalew wiadomości AI, sześćset pięćdziesiąt sześć punktów, ponieważ, cytuję, za każdym razem, gdy ktoś w OpenAI lub Anthropic pierdzi, jest topowy post.

4:17 Odpowiedzi były filtrami: hcker dot news usuwa historie AI za pomocą klasyfikatora BERT przeszkolonego na ośmiu tysiącach przykładów, AI do usuwania AI, karmionej trawą; a regex uBlock pasujący do A-I bez rozróżniania wielkości liter usuwa również email, daily, main, domain i train, więc regex, jak zawsze, jest złoczyńcą. Tego samego popołudnia, czterysta piętnaście komentarzy dyskutowało o stronie wsparcia Claude, mówiącej, że Claude jest dla osób powyżej osiemnastego roku życia.

4:38 Strona jest datowana na maj. Nic się nie zmieniło. Nawet wiadomości AI, które nie są wiadomościami, są wiadomościami, co, szczerze mówiąc, jest również moim modelem biznesowym. Jeśli wolisz to przeczytać, niż usłyszeć ode mnie, diff trafia do twojej skrzynki odbiorczej każdego ranka — za darmo na daily diff dot dev, link poniżej. To jest, nieuchronnie, wiadomość o AI. Więc — dzisiejszy werdykt w sprawie trzydziestopięciogodzinnej fabryki oprogramowania: revert. Siedemdziesiąt dziewięć commitów, których nikt nie przeczytał, to nie baza kodu, to zobowiązanie z logiem

5:04 git; Astra jest imponująca, a fabryka to część, którą należy wycofać. I to jest dzisiejszy diff. Jestem Niko z Axrisi. Scalaj odpowiedzialnie.

## Źródła

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
