# Армін Ронахер залишив GPT-6 Astra на 35 годин.

Published: 2026-09-12

Армін Ронахер (Flask, Jinja) дав GPT-6 Astra одне підказку та залишив її на 35 годин: близько мільярда токенів, близько 1200 доларів, 79 коммітів, 75 000 рядків — і "абсолютно нічого цінного". Код, який вона відновила, — це ціла історія: файли C, виправлені за допомогою heredoc-ів Python для вставки рядків, Python, що запускає Node, який запускає PowerShell, юніт-тести з видаленими пробілами, тому що це на 10% дешевше в токенах. Його підтверджують два виміри: показники Earendil's SlopCodeBench (код агента приблизно вдвічі багатослівніший та еродованіший, ніж репозиторії людей, 0% жорсткий показник проходження) та бенчмарк Quesma вартістю 1500 доларів для RTK (79 тис. зірок, "89% токенів збережено" за власним лічильником, +17% за завдання з DeepSeek). Також: SWE-2 від Cognition (Kimi K3 у плащі, 92,8 на Terminal-Bench 2.1 проти 27,3 на Terminal-Bench 4), API агента OpenAI та призупинена реєстрація на $200 Pro, а також п'ятничний Hacker News, який просив менше новин про ШІ. Висновок: REVERT.

Canonical: https://thedailydiff.dev/uk/video/2026-09-11-astra-slop-factory/

## Що охоплює це відео

- Армін Ронахер: 35 годин без нагляду GPT-6 Astra, ~1200 доларів, 79 коммітів, +75 тис. рядків, нічого не SHIP IT
- Earendil / SlopCodeBench: код агента ~2× багатослівніший та еродованіший, ніж репозиторії людей; суворий показник проходження 0%
- Quesma: RTK повідомляє про економію 89% токенів, але витрати Terminal-Bench зростають на 17% з DeepSeek; цикл переписування провалився 339 разів поспіль
- Cognition SWE-2: постнавчений з Kimi K3, відповідає Fable 5.1 на FrontierCode за третину ціни; TB 2.1 92.8 проти TB 4 27.3; Devin Voice
- API агентів OpenAI (інструмент Codex як послуга, тільки для США, без ZDR); реєстрації на Pro за $200 призупинені через попит на Astra

## Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

0:00 Армін Ронахер, людина, яка написала Flask, дав GPT-6 Astra одну підказку і залишив її на тридцять п'ять годин. Вона повернула сімдесят п'ять тисяч рядків коду і, за його словами, абсолютно нічого цінного, що робить її найреалістичнішою фабрикою програмного забезпечення, коли-небудь створеною. Він опублікував звіт у середу. У четвер Cognition випустила SWE-2, а OpenAI — API агентів і призупинила реєстрацію на свій план за двісті доларів,

0:24 тому що Astra заповнила сервери. А в п'ятницю звіт потрапив на головну сторінку Hacker News, на кілька рядків нижче допису, що просив Hacker News, будь ласка, припинити публікувати новини про ШІ. У цьому відео: що створює півтора дня без нагляду Astra, два виміри, які перетворюють безлад на число, чому інструмент із сімдесят дев'ятьма тисячами зірок збільшує ваш рахунок, і як Hacker News намагався відфільтрувати ШІ, використовуючи ШІ. Сьогодні п'ятниця, 11 вересня, і це The Daily Diff.

0:53 Фабрика. Одне підказка: створити Python з віртуальними потоками та лексичною областю видимості. Astra вела власні нотатки, запускала власні підагенти, і працювала, поки Армін не вимкнув її, через півтора дня і близько дванадцяти сотень доларів. Сімдесят дев'ять коммітів, тобто п'ятнадцять з половиною доларів за комміт, що приблизно відповідає тому, скільки бере людина, за винятком того, що людина врешті-решт зупиняється. Код — це історія. Замість інструменту редагування Astra виправляє файли C, передаючи heredoc-и Python, які читають файл, замінюють функцію рядком і записують його назад.

1:20 Щоб запустити один тест Windows, вона написала Python, який запустив Node, який запустив PowerShell, стек викликів з паспортом. Юніт-тести, які вона закоммітила, взагалі не мають пробілів, тому що без відступів вони на десять відсотків дешевші в токенах. І список завдань змінився з один, два, три на завдання 8b2c2b2b контрольна точка один, що свідчить про те, що інтерн занадто довго був один. Теорія Арміна: модель винагороджується за виконання довгих завдань і майже не карається за негарний код, тому виклики інструментів, що заощаджують токени, проникають у кодову базу,

1:48 і чим менше людей дивиться, тим менше це має значення. Він назвав цей розділ "Це ШІ, якщо ви не дивитеся". Hacker News додав економіку: більше коду означає більше токенів для його підтримки, що робить безлад не помилкою, а підпискою. Чи можна виміряти безлад? Власна компанія Арміна спробувала це цього тижня. Earendil провів розрахунки SlopCodeBench: код агента приблизно вдвічі багатослівніший і вдвічі еродованіший, ніж людські репозиторії, з якими його порівнюють,

2:10 і коли бенчмарк очищає пам'ять агента між контрольними точками, жорсткий показник проходження для кожної протестованої ними моделі дорівнює нулю. Найбільш надійним показником безладу, який вони знайшли, була сира кількість рядків, яка перестає працювати в той момент, коли хтось її оптимізує, тому, будь ласка, не кажіть моделям. Потім гаманець. RTK має сімдесят дев'ять тисяч зірок GitHub та мініатюри на YouTube, що обіцяють зменшити ваш рахунок за Claude Code вдвічі; він стискає вивід терміналу, перш ніж агент

2:34 його прочитає. Quesma запустила його на Terminal-Bench за тисячу п'ятсот доларів токенів. З Fable рахунок зменшився на п'ять відсотків, майже все з одного завдання; з DeepSeek середнє завдання стало на сімнадцять відсотків дорожчим. Тим часом власний лічильник RTK повідомляв про вісімдесят дев'ять відсотків економії, тому що він рахує видалені байти, а не додаткові повороти, що викликані: розумний лічильник, який виставляє рахунок сусідові. І одна помилка версії переписала find на команду, яка не спрацювала, триста тридцять дев'ять разів поспіль, за дев'ять разів дорожче.

3:01 Інструмент, що вбиває токени, має цикл. Сама повінь. SWE-2 від Cognition — це Kimi K3, відкрита китайська модель, постнавчена до того, що вона відповідає Fable 5.1 на власному бенчмарку Cognition за третину ціни; Hacker News: чому всі американські моделі ШІ — це, по суті, Kimi в плащі. На Terminal-Bench 2.1 вона очолює всю таблицю; на Terminal-Bench 4, тій, яку ще ніхто не запам'ятав, вона набирає двадцять сім проти п'ятдесяти шести Fable,

3:28 тому на бенчмарках слайд-деків найкраща колонка — це іспит, який усі вже здали. Cognition також анонсувала Devin Voice, ваш улюблений інженер програмного забезпечення ШІ щойно отримав стаціонарний телефон, тому що єдине, чого бракувало агентському кодуванню, це музика для очікування. OpenAI, того ж дня: API агентів, який є інструментом Codex, що продається як послуга. OpenAI запускає пісочницю, лише для США, без збереження даних, тому агент пам'ятає вашу кодову базу так само добре, як і ChatGPT. Потім OpenAI призупинила реєстрацію на план Pro за двісті доларів,

3:57 тому що попит на Astra, цитую, безпрецедентний: перший продукт зі списком очікування, щоб платити більше. Армін здійснив повне скидання на своїй фабриці. Він є попитом. Що підводить нас до п'ятничного Ask HN: чи можемо ми, будь ласка, обмежити потік новин про ШІ, шістсот п'ятдесят шість балів, тому що, цитую, кожного разу, коли хтось в OpenAI або Anthropic пукає, з'являється допис у топ-десять.

4:17 Відповіді були фільтрами: hcker dot news видаляє історії про ШІ за допомогою BERT класифікатора, навченого на восьми тисячах прикладів, ШІ для видалення ШІ, вирощений на пасовищах; і uBlock regex, що збігається з A-I без урахування регістру, також видаляє email, daily, main, domain і train, тому regex, як завжди, є лиходієм. Того ж дня, після обіду, чотириста п'ятнадцять коментарів обговорювали сторінку підтримки Claude, де зазначено, що Claude призначений для осіб віком від вісімнадцяти років.

4:38 Сторінка датована травнем. Нічого не змінилося. Навіть новини про ШІ, які не є новинами, є новинами, що, чесно кажучи, також є моєю бізнес-моделлю. Якщо ви бажаєте прочитати це, а не чути, як я це кажу, то The Daily Diff надходить на вашу поштову скриньку щоранку — безкоштовно на daily diff dot dev, посилання нижче. Це, неминуче, новини про ШІ. Отже — сьогоднішній вердикт щодо тридцятип'ятигодинної фабрики програмного забезпечення: REVERT. Сімдесят дев'ять коммітів, які ніхто не прочитав, — це не кодова база, це відповідальність з git

5:04 журналом; Astra вражаюча, і фабрика — це та частина, яку потрібно відкотити. І це The Daily Diff на сьогодні. Я Ніко з Axrisi. Об'єднуйте відповідально.

## Джерела

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
