Армин Ронахер оставил GPT-6 Astra на 35 часов.
Армин Ронахер (Flask, Jinja) дал GPT-6 Astra один запрос и оставил её на 35 часов: около миллиарда токенов, около $1200, 79 коммитов, 75 000 строк — и «абсолютно ничего ценного».
Армин Ронахер (Flask, Jinja) дал GPT-6 Astra один запрос и оставил её на 35 часов: около миллиарда токенов, около $1200, 79 коммитов, 75 000 строк — и «абсолютно ничего ценного». Восстановленный код — это целая история: C-файлы, пропатченные строковой склейкой heredoc'ов Python, Python, запускающий Node, который запускает PowerShell, модульные тесты с удалёнными пробелами, потому что это на 10% дешевле в токенах. Его поддерживают два измерения: показатели SlopCodeBench от Earendil (агентский код примерно в два раза более многословный и «разъеденный», чем человеческие репозитории, 0% строгий коэффициент прохождения) и бенчмарк Quesma за $1500 для RTK (79k звёзд, «89% токенов сэкономлено» по собственному счётчику, +17% на задачу с DeepSeek). Также: SWE-2 от Cognition (Kimi K3 в плаще, 92,8 на Terminal-Bench 2.1 против 27,3 на Terminal-Bench 4), Agents API от OpenAI и приостановленная регистрация Pro за $200, а также пятничный Hacker News, который просил меньше новостей об ИИ. Вердикт: REVERT.
Читать письменное издание (на английском) ↗
Что освещается в этом видео
- Армин Ронахер: 35 часов без присмотра GPT-6 Astra, ~1200 долларов, 79 коммитов, +75 тысяч строк, ничего не выпущено.
- Earendil / SlopCodeBench: агентский код ~в 2 раза более многословный и «разъеденный», чем человеческие репозитории; строгий коэффициент прохождения 0%.
- Quesma: RTK сообщает о 89% сэкономленных токенов, но затраты Terminal-Bench увеличиваются на 17% с DeepSeek; цикл перезаписи не удался 339 раз подряд.
- Cognition SWE-2: дообучен с Kimi K3, соответствует Fable 5.1 на FrontierCode по трети цены; TB 2.1 92.8 против TB 4 27.3; Devin Voice.
- OpenAI Agents API (сервис Codex harness, только для США, без ZDR); регистрация Pro за 200 долларов приостановлена из-за спроса на Astra.
Переведенная стенограмма
Переведено с оригинального английского повествования. Доступные аудио и субтитры контролируются YouTube.
0:00 Армин Ронахер, человек, написавший Flask, дал GPT-6 Astra один единственный запрос и оставил её на тридцать пять часов. Она вернулась с семьюдесятью пятью тысячами строк кода и, по его словам, абсолютно ничем ценным, что делает её самой реалистичной из когда-либо созданных фабрик программного обеспечения. Он опубликовал отчёт в среду. В четверг Cognition выпустила SWE-2, а OpenAI выпустила Agents API и приостановила регистрацию на свой план за двести долларов,
0:24 потому что Astra "съела" серверы. А в пятницу отчёт попал на главную страницу Hacker News, на несколько строк ниже поста, просившего Hacker News, пожалуйста, перестать публиковать новости об ИИ. В этом видео: что производит полтора дня без присмотра Astra, два измерения, которые превращают халтуру в число, почему инструмент с семьюдесятью девятью тысячами звёзд увеличивает ваш счёт, и как Hacker News пыталась отфильтровать ИИ, используя ИИ. Сегодня пятница, 11 сентября, и это The Daily Diff.
0:53 Фабрика. Один запрос: создать Python с виртуальными потоками и лексической областью видимости. Astra вела свои собственные записи, запускала своих субагентов, и работала, пока Армин не отключил её, полтора дня и около двенадцати сотен долларов спустя. Семьдесят девять коммитов, то есть пятнадцать с половиной долларов за коммит, что примерно соответствует тому, сколько берёт человек, за исключением того, что человек в конце концов останавливается. Код — это история. Вместо инструмента редактирования Astra патчит C-файлы, передавая Python-хередоки, которые читают файл, строково заменяют функцию и записывают её обратно.
1:20 Чтобы запустить один тест на Windows, она написала Python, который запускал Node, который запускал PowerShell, стек вызовов с паспортом. Модульные тесты, которые она закоммитила, вообще не содержат пробелов, потому что без отступов они на десять процентов дешевле в токенах. А список задач дрейфовал от один, два, три до задачи 8b2c2b2b контрольная точка один, что является признаком того, что стажёр слишком долго был один. Теория Армина: модель вознаграждается за выполнение долгих задач и почти не наказывается за некрасивый код, поэтому «токен-гольфированные» вызовы инструментов просачиваются в кодовую базу,
1:48 и чем меньше людей смотрит, тем меньше это имеет значение. Он назвал этот раздел «Это ИИ, если вы не смотрите». Hacker News добавил экономику: больше кода означает больше токенов для его поддержки, что делает халтуру не ошибкой, а подпиской. Можно ли измерить халтуру? Собственная компания Армина попробовала это на этой неделе. Earendil провёл расчёты SlopCodeBench: агентский код примерно в два раза более многословный и в два раза более «разъеденный», чем человеческие репозитории, с которыми он сравнивается,
2:10 и когда бенчмарк очищает память агента между контрольными точками, строгий коэффициент прохождения для каждой протестированной ими модели равен нулю. Самым надёжным показателем халтуры, который они нашли, был чистый подсчёт строк, который перестаёт работать в тот момент, когда кто-либо начинает оптимизировать под него, поэтому, пожалуйста, не говорите моделям. Затем кошелёк. У RTK семьдесят девять тысяч звёзд на GitHub и YouTube-превью, обещающие уменьшить вдвое ваш счёт за Claude Code; он сжимает вывод терминала до того, как агент
2:34 прочитает его. Quesma запустил его на Terminal-Bench за полторы тысячи долларов в токенах. С Fable счёт упал на пять процентов, почти полностью за счёт одной задачи; с DeepSeek средняя задача стала на семнадцать процентов дороже. Тем временем собственный счётчик RTK сообщал о восьмидесяти девяти процентах экономии, потому что он считает удалённые байты, а не вызванные дополнительные шаги: умный счётчик, который выставляет счёт соседу. И одна ошибка версии переписала find в команду, которая завершалась с ошибкой, триста тридцать девять раз подряд, по цене в девять раз выше.
3:01 Инструмент, который убивает токены, имеет цикл. Сам поток. SWE-2 от Cognition — это Kimi K3, открытая китайская модель, дообученная до того, что она соответствует Fable 5.1 на собственном бенчмарке Cognition по трети цены; Hacker News: почему все американские модели ИИ — это по сути Kimi в плаще. На Terminal-Bench 2.1 она возглавляет всю таблицу; на Terminal-Bench 4, той, которую ещё никто не запомнил, она набирает двадцать семь против пятидесяти шести у Fable,
3:28 так что на бенчмарках для слайд-деков лучшая колонка — это экзамен, который все уже сдали. Cognition также анонсировала Devin Voice, ваш любимый инженер-программист ИИ только что получил стационарный телефон, потому что единственное, чего не хватало агентскому кодированию, это музыка для ожидания. OpenAI, в тот же день: Agents API, который является Codex harness, продаваемым как услуга. OpenAI запускает песочницу, только для данных США, без сохранения данных (no zero-data-retention), так что агент запоминает вашу кодовую базу ровно так же хорошо, как ChatGPT. Затем OpenAI приостановила регистрацию на план Pro за двести долларов,
3:57 потому что спрос на Astra, цитирую, «беспрецедентен»: первый продукт со списком ожидания чтобы заплатить больше. Армин полностью сбросил настройки своей фабрики. Он и есть спрос. Что подводит нас к пятничному Ask HN: можем ли мы, пожалуйста, ограничить поток новостей об ИИ, шестьсот пятьдесят шесть очков, потому что, цитирую, «каждый раз, когда кто-то в OpenAI или Anthropic издаёт звук, появляется пост в первой десятке».
4:17 Ответы были фильтрами: hcker.news удаляет истории об ИИ с помощью BERT классификатора, обученного на восьми тысячах примеров, ИИ для удаления ИИ, «натуральный»; а uBlock regex, совпадающий с A-I без учёта регистра, также удаляет email, daily, main, domain и train, так что regex, как всегда, является злодеем. В тот же день днём, четыреста пятнадцать комментариев спорили о странице поддержки Claude, говорящей, что Claude предназначен для лиц старше восемнадцати лет.
4:38 Страница датирована маем. Ничего не изменилось. Даже новости об ИИ, которые не являются новостями, являются новостями, что, справедливости ради, также является моей бизнес-моделью. Если вы предпочитаете прочитать это, а не услышать от меня, то "разница" приходит на вашу почту каждое утро — бесплатно на the daily diff dot dev, ссылка ниже. Это, неизбежно, новости об ИИ. Итак — сегодняшний вердикт по тридцатипятичасовой фабрике программного обеспечения: REVERT. Семьдесят девять непрочитанных коммитов — это не кодовая база, это обязательство с git
5:04 журналом; Astra впечатляет, и фабрика — это та часть, которую нужно откатить. И это вся "разница" на сегодня. Я Нико из Axrisi. Объединяйте ответственно.
Источники
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



