Armin Ronacher a laissé GPT-6 Astra seul pendant 35 heures.
Armin Ronacher (Flask, Jinja) a donné une seule instruction à GPT-6 Astra et l'a laissé seul pendant 35 heures : environ un milliard de jetons, environ 1 200 $, 79 commits, 75 000 lignes — et « absolument rien de valeur ».
Armin Ronacher (Flask, Jinja) a donné une seule instruction à GPT-6 Astra et l'a laissé seul pendant 35 heures : environ un milliard de jetons, environ 1 200 $, 79 commits, 75 000 lignes — et « absolument rien de valeur ». Le code qu'il a récupéré est l'histoire : des fichiers C patchés par des heredocs Python à découpage de chaînes, Python engendrant Node qui engendre PowerShell, des tests unitaires sans espaces blancs car cela coûte 10 % moins cher en jetons. Deux mesures le confirment : les chiffres de SlopCodeBench d'Earendil (code d'agent environ deux fois plus verbeux et érodé que les dépôts humains, 0 % de taux de réussite strict) et le benchmark de 1 500 $ de Quesma pour RTK (79 000 étoiles, « 89 % de jetons économisés » sur son propre compteur, +17 % par tâche avec DeepSeek). Aussi : SWE-2 de Cognition (Kimi K3 sous un imperméable, 92,8 sur Terminal-Bench 2.1 contre 27,3 sur Terminal-Bench 4), l'API Agents d'OpenAI et les inscriptions Pro à 200 $ mises en pause, et le Hacker News de vendredi demandait moins de nouvelles sur l'IA. Verdict : REVERT.
Lire l'édition écrite (anglais) ↗
Ce que couvre cette vidéo
- Armin Ronacher : 35 h de GPT-6 Astra sans surveillance, ~1 200 $, 79 commits, +75k lignes, rien de livré
- Earendil / SlopCodeBench : code d'agent ~2× plus verbeux et érodé que les dépôts humains ; taux de réussite strict 0%
- Quesma : RTK rapporte 89 % de jetons économisés, mais les coûts de Terminal-Bench augmentent de 17 % avec DeepSeek ; une boucle de réécriture a échoué 339 fois de suite
- Cognition SWE-2 : post-entraîné à partir de Kimi K3, il correspond à Fable 5.1 sur FrontierCode pour un tiers du prix ; TB 2.1 92,8 vs TB 4 27,3 ; Devin Voice
- API OpenAI Agents (le harnais Codex en tant que service, US uniquement, pas de ZDR) ; inscriptions Pro à 200 $ mises en pause pour la demande Astra
Transcription traduite
Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont gérés par YouTube.
0:00 Armin Ronacher, l'homme qui a écrit Flask, a donné une seule instruction à GPT-6 Astra et l'a laissé seul pendant trente-cinq heures. Il est revenu avec soixante-quinze mille lignes de code et, selon ses mots, absolument rien de valeur, ce qui en fait la plus réaliste usine logicielle jamais construite. Il a publié l'article mercredi. Jeudi, Cognition a livré SWE-2, et OpenAI a livré une API Agents et a mis en pause les inscriptions à son plan de deux cents dollars,
0:24 parce qu'Astra a mangé les serveurs. Et vendredi, l'article a atteint la première page de Hacker News, quelques lignes en dessous d'un article demandant à Hacker News d'arrêter de publier des nouvelles sur l'IA. Dans cette vidéo : ce que produit un jour et demi d'Astra sans supervision, deux mesures qui transforment le désordre en un nombre, pourquoi un outil avec soixante-dix-neuf mille étoiles augmente votre facture, et comment Hacker News a essayé de filtrer l'IA, en utilisant l'IA. Nous sommes le vendredi 11 septembre, et voici The Daily Diff.
0:53 L'usine. Une instruction : construire un Python avec des threads virtuels et une portée lexicale. Astra a pris ses propres notes, a lancé ses propres sous-agents, et a fonctionné jusqu'à ce qu'Armin débranche la prise, un jour et demi et environ douze cents dollars plus tard. Soixante-dix-neuf commits, soit quinze dollars et demi par commit, ce qui est à peu près ce qu'un humain facture, sauf que l'humain s'arrête éventuellement. Le code est l'histoire. Au lieu de l'outil d'édition, Astra patche les fichiers C en acheminant des heredocs Python qui lisent le fichier, insèrent une fonction par remplacement de chaîne, et le réécrivent.
1:20 Pour exécuter un test Windows, il a écrit du Python qui a lancé Node qui a lancé PowerShell, une pile d'appels avec un passeport. Les tests unitaires qu'il a commis n'ont aucun espace blanc, car sans indentation, ils sont dix pour cent moins chers en jetons. Et la liste des tâches est passée de un, deux, trois à tâche 8b2c2b2b point de contrôle un, ce qui est la façon de savoir que le stagiaire a été seul trop longtemps. La théorie d'Armin : le modèle est récompensé pour avoir terminé de longues tâches et à peine puni pour du code moche, donc les appels d'outils optimisés en jetons se répandent dans le code,
1:48 et moins il y a d'humains qui regardent, moins cela importe. Il a intitulé cette section C'est de l'AGI si vous ne regardez pas. Hacker News a ajouté l'économie : plus de code signifie plus de jetons pour le maintenir, ce qui fait du désordre non pas un bug mais un abonnement. Peut-on mesurer le désordre ? La propre entreprise d'Armin a essayé cette semaine. Earendil a exécuté les chiffres de SlopCodeBench : le code d'agent est environ deux fois plus verbeux et deux fois plus érodé que les dépôts humains auxquels il est comparé,
2:10 et lorsque le benchmark efface la mémoire de l'agent entre les points de contrôle, le taux de réussite strict pour chaque modèle testé est de zéro. La métrique de désordre la plus fiable qu'ils ont trouvée était le nombre brut de lignes, qui cesse de fonctionner dès que quelqu'un l'optimise, alors s'il vous plaît, ne le dites pas aux modèles. Ensuite le portefeuille. RTK a soixante-dix-neuf mille étoiles GitHub et des vignettes YouTube promettant de réduire de moitié votre facture Claude Code ; il compresse la sortie du terminal avant que l'agent
2:34 ne la lise. Quesma l'a exécuté sur Terminal-Bench pour quinze cents dollars de jetons. Avec Fable, la facture a diminué de cinq pour cent, presque entièrement grâce à une seule tâche ; avec DeepSeek la tâche moyenne est devenue dix-sept pour cent plus chère. Pendant ce temps, le propre compteur de RTK rapportait quatre-vingt-neuf pour cent d'économies, parce qu'il compte les octets supprimés, pas les tours supplémentaires causés : un compteur intelligent qui facture le voisin. Et un bug de version a réécrit find en une commande qui a échoué, trois cent trente-neuf fois de suite, à neuf fois le prix.
3:01 L'outil qui tue les jetons a une boucle. Le déluge lui-même. Le SWE-2 de Cognition est Kimi K3, le modèle chinois ouvert, post-entraîné jusqu'à ce qu'il corresponde à Fable 5.1 sur le propre benchmark de Cognition pour un tiers du prix ; Hacker News : pourquoi tous les modèles d'IA américains sont-ils essentiellement Kimi sous un imperméable. Sur Terminal-Bench 2.1, il domine tout le tableau ; sur Terminal-Bench 4, celui que personne n'a encore mémorisé, il marque vingt-sept contre cinquante-six pour Fable,
3:28 donc sur les benchmarks de diapositives, la meilleure colonne est l'examen que tout le monde a déjà réussi. Cognition a également annoncé Devin Voice, votre ingénieur logiciel IA préféré vient d'avoir une ligne fixe, parce que la seule chose qui manquait à la programmation agentique était la musique d'attente. OpenAI, le même jour : l'API Agents, qui est le harnais Codex vendu comme un service. OpenAI gère le sandbox, résidence des données US uniquement, pas de rétention de données nulle, donc l'agent se souvient de votre base de code exactement aussi bien que ChatGPT. Ensuite, OpenAI a mis en pause les inscriptions au plan Pro de deux cents dollars,
3:57 parce que la demande pour Astra est, je cite, sans précédent : le premier produit avec une liste d'attente pour payer plus. Armin a effectué une réinitialisation complète de son usine. Il est la demande. Ce qui nous amène à la question de vendredi sur Ask HN : pouvons-nous s'il vous plaît limiter le flux de nouvelles sur l'IA, six cent cinquante-six points, parce que, je cite, chaque fois que quelqu'un chez OpenAI ou Anthropic pète, il y a un article dans le top dix.
4:17 Les réponses étaient des filtres : hcker.news supprime les histoires d'IA avec un classifieur BERT entraîné sur huit mille exemples, IA pour supprimer l'IA, élevé à l'herbe ; et une expression régulière uBlock correspondant à A-I sans distinction de casse supprime également email, daily, main, domain et train, donc l'expression régulière, comme toujours, est le méchant. Le même après-midi, quatre cent quinze commentaires ont débattu d'une page de support de Claude disant que Claude est réservé aux plus de dix-huit ans.
4:38 La page est datée de mai. Rien n'a changé. Même les nouvelles sur l'IA qui ne sont pas des nouvelles sont des nouvelles, ce qui, pour être juste, est aussi mon modèle économique. Si vous préférez lire ceci plutôt que de m'entendre le dire, The Daily Diff arrive dans votre boîte de réception chaque matin — gratuit sur the daily diff dot dev, lien ci-dessous. C'est, inévitablement, des nouvelles sur l'IA. Alors — le verdict d'aujourd'hui sur l'usine logicielle de trente-cinq heures : REVERT. Soixante-dix-neuf commits que personne n'a lus ne constituent pas une base de code, c'est une responsabilité avec un journal git
5:04 ; Astra est impressionnant, et l'usine est la partie à annuler. Et c'est le diff pour aujourd'hui. Je suis Niko d'Axrisi. Fusionnez de manière responsable.
Sources
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



