# Armin Ronacher dejó solo a GPT-6 Astra durante 35 horas.

Published: 2026-09-12

Armin Ronacher (Flask, Jinja) le dio a GPT-6 Astra una única indicación y lo dejó solo durante 35 horas: aproximadamente mil millones de tokens, alrededor de $1,200, 79 commits, 75,000 líneas, y "absolutamente nada de valor". El código que recuperó es la historia: archivos C parcheados mediante heredocs de Python que empalman cadenas, Python generando Node que a su vez genera PowerShell, pruebas unitarias con los espacios en blanco eliminados porque es un 10% más barato en tokens. Dos mediciones lo respaldan: los números de SlopCodeBench de Earendil (código de agente aproximadamente el doble de verboso y erosionado que los repositorios humanos, 0% de tasa de aprobación estricta) y el benchmark de $1,500 de Quesma de RTK (79k estrellas, "89% de tokens ahorrados" en su propio contador, +17% por tarea con DeepSeek). También: SWE-2 de Cognition (Kimi K3 disfrazado, 92.8 en Terminal-Bench 2.1 vs 27.3 en Terminal-Bench 4), la API de Agentes de OpenAI y las inscripciones Pro de $200 pausadas, y el viernes Hacker News pidió menos noticias de IA. Veredicto: REVERT.

Canonical: https://thedailydiff.dev/es-US/video/2026-09-11-astra-slop-factory/

## Lo que cubre este video

- Armin Ronacher: 35 h de GPT-6 Astra desatendido, ~$1,200, 79 commits, +75k líneas, nada entregado
- Earendil / SlopCodeBench: código de agente ~2× más verboso y erosionado que los repositorios humanos; tasa de aprobación estricta 0%
- Quesma: RTK reporta 89% de tokens ahorrados, pero los costos de Terminal-Bench suben 17% con DeepSeek; un bucle de reescritura falló 339 veces seguidas
- Cognition SWE-2: post-entrenado desde Kimi K3, iguala a Fable 5.1 en FrontierCode a un tercio del precio; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- API de Agentes de OpenAI (el arnés de Codex como servicio, solo en EE. UU., sin ZDR); inscripciones Pro de $200 pausadas por demanda de Astra

## Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles son controlados por YouTube.

0:00 Armin Ronacher, el hombre que escribió Flask, le dio a GPT-6 Astra una sola indicación y lo dejó solo durante treinta y cinco horas. Regresó con setenta y cinco mil líneas de código y, en sus palabras, absolutamente nada de valor, lo que la convierte en la fábrica de software más realista jamás construida. Publicó el informe el miércoles. El jueves, Cognition lanzó SWE-2, y OpenAI lanzó una API de Agentes y pausó las inscripciones para su plan de doscientos dólares,

0:24 porque Astra se comió los servidores. Y el viernes el informe llegó a la página principal de Hacker News, unas pocas filas debajo de una publicación pidiéndole a Hacker News que por favor dejara de publicar sobre IA. En este video: lo que produce un día y medio de Astra sin supervisión, dos mediciones que convierten el "slop" en un número, por qué una herramienta con setenta y nueve mil estrellas hace que tu factura sea más grande, y cómo Hacker News intentó filtrar la IA, usando IA. Es viernes, 11 de septiembre, y esto es The Daily Diff.

0:53 La fábrica. Una indicación: construir un Python con hilos virtuales y alcance léxico. Astra mantuvo sus propias notas, activó sus propios subagentes, y funcionó hasta que Armin desconectó el enchufe, un día y medio y unos mil doscientos dólares después. Setenta y nueve commits, o sea, quince dólares y medio por commit, que es aproximadamente lo que cobra un humano, excepto que el humano finalmente se detiene. El código es la historia. En lugar de la herramienta de edición, Astra parchea archivos C enviando heredocs de Python que leen el archivo, reemplazan una función e la insertan, y lo vuelven a escribir.

1:20 Para ejecutar una prueba de Windows, escribió Python que generó Node que generó PowerShell, una pila de llamadas con un pasaporte. Las pruebas unitarias que hizo commit no tienen espacios en blanco en absoluto, porque sin indentación son un diez por ciento más baratas en tokens. Y la lista de tareas pasó de uno, dos, tres a la tarea 8b2c2b2b punto de control uno, que es como sabes que el pasante ha estado solo demasiado tiempo. La teoría de Armin: el modelo es recompensado por terminar tareas largas y apenas castigado por código feo, por lo que las llamadas a herramientas con "token-golfed" se filtran en el código base,

1:48 y cuantos menos humanos miran, menos importa. Tituló esa sección Es AGI si no miras. Hacker News añadió la economía: más código significa más tokens para mantenerlo, lo que hace que el "slop" no sea un error, sino una suscripción. ¿Puedes medir el "slop"? La propia empresa de Armin lo intentó esta semana. Earendil ejecutó los números de SlopCodeBench: el código del agente es aproximadamente el doble de verboso y el doble de erosionado que los repositorios humanos con los que se compara,

2:10 y cuando el benchmark borra la memoria del agente entre puntos de control, la tasa de aprobación estricta para cada modelo que probaron es cero. La métrica de "slop" más confiable que encontraron fue el recuento de líneas en bruto, lo que deja de funcionar en el momento en que alguien lo optimiza, así que por favor no se lo digas a los modelos. Luego la billetera. RTK tiene setenta y nueve mil estrellas de GitHub y miniaturas de YouTube que prometen reducir a la mitad tu factura de Claude Code; comprime la salida del terminal antes de que el agente

2:34 lo lea. Quesma lo ejecutó en Terminal-Bench por mil quinientos dólares en tokens. Con Fable, la factura bajó un cinco por ciento, casi todo de una tarea; con DeepSeek la tarea promedio se volvió un diecisiete por ciento más cara. Mientras tanto, el propio contador de RTK reportó un ochenta y nueve por ciento ahorrado, porque cuenta los bytes eliminados, no los turnos extra causados: un medidor inteligente que le cobra al vecino. Y un error de versión reescribió "find" en un comando que falló, trescientas treinta y nueve veces seguidas, a nueve veces el precio.

3:01 La herramienta que elimina tokens tiene un bucle. La inundación en sí. SWE-2 de Cognition es Kimi K3, el modelo chino abierto, post-entrenado hasta que iguala a Fable 5.1 en el propio benchmark de Cognition a un tercio del precio; Hacker News: por qué todos los modelos de IA estadounidenses son básicamente Kimi con gabardina. En Terminal-Bench 2.1 encabeza toda la tabla; en Terminal-Bench 4, el que nadie ha memorizado todavía, obtiene veintisiete puntos frente a los cincuenta y seis de Fable,

3:28 así que en los benchmarks de las presentaciones la mejor columna es el examen que todos ya aprobaron. Cognition también anunció Devin Voice, tu ingeniero de software de IA favorito acaba de recibir un teléfono fijo, porque lo único que le faltaba a la codificación agéntica era música de espera. OpenAI, el mismo día: la API de Agentes, que es el arnés de Codex vendido como servicio. OpenAI ejecuta el sandbox, solo residencia de datos en EE. UU., sin retención de datos cero, así que el agente recuerda tu base de código exactamente tan bien como ChatGPT. Luego OpenAI pausó las inscripciones para el plan Pro de doscientos dólares,

3:57 porque la demanda de Astra es, cito, sin precedentes: el primer producto con lista de espera para pagar más. Armin quemó un reinicio completo en su fábrica. Él es la demanda. Lo que nos lleva al Ask HN del viernes: ¿podemos por favor limitar la avalancha de noticias de IA, seiscientos cincuenta y seis puntos, porque, cito, cada vez que alguien en OpenAI o Anthropic se tira un pedo, hay una publicación entre las diez mejores.

4:17 Las respuestas fueron filtros: hcker dot news elimina historias de IA con un clasificador BERT entrenado con ocho mil ejemplos, IA para eliminar IA, alimentado con pasto; y una expresión regular de uBlock que coincide con A-I sin distinción de mayúsculas y minúsculas también elimina correo electrónico, diario, principal, dominio y tren, por lo que la expresión regular, como siempre, es el villano. Esa misma tarde, cuatrocientos quince comentarios discutieron sobre una página de soporte de Claude que decía que Claude es para mayores de dieciocho años.

4:38 La página está fechada en mayo. Nada cambió. Incluso las noticias de IA que no son noticias son noticias, lo cual, para ser justos, también es mi modelo de negocio. Si prefieres leer esto antes que oírme decirlo, el "diff" llega a tu bandeja de entrada todas las mañanas — gratis en the daily diff dot dev, enlace abajo. Es, inevitablemente, noticias de IA. Así que — el veredicto de hoy sobre la fábrica de software de treinta y cinco horas: revertir. Setenta y nueve commits que nadie leyó no es una base de código, es un pasivo con un registro de git;

5:04 Astra es impresionante, y la fábrica es la parte que hay que revertir. Y ese es el "diff" de hoy. Soy Niko de Axrisi. Fusiona responsablemente.

## Fuentes

- [Armin Ronacher — Astra for Coding: Why Are We Doing This Again?](https://lucumr.pocoo.org/2026/9/7/astra-why/) — lucumr.pocoo.org
- [HN: Astra for Coding](https://news.ycombinator.com/item?id=49654229) — news.ycombinator.com
- [Earendil — Measuring the sloppiness of code](https://earendil.com/posts/measuring-code-sloppiness/) — earendil.com
- [HN: Measuring the sloppiness of code](https://news.ycombinator.com/item?id=49658311) — news.ycombinator.com
- [Quesma — RTK reports huge token savings, but our cost benchmarks disagree](https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/) — quesma.com
- [HN: RTK](https://news.ycombinator.com/item?id=49656471) — news.ycombinator.com
- [RTK (Rust Token Killer)](https://github.com/rtk-ai/rtk) — github.com
- [Cognition — Introducing SWE-2](https://cognition.com/blog/swe-2) — cognition.com
- [HN: Cognition SWE-2](https://news.ycombinator.com/item?id=49645443) — news.ycombinator.com
- [OpenAI — Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) — developers.openai.com
- [HN: OpenAI Agents API](https://news.ycombinator.com/item?id=49649213) — news.ycombinator.com
- [TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demand](https://techcrunch.com/2026/09/10/openai-puts-pro-subscriptions-on-hold-due-to-astra-demand/) — techcrunch.com
- [Ask HN: Can we please limit the AI news flood?](https://news.ycombinator.com/item?id=49657850) — news.ycombinator.com
- [HN: Claude is only available to people over 18 years](https://news.ycombinator.com/item?id=49656225) — news.ycombinator.com
