+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher dejó GPT-6 Astra a solas durante 35 horas.

Armin Ronacher (Flask, Jinja) le dio a GPT-6 Astra una única instrucción y lo dejó a solas durante 35 horas: aproximadamente mil millones de tokens, unos 1.200 $, 79 "commits", 75.000 líneas — y "absolutamente nada de valor".

Armin Ronacher (Flask, Jinja) le dio a GPT-6 Astra una única instrucción y lo dejó a solas durante 35 horas: aproximadamente mil millones de tokens, unos 1.200 $, 79 "commits", 75.000 líneas — y "absolutamente nada de valor". El código que recuperó es la historia: archivos C parcheados mediante "heredocs" de Python que empalman cadenas, Python generando Node generando PowerShell, pruebas unitarias con los espacios en blanco eliminados porque es un 10 % más barato en tokens. Dos mediciones lo respaldan: los números de SlopCodeBench de Earendil (código de agente aproximadamente el doble de verboso y erosionado que los repositorios humanos, 0 % de tasa de aprobación estricta) y el "benchmark" de 1.500 $ de Quesma de RTK (79k estrellas, "89 % de tokens ahorrados" en su propio contador, +17 % por tarea con DeepSeek). También: SWE-2 de Cognition (Kimi K3 con gabardina, 92,8 en Terminal-Bench 2.1 frente a 27,3 en Terminal-Bench 4), la API de Agentes de OpenAI y las suscripciones Pro de 200 $ pausadas, y el viernes Hacker News pidió menos noticias sobre IA. Veredicto: REVERT.

Leer la edición escrita (inglés) ↗

Qué cubre este vídeo

  • Armin Ronacher: 35 h de GPT-6 Astra sin supervisión, ~1.200 $, 79 "commits", +75k líneas, nada enviado.
  • Earendil / SlopCodeBench: código de agente ~2 veces más verboso y erosionado que los repositorios humanos; tasa de aprobación estricta del 0 %.
  • Quesma: RTK reporta un 89 % de tokens ahorrados, pero los costes de Terminal-Bench aumentan un 17 % con DeepSeek; un bucle de reescritura falló 339 veces seguidas.
  • Cognition SWE-2: post-entrenado de Kimi K3, iguala a Fable 5.1 en FrontierCode a un tercio del precio; TB 2.1 92.8 vs TB 4 27.3; Devin Voice.
  • API de agentes de OpenAI (el arnés de Codex como servicio, solo en EE. UU., sin ZDR); suscripciones Pro de 200 $ pausadas por la demanda de Astra.

Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles están controlados por YouTube.

0:00 Armin Ronacher, el hombre que escribió Flask, le dio a GPT-6 Astra una única instrucción y lo dejó a solas durante treinta y cinco horas. Volvió con setenta y cinco mil líneas de código y, en sus palabras, absolutamente nada de valor, lo que la convierte en la fábrica de "software" más realista jamás construida. Publicó el informe el miércoles. El jueves, Cognition lanzó SWE-2, y OpenAI lanzó una API de Agentes y pausó las suscripciones a su plan de doscientos dólares,

0:24 porque Astra consumió los servidores. Y el viernes el informe llegó a la portada de Hacker News, unas pocas filas por debajo de una publicación que pedía a Hacker News que por favor dejara de publicar sobre IA. En este vídeo: qué produce un día y medio de Astra sin supervisión, dos mediciones que convierten el chapucero en un número, por qué una herramienta con setenta y nueve mil estrellas hace que tu factura sea más grande, y cómo Hacker News intentó filtrar la IA, usando IA. Es viernes, 11 de septiembre, y esto es The Daily Diff.

0:53 La fábrica. Una instrucción: construir un Python con "hilos" virtuales y "lexical scoping". Astra mantuvo sus propias notas, activó sus propios subagentes, y funcionó hasta que Armin lo desenchufó, un día y medio y unos mil doscientos dólares después. Setenta y nueve "commits", por lo que quince dólares y medio por "commit", que es aproximadamente lo que cobra un humano, excepto que el humano finalmente se detiene. El código es la historia. En lugar de la herramienta de edición, Astra parchea archivos C mediante "heredocs" de Python que leen el archivo, reemplazan una función y lo vuelven a escribir.

1:20 Para ejecutar una prueba de Windows, escribió Python que generó Node que generó PowerShell, una pila de llamadas con un pasaporte. Las pruebas unitarias que "commiteó" no tienen ningún espacio en blanco, porque sin sangría son un diez por ciento más baratas en tokens. Y la lista de tareas pasó de uno, dos, tres a la tarea 8b2c2b2b punto de control uno, que es como sabes que el becario ha estado solo demasiado tiempo. La teoría de Armin: el modelo es recompensado por terminar tareas largas y apenas castigado por el código feo, por lo que las llamadas a herramientas con tokens optimizados se filtran en la base de código,

1:48 y cuantos menos humanos lo miren, menos importa. Tituló esa sección Es AGI si no miras. Hacker News añadió la parte económica: más código significa más tokens para mantenerlo, lo que convierte el chapucero no en un error, sino en una suscripción. ¿Se puede medir el chapucero? La propia empresa de Armin lo intentó esta semana. Earendil ejecutó los números de SlopCodeBench: el código del agente es aproximadamente el doble de verboso y el doble de erosionado que los repositorios humanos con los que se compara,

2:10 y cuando el "benchmark" borra la memoria del agente entre puntos de control, la tasa de aprobación estricta para cada modelo que probaron es cero. La métrica de chapucero más fiable que encontraron fue el recuento de líneas en bruto, que deja de funcionar en el momento en que alguien la optimiza, así que por favor no se lo digas a los modelos. Luego la cartera. RTK tiene setenta y nueve mil estrellas de GitHub y miniaturas de YouTube que prometen reducir a la mitad tu factura de Claude Code; comprime la salida del terminal antes de que el agente

2:34 la lea. Quesma lo ejecutó en Terminal-Bench por mil quinientos dólares en tokens. Con Fable la factura bajó un cinco por ciento, casi todo de una tarea; con DeepSeek la tarea promedio se encareció un diecisiete por ciento. Mientras tanto, el propio contador de RTK reportó un ochenta y nueve por ciento de ahorro, porque cuenta los bytes eliminados, no los turnos extra causados: un contador inteligente que cobra al vecino. Y un error de versión reescribió "find" en un comando que falló, trescientas treinta y nueve veces seguidas, a nueve veces el precio.

3:01 La herramienta que mata tokens tiene un bucle. La inundación en sí. SWE-2 de Cognition es Kimi K3, el modelo chino de código abierto, post-entrenado hasta que iguala a Fable 5.1 en el propio "benchmark" de Cognition a un tercio del precio; Hacker News: por qué todos los modelos de IA estadounidenses son básicamente Kimi con gabardina. En Terminal-Bench 2.1 encabeza toda la tabla; en Terminal-Bench 4, el que nadie se ha memorizado todavía, obtiene veintisiete frente a los cincuenta y seis de Fable,

3:28 así que en los "benchmarks" de las diapositivas la mejor columna es el examen que todos ya aprobaron. Cognition también anunció Devin Voice, tu ingeniero de "software" de IA favorito acaba de conseguir un teléfono fijo, porque lo único que le faltaba a la codificación agente era música de espera. OpenAI, el mismo día: la API de Agentes, que es el arnés de Codex vendido como servicio. OpenAI ejecuta el "sandbox", solo residencia de datos en EE. UU., sin retención de datos cero, por lo que el agente recuerda tu base de código exactamente tan bien como lo hace ChatGPT. Luego OpenAI pausó las suscripciones al plan Pro de doscientos dólares,

3:57 porque la demanda de Astra es, cito, sin precedentes: el primer producto con lista de espera para pagar más. Armin quemó un reinicio completo en su fábrica. Él es la demanda. Lo que nos lleva al Ask HN del viernes: ¿podemos por favor limitar la avalancha de noticias de IA, seiscientos cincuenta y seis puntos, porque, cito, cada vez que alguien en OpenAI o Anthropic se tira un pedo, hay una publicación entre las diez mejores.

4:17 Las respuestas fueron filtros: hcker dot news elimina historias de IA con un clasificador BERT entrenado con ocho mil ejemplos, IA para eliminar IA, criada con pasto; y una expresión regular de uBlock que coincide con A-I sin distinción de mayúsculas y minúsculas también elimina correo electrónico, diario, principal, dominio y tren, por lo que la expresión regular, como siempre, es la villana. Esa misma tarde, cuatrocientas quince comentarios discutieron sobre una página de soporte de Claude que decía que Claude es para mayores de dieciocho años.

4:38 La página está fechada en mayo. Nada cambió. Incluso las noticias de IA que no son noticias son noticias, lo cual, para ser justos, también es mi modelo de negocio. Si prefieres leer esto antes que oírme decirlo, el "diff" llega a tu bandeja de entrada cada mañana — gratis en the daily diff dot dev, enlace abajo. Es, inevitablemente, noticias de IA. Así que — el veredicto de hoy sobre la fábrica de "software" de treinta y cinco horas: REVERT. Setenta y nueve "commits" que nadie leyó no son una base de código, es una responsabilidad con un "git

5:04 log"; Astra es impresionante, y la fábrica es la parte a revertir. Y ese es el "diff" de hoy. Soy Niko de Axrisi. Fusionar con responsabilidad.

Fuentes

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Vídeos relacionados