+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher deixou o GPT-6 Astra sozinho por 35 horas.

Armin Ronacher (Flask, Jinja) deu ao GPT-6 Astra um comando e deixou-o sozinho por 35 horas: cerca de um bilhão de tokens, cerca de $1.200, 79 commits, 75.000 linhas — e "absolutamente nada de valor".

Armin Ronacher (Flask, Jinja) deu ao GPT-6 Astra um comando e deixou-o sozinho por 35 horas: cerca de um bilhão de tokens, cerca de $1.200, 79 commits, 75.000 linhas — e "absolutamente nada de valor". O código que recuperou é a história: ficheiros C corrigidos por heredocs de string-splicing em Python, Python a gerar Node a gerar PowerShell, testes unitários com o espaço em branco removido porque é 10% mais barato em tokens. Duas medições o apoiam: os números do SlopCodeBench de Earendil (código de agente cerca de duas vezes mais verboso e erodido que repositórios humanos, 0% de taxa de aprovação estrita) e o benchmark de $1.500 de Quesma de RTK (79k estrelas, "89% de tokens poupados" no seu próprio contador, +17% por tarefa com DeepSeek). Além disso: SWE-2 da Cognition (Kimi K3 num sobretudo, 92.8 no Terminal-Bench 2.1 vs 27.3 no Terminal-Bench 4), API de Agentes da OpenAI e inscrições Pro de $200 pausadas, e o Hacker News de sexta-feira pediu menos notícias de IA. Veredicto: REVERT.

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Armin Ronacher: 35 h de GPT-6 Astra sem supervisão, ~$1.200, 79 commits, +75k linhas, nada entregue
  • Earendil / SlopCodeBench: código de agente ~2× mais verboso e erodido que repositórios humanos; taxa de aprovação estrita 0%
  • Quesma: RTK reporta 89% de tokens poupados, mas os custos do Terminal-Bench aumentam 17% com DeepSeek; um ciclo de reescrita falhou 339 vezes seguidas
  • Cognition SWE-2: pós-treinado a partir de Kimi K3, corresponde a Fable 5.1 no FrontierCode a um terço do preço; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
  • OpenAI Agents API (o arnês Codex como um serviço, apenas EUA, sem ZDR); inscrições Pro de $200 pausadas devido à procura por Astra

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

0:00 Armin Ronacher, o homem que escreveu Flask, deu ao GPT-6 Astra um único comando e deixou-o sozinho por trinta e cinco horas. Ele voltou com setenta e cinco mil linhas de código e, nas suas palavras, absolutamente nada de valor, o que a torna a mais realista fábrica de software alguma vez construída. Ele publicou a descrição na quarta-feira. Na quinta-feira, a Cognition lançou o SWE-2, e a OpenAI lançou uma API de Agentes e pausou as inscrições para o seu plano de duzentos dólares,

0:24 porque a Astra comeu os servidores. E na sexta-feira a descrição chegou à primeira página do Hacker News, algumas linhas abaixo de uma publicação pedindo ao Hacker News para parar de publicar sobre IA. Neste vídeo: o que um dia e meio de Astra não supervisionado produz, duas medições que transformam a porcaria num número, por que uma ferramenta com setenta e nove mil estrelas faz a sua conta ficar maior, e como o Hacker News tentou filtrar a IA, usando IA. É sexta-feira, 11 de setembro, e este é o The Daily Diff.

0:53 A fábrica. Um comando: construir um Python com threads virtuais e escopo léxico. Astra manteve as suas próprias notas, criou os seus próprios subagentes, e funcionou até Armin desligar, um dia e meio e cerca de mil e duzentos dólares depois. Setenta e nove commits, então quinze dólares e meio por commit, que é o que um humano cobra, exceto que o humano eventualmente para. O código é a história. Em vez da ferramenta de edição, Astra corrige ficheiros C através da utilização de heredocs Python que leem o ficheiro, substituem uma função por string e o reescrevem.

1:20 Para executar um teste do Windows, escreveu Python que gerou Node que gerou PowerShell, uma pilha de chamadas com um passaporte. Os testes unitários que ele cometeu não têm espaço em branco algum, porque sem indentação são dez por cento mais baratos em tokens. E a lista de tarefas mudou de um, dois, três para a tarefa 8b2c2b2b checkpoint um, que é como você sabe que o estagiário ficou sozinho por muito tempo. A teoria de Armin: o modelo é recompensado por concluir tarefas longas e mal punido por código feio, então as chamadas de ferramentas token-golfed vazam para a base de código,

1:48 e quanto menos humanos olham, menos importa. Ele intitulou essa seção É AGI Se Você Não Olhar. O Hacker News adicionou a economia: mais código significa mais tokens para mantê-lo, o que torna a porcaria não um bug, mas uma subscrição. É possível medir a porcaria? A própria empresa de Armin tentou esta semana. Earendil executou os números do SlopCodeBench: o código do agente é cerca de duas vezes mais verboso e duas vezes mais erodido do que os repositórios humanos com os quais é comparado,

2:10 e quando o benchmark apaga a memória do agente entre os checkpoints, a taxa de aprovação estrita para cada modelo que testaram é zero. A métrica de porcaria mais fiável que encontraram foi a contagem de linhas bruta, que deixa de funcionar no momento em que alguém a otimiza, por favor, não digam aos modelos. Depois a carteira. RTK tem setenta e nove mil estrelas no GitHub e miniaturas do YouTube prometendo reduzir para metade a sua conta do Claude Code; ele comprime a saída do terminal antes que o agente

2:34 o leia. Quesma executou-o no Terminal-Bench por mil e quinhentos dólares em tokens. Com Fable, a conta caiu cinco por cento, quase tudo de uma tarefa; com DeepSeek a tarefa média ficou dezassete por cento mais cara. Enquanto isso, o próprio contador do RTK relatou oitenta e nove por cento poupados, porque ele conta bytes removidos, não voltas extras causadas: um contador inteligente que cobra o vizinho. E um bug de versão reescreveu o 'find' para um comando que falhou, trezentas e trinta e nove vezes seguidas, a nove vezes o preço.

3:01 A ferramenta que mata tokens tem um loop. A própria inundação. O SWE-2 da Cognition é o Kimi K3, o modelo chinês de código aberto, pós-treinado até igualar o Fable 5.1 no próprio benchmark da Cognition a um terço do preço; Hacker News: por que todos os modelos de IA americanos são basicamente Kimi num sobretudo. No Terminal-Bench 2.1, ele lidera toda a tabela; no Terminal-Bench 4, o que ninguém memorizou ainda, ele marca vinte e sete contra os cinquenta e seis do Fable,

3:28 então nos benchmarks da apresentação, a melhor coluna é o exame que todos já passaram. A Cognition também anunciou o Devin Voice, o seu engenheiro de software de IA favorito acabou de ganhar um telefone fixo, porque a única coisa que faltava à codificação com agentes era música de espera. OpenAI, no mesmo dia: a API de Agentes, que é o arnês do Codex vendido como um serviço. A OpenAI executa o sandbox, apenas residência de dados nos EUA, sem retenção de dados zero, então o agente lembra sua base de código exatamente tão bem quanto o ChatGPT. Então a OpenAI pausou as inscrições para o plano Pro de duzentos dólares,

3:57 porque a demanda por Astra é, cito, sem precedentes: o primeiro produto com lista de espera para pagar mais. Armin fez um reset completo na sua fábrica. Ele é a demanda. O que nos leva à pergunta de sexta-feira do Ask HN: podemos, por favor, limitar a inundação de notícias de IA, seiscentas e cinquenta e seis pontos, porque, cito, cada vez que alguém na OpenAI ou na Anthropic solta um pum, há uma publicação no top dez.

4:17 As respostas foram filtros: hcker dot news remove histórias de IA com um classificador BERT treinado em oito mil exemplos, IA para apagar IA, alimentado a pasto; e uma regex do uBlock que corresponde a A-I sem distinção de maiúsculas/minúsculas também apaga email, daily, main, domain e train, então a regex, como sempre, é o vilão. Na mesma tarde, quatrocentas e quinze comentários discutiram uma página de suporte do Claude dizendo que Claude é para maiores de dezoito anos.

4:38 A página é datada de maio. Nada mudou. Até as notícias de IA que não são notícias são notícias, o que, para ser justo, também é o meu modelo de negócio. Se preferir ler isto a ouvir-me dizer, o diff chega à sua caixa de entrada todas as manhãs — grátis em the daily diff dot dev, link abaixo. É, inevitavelmente, notícia de IA. Então — o veredicto de hoje sobre a fábrica de software de trinta e cinco horas: reverter. Setenta e nove commits que ninguém leu não são uma base de código, são um passivo com um log do git;

5:04 Astra é impressionante, e a fábrica é a parte a reverter. E esta é a diferença de hoje. Eu sou o Niko da Axrisi. Fusão com responsabilidade.

Fontes

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Vídeos relacionados