+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher ha lasciato GPT-6 Astra da solo per 35 ore.

Armin Ronacher (Flask, Jinja) ha dato a GPT-6 Astra un solo prompt e l'ha lasciato solo per 35 ore: circa un miliardo di token, circa 1.200 dollari, 79 commit, 75.000 linee — e "assolutamente nulla di valore".

Armin Ronacher (Flask, Jinja) ha dato a GPT-6 Astra un solo prompt e l'ha lasciato solo per 35 ore: circa un miliardo di token, circa 1.200 dollari, 79 commit, 75.000 linee — e "assolutamente nulla di valore". Il codice che ha recuperato è la storia: file C patchati con heredoc Python che fanno string-splicing, Python che avvia Node che avvia PowerShell, unit test con gli spazi bianchi rimossi perché è il 10% più economico in termini di token. Due misurazioni lo supportano: i numeri di SlopCodeBench di Earendil (codice dell'agente circa il doppio più verboso ed eroso rispetto ai repository umani, tasso di successo rigoroso dello 0%) e il benchmark da 1.500 dollari di Quesma su RTK (79k stelle, "89% di token risparmiati" sul proprio contatore, +17% per compito con DeepSeek). Inoltre: SWE-2 di Cognition (Kimi K3 in un impermeabile, 92.8 su Terminal-Bench 2.1 vs 27.3 su Terminal-Bench 4), l'API Agents di OpenAI e le iscrizioni Pro da 200 dollari in pausa, e il venerdì Hacker News ha chiesto meno notizie sull'AI. Verdetto: REVERT.

Leggi l'edizione scritta (inglese) ↗

Contenuto di questo video

  • Armin Ronacher: 35 ore di GPT-6 Astra senza supervisione, circa 1.200 dollari, 79 commit, +75k linee, nulla SHIP IT
  • Earendil / SlopCodeBench: codice agente circa 2 volte più verboso ed eroso rispetto ai repository umani; tasso di successo rigoroso 0%
  • Quesma: RTK riporta 89% di token risparmiati, ma i costi di Terminal-Bench aumentano del 17% con DeepSeek; un ciclo di riscrittura è fallito 339 volte di seguito
  • Cognition SWE-2: post-addestrato da Kimi K3, eguaglia Fable 5.1 su FrontierCode a un terzo del prezzo; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
  • API Agenti di OpenAI (il harness di Codex come servizio, solo negli USA, senza ZDR); iscrizioni Pro da 200 dollari in pausa per la domanda di Astra

Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

0:00 Armin Ronacher, l'uomo che ha scritto Flask, ha dato a GPT-6 Astra un singolo prompt e l'ha lasciato solo per trentacinque ore. È tornato con settantacinquemila linee di codice e, nelle sue parole, assolutamente nulla di valore, il che la rende la più realistica fabbrica di software mai costruita. Ha pubblicato la relazione mercoledì. Giovedì, Cognition ha rilasciato SWE-2, e OpenAI ha rilasciato un'API Agents e ha sospeso le iscrizioni per il suo piano da duecento dollari,

0:24 perché Astra ha consumato i server. E venerdì la relazione ha raggiunto la prima pagina di Hacker News, poche righe sotto un post che chiedeva a Hacker News di smettere di pubblicare notizie sull'AI. In questo video: cosa produce un giorno e mezzo di Astra non supervisionato, due misurazioni che trasformano lo scarto in un numero, perché uno strumento con settantanovemila stelle aumenta il tuo conto, e come Hacker News ha cercato di filtrare l'AI, usando l'AI. È venerdì 11 settembre, e questo è The Daily Diff.

0:53 La fabbrica. Un prompt: costruire un Python con thread virtuali e scope lessicale. Astra ha tenuto le proprie note, ha avviato i propri sub-agenti, e ha continuato a funzionare finché Armin non ha staccato la spina, un giorno e mezzo e circa milleduecento dollari dopo. Settantanove commit, quindi quindici dollari e mezzo per commit, che è circa quanto chiede un essere umano, tranne che l'essere umano alla fine si ferma. Il codice è la storia. Invece dello strumento di modifica, Astra patcha i file C convogliando heredoc Python che leggono il file, sostituiscono una funzione e lo riscrivono.

1:20 Per eseguire un test di Windows ha scritto Python che ha avviato Node che ha avviato PowerShell, una pila di chiamate con un passaporto. Gli unit test che ha committato non hanno affatto spazi bianchi, perché senza indentazione sono il dieci percento più economici in termini di token. E l'elenco dei compiti è passato da uno, due, tre a compito 8b2c2b2b checkpoint uno, che è come si capisce che lo stagista è stato troppo a lungo da solo. La teoria di Armin: il modello viene premiato per aver completato compiti lunghi e a malapena punito per il codice brutto, quindi le chiamate agli strumenti con token ottimizzati si riversano nella codebase,

1:48 e meno umani guardano, meno importa. Ha intitolato quella sezione "È AGI se non guardi". Hacker News ha aggiunto l'economia: più codice significa più token per mantenerlo, il che rende lo scarto non un bug ma un abbonamento. Si può misurare lo scarto? La stessa azienda di Armin ha provato questa settimana. Earendil ha eseguito i numeri di SlopCodeBench: il codice dell'agente è circa il doppio più verboso e il doppio più eroso rispetto ai repository umani con cui viene confrontato,

2:10 e quando il benchmark cancella la memoria dell'agente tra i checkpoint, il tasso di successo rigoroso per ogni modello che hanno testato è zero. La metrica di scarto più affidabile che hanno trovato è stato il conteggio delle linee grezze, che smette di funzionare nel momento in cui qualcuno la ottimizza, quindi per favore non ditelo ai modelli. Poi il portafoglio. RTK ha settantanovemila stelle su GitHub e miniature di YouTube che promettono di dimezzare il conto di Claude Code; comprime l'output del terminale prima che l'agente

2:34 lo legga. Quesma l'ha eseguito su Terminal-Bench per milleduecento dollari di token. Con Fable il conto è diminuito del cinque percento, quasi tutto da un solo compito; con DeepSeek il compito medio è diventato il diciassette percento più costoso. Nel frattempo il contatore di RTK riportava l'ottantanove percento risparmiato, perché conta i byte rimossi, non i turni extra causati: un contatore intelligente che fa pagare il vicino. E un bug di versione ha riscritto "find" in un comando che è fallito, trecentotrentanove volte di seguito, a nove volte il prezzo.

3:01 Lo strumento che uccide i token ha un ciclo. Il diluvio stesso. SWE-2 di Cognition è Kimi K3, il modello cinese open, post-addestrato finché non eguaglia Fable 5.1 sul benchmark di Cognition a un terzo del prezzo; Hacker News: perché tutti i modelli di AI americani sono fondamentalmente Kimi in un impermeabile. Su Terminal-Bench 2.1 è in cima all'intera classifica; su Terminal-Bench 4, quello che nessuno ha ancora memorizzato, segna ventisette contro i cinquantasei di Fable,

3:28 quindi sui benchmark delle slide la colonna migliore è l'esame che tutti hanno già superato. Cognition ha anche annunciato Devin Voice, il tuo ingegnere software AI preferito ha appena ottenuto un telefono fisso, perché l'unica cosa che mancava alla codifica agentiva era la musica d'attesa. OpenAI, lo stesso giorno: l'API Agents, che è l'harness di Codex venduto come servizio. OpenAI gestisce la sandbox, solo residenza dati USA, nessuna conservazione zero-data, quindi l'agente ricorda la tua codebase esattamente come ChatGPT. Poi OpenAI ha sospeso le iscrizioni per il piano Pro da duecento dollari,

3:57 perché la domanda di Astra è, cito, senza precedenti: il primo prodotto con una lista d'attesa per pagare di più. Armin ha bruciato un reset completo sulla sua fabbrica. È lui la domanda. Il che ci porta all'Ask HN di venerdì: possiamo per favore limitare il diluvio di notizie sull'AI, seicentocinquantasei punti, perché, cito, ogni volta che qualcuno di OpenAI o Anthropic fa una scoreggia, c'è un post tra i primi dieci.

4:17 Le risposte erano filtri: hcker.news rimuove le storie di AI con un classificatore BERT addestrato su ottomila esempi, AI per eliminare AI, grass-fed; e una regex uBlock che corrisponde a A-I in modo case-insensitive elimina anche email, daily, main, domain e train, quindi la regex, come sempre, è il cattivo. Lo stesso pomeriggio, quattrocentoquindici commenti hanno discusso su una pagina di supporto di Claude che diceva che Claude è per maggiori di diciotto anni.

4:38 La pagina è datata maggio. Nulla è cambiato. Anche le notizie sull'AI che non sono notizie sono notizie, il che, a dire il vero, è anche il mio modello di business. Se preferisci leggere questo piuttosto che sentirlo da me, il "diff" arriva nella tua casella di posta ogni mattina — gratis su the daily diff dot dev, link qui sotto. È, inevitabilmente, una notizia sull'AI. Quindi — il verdetto di oggi sulla fabbrica di software da trentacinque ore: REVERT. Settantanove commit che nessuno ha letto non sono una codebase, sono una passività con un log git;

5:04 Astra è impressionante, e la fabbrica è la parte da ROLL BACK. E questo è il "diff" di oggi. Sono Niko di Axrisi. SHIP IT responsabilmente.

Fonti

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Video correlati