Armin Ronacher jätti GPT-6 Astran yksin 35 tunniksi.
Armin Ronacher (Flask, Jinja) antoi GPT-6 Astralle yhden kehotteen ja jätti sen yksin 35 tunniksi: noin miljardi tokenia, noin 1 200 dollaria, 79 commitia, 75 000 riviä – ja "täysin arvotonta".
Armin Ronacher (Flask, Jinja) antoi GPT-6 Astralle yhden kehotteen ja jätti sen yksin 35 tunniksi: noin miljardi tokenia, noin 1 200 dollaria, 79 commitia, 75 000 riviä – ja "täysin arvotonta". Sen palauttama koodi on tarina sinänsä: C-tiedostoja, joihin on tehty korjauksia Pythonin string-splicing heredoc-tyylillä, Python synnyttämässä Nodea, joka synnytti PowerShellin, yksikkötestejä ilman välilyöntejä, koska se on 10 % edullisempaa tokeneissa. Kaksi mittausta tukee häntä: Earendilin SlopCodeBench-luvut (agenttikoodi noin kaksi kertaa yhtä laveaa ja heikompaa kuin ihmisten repositoriot, 0 % tiukka läpäisyprosentti) ja Quesman 1 500 dollarin vertailuarvo RTK:lle (79 tuhatta tähteä, "89 % tokeneista säästetty" sen oman laskurin mukaan, +17 % tehtävää kohti DeepSeekillä). Lisäksi: Cognitionin SWE-2 (Kimi K3 sadetakissa, 92.8 Terminal-Bench 2.1:ssä vs. 27.3 Terminal-Bench 4:ssä), OpenAI:n Agents API ja keskeytetyt 200 dollarin Pro-tilaukset, ja perjantaina Hacker News pyysi vähemmän tekoälyuutisia. Tuomio: REVERT.
Lue kirjoitettu versio (englanniksi) ↗
Mitä tämä video käsittelee
- Armin Ronacher: 35 tuntia valvomatta jätettyä GPT-6 Astraa, ~1 200 dollaria, 79 commitia, +75k riviä, mitään ei toimitettu
- Earendil / SlopCodeBench: agenttikoodi ~2× yhtä laveaa ja heikompaa kuin ihmisten repositoriot; tiukka läpäisyprosentti 0 %
- Quesma: RTK raportoi 89 % tokeneista säästetyn, mutta Terminal-Bench-kustannukset nousevat 17 % DeepSeekillä; uudelleenkirjoitussykli epäonnistui 339 kertaa peräkkäin
- Cognition SWE-2: jälkikoulutettu Kimi K3:sta, vastaa Fable 5.1:ä FrontierCodessa kolmanneksella hinnasta; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (Codex-valjaat palveluna, vain Yhdysvalloissa, ei ZDR); 200 dollarin Pro-tilaukset keskeytetty Astra-kysynnän vuoksi
Käännetty transkriptio
Käännetty alkuperäisestä englanninkielisestä selostuksesta. Käytettävissä olevan äänen ja tekstitysten hallinta tapahtuu YouTuben kautta.
0:00 Armin Ronacher, Flaskin kirjoittaja, antoi GPT-6 Astralle yhden kehotteen ja jätti sen yksin kolmeksikymmeneksi viideksi tunniksi. Se palasi seitsemänkymmentäviisi tuhatta riviä koodia ja, hänen sanoin, täysin arvotonta, mikä tekee siitä realistisimman ohjelmistotehtaan, joka on koskaan rakennettu. Hän julkaisi kirjoituksen keskiviikkona. Torstaina Cognition toimitti SWE-2:n, ja OpenAI toimitti Agents API:n ja keskeytti tilaukset kaksisataadollariseen suunnitelmaansa,
0:24 koska Astra söi palvelimet. Ja perjantaina kirjoitus pääsi Hacker Newsin etusivulle, muutaman rivin alapuolella viestistä, jossa pyydettiin Hacker Newsia lopettamaan tekoälystä postaaminen. Tässä videossa: mitä puolentoista päivän valvomaton Astra tuottaa, kaksi mittausta, jotka muuttavat "slopin" luvuksi, miksi työkalu, jossa on seitsemänkymmentäyhdeksän tuhatta tähteä, kasvattaa laskuasi, ja miten Hacker News yritti suodattaa tekoälyä pois tekoälyn avulla. On perjantai, syyskuun 11. päivä, ja tämä on The Daily Diff.
0:53 Tehdas. Yksi kehote: rakenna Python virtuaalisäikeillä ja leksikaalisella skooppauksella. Astra piti omat muistiinpanonsa, käynnisti omat ala-agenttinsa, ja toimi, kunnes Armin veti töpselin seinästä, puolitoista päivää ja noin kaksitoista sataa dollaria myöhemmin. Seitsemänkymmentäyhdeksän commitia, siis viisitoista ja puoli dollaria per commit, mikä on suunnilleen se, mitä ihminen veloittaa, paitsi että ihminen lopulta pysähtyy. Koodi on tarina. Muokkaustyökalun sijaan Astra korjaa C-tiedostoja syöttämällä Pythonin heredoceja, jotka lukevat tiedoston, korvaavat funktion merkkijonona ja kirjoittavat sen takaisin.
1:20 Suorittaakseen yhden Windows-testin se kirjoitti Pythonia, joka synnytti Noden, joka synnytti PowerShellin, kutsupinon passilla. Sen commitatuissa yksikkötesteissä ei ole ollenkaan välilyöntejä, koska ilman sisennystä ne ovat kymmenen prosenttia halvempia tokeneissa. Ja tehtävälista vaihteli yhdestä, kahdesta, kolmesta tehtävään 8b2c2b2b checkpoint yksi, mistä tiedät, että harjoittelija on ollut liian kauan yksin. Arminin teoria: mallia palkitaan pitkien tehtävien suorittamisesta ja tuskin rangaistaan rumasta koodista, joten "token-golfatut" työkalukutsut vuotavat koodikantaan,
1:48 ja mitä vähemmän ihmiset katsovat, sitä vähemmän sillä on merkitystä. Hän nimesi kyseisen osion "Se on AGI, jos et katso". Hacker News lisäsi taloudellisen näkökulman: enemmän koodia tarkoittaa enemmän tokeneita sen ylläpitämiseen, mikä tekee "slopista" ei virheen vaan tilauksen. Voiko "slopia" mitata? Arminin oma yritys yritti tällä viikolla. Earendil ajoi SlopCodeBench-luvut: agenttikoodi on noin kaksi kertaa yhtä laveaa ja kaksi kertaa yhtä heikosti ylläpidettyä kuin ihmisten repositoriot, joihin sitä verrataan,
2:10 ja kun vertailuarvo pyyhkii agentin muistin tarkistuspisteiden välillä, kaikkien testattujen mallien tiukka läpäisyprosentti on nolla. Luotettavin "slop"-mittari, jonka he löysivät, oli raaka rivimäärä, joka lakkaa toimimasta heti, kun joku optimoi sen mukaan, joten älkää kertoko malleille. Sitten lompakko. RTK:lla on seitsemänkymmentäyhdeksän tuhatta GitHub-tähteä ja YouTube-kuvakkeita, jotka lupaavat puolittaa Claude Code -laskusi; se pakkaa terminaalilähtöä ennen kuin agentti
2:34 lukee sen. Quesma ajoi sen Terminal-Benchissä viidentoista sadan dollarin edestä tokeneita. Fablella lasku laski viisi prosenttia, melkein kaikki yhdestä tehtävästä; DeepSeekillä keskimääräinen tehtävä kallistui seitsemäntoista prosenttia. Samaan aikaan RTK:n oma laskuri ilmoitti kahdeksankymmentäyhdeksän prosenttia säästetyn, koska se laskee poistettuja tavuja, ei aiheutuneita ylimääräisiä vuoroja: älymittari, joka laskuttaa naapuria. Ja yksi versiovirhe muutti find-komennon komennoksi, joka epäonnistui, kolmesataa kolmekymmentäyhdeksän kertaa peräkkäin, yhdeksänkertaisella hinnalla.
3:01 Tokeneja tappavalla työkalulla on silmukka. Tulva itsessään. Cognitionin SWE-2 on Kimi K3, avoin kiinalainen malli, jälkikoulutettu, kunnes se vastaa Fable 5.1:tä Cognitionin omalla vertailuarvolla kolmanneksella hinnasta; Hacker News: miksi kaikki amerikkalaiset tekoälymallit ovat pohjimmiltaan Kimi sadetakissa. Terminal-Bench 2.1:ssä se on koko listan kärjessä; Terminal-Bench 4:ssä, jota kukaan ei ole vielä opetellut ulkoa, se saa kaksikymmentäseitsemän Fablein viidenkymmenenkuuden sijaan,
3:28 joten esityskalvojen vertailuarvoissa paras sarake on tentti, jonka kaikki ovat jo läpäisseet. Cognition julkisti myös Devin Voicen, suosikki-AI-ohjelmistoinsinöörisi sai juuri lankapuhelimen, koska ainoa asia, mikä agenttisesta koodauksesta puuttui, oli jonotusmusiikki. OpenAI, samana päivänä: Agents API, joka on Codex-valjaat myytynä palveluna. OpenAI pyörittää hiekkalaatikkoa, vain Yhdysvaltojen dataresidenssi, ei nolladatansäilytystä, joten agentti muistaa koodikantasi täsmälleen yhtä hyvin kuin ChatGPT. Sitten OpenAI keskeytti 200 dollarin Pro-suunnitelman tilaukset,
3:57 koska Astra-kysyntä on, lainaus, ennennäkemätön: ensimmäinen tuote, jolla on odotuslista maksaa enemmän. Armin poltti täyden resetin tehtaallaan. Hän on se kysyntä. Mikä tuo meidät perjantain Ask HN:ään: voisimmeko rajoittaa tekoälyuutisten tulvaa, kuusisataaviisikymmentäkuusi pistettä, koska, lainaus, joka kerta kun joku OpenAI:ssa tai Anthropicissa pieraisee, siitä on kymmenen parhaan joukossa.
4:17 Vastaukset olivat suodattimia: hcker dot news poistaa AI-tarinoita BERT-luokittelijalla, joka on koulutettu kahdeksalla tuhannella esimerkillä, tekoäly poistaa tekoälyä, ruohonjuuritasolla; ja uBlock-regex, joka vastaa A-I:tä tapausherkkyydestä riippumatta, poistaa myös sähköpostin, päivittäin, pääasiallinen, verkkotunnus ja juna, joten regex, kuten aina, on roisto. Samana iltapäivänä neljäsataa viisitoista kommenttia väitteli Claude-tukisivusta jonka mukaan Claude on yli kahdeksantoista.
4:38 Sivu on päivätty toukokuulle. Mikään ei muuttunut. Jopa tekoälyuutiset, jotka eivät ole uutisia, ovat uutisia, mikä, reilusti sanottuna, on myös minun liiketoimintamallini. Jos haluat mieluummin lukea tämän kuin kuulla minun sanovan sen, "diff" saapuu sähköpostiisi joka aamu – ilmaiseksi osoitteesta the daily diff dot dev, linkki alla. Se on, väistämättä, tekoälyuutisia. Joten – tämän päivän tuomio kolmenkymmenenviiden tunnin ohjelmistotehtaalle: REVERT. Seitsemänkymmentäyhdeksän commitia, joita kukaan ei lukenut, ei ole koodikanta, se on vastuu git-
5:04 login kanssa; Astra on vaikuttava, ja tehdas on se osa, joka pitää palauttaa. Ja se on päivän "diff". Olen Niko Axrisista. Yhdistä vastuullisesti.
Lähteet
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



