Armin Ronacher jättis GPT-6 Astra 35 tunniks üksi.
Armin Ronacher (Flask, Jinja) andis GPT-6 Astrale ühe viiba ja jättis selle 35 tunniks üksi: umbes miljard tokenit, umbes $1,200, 79 commit’i, 75 000 rida — ja "absoluutselt mitte midagi väärtuslikku".
Armin Ronacher (Flask, Jinja) andis GPT-6 Astrale ühe viiba ja jättis selle 35 tunniks üksi: umbes miljard tokenit, umbes $1,200, 79 commit’i, 75 000 rida — ja "absoluutselt mitte midagi väärtuslikku". Taastatud kood on omaette lugu: C-failid, mida parandati Pythoni stringide heredoc-idega, Python käivitas Node'i, mis käivitas PowerShelli, ühikutestid ilma tühikuteta, sest see on 10% odavam tokenites. Kaks mõõtmist toetavad teda: Earendili SlopCodeBenchi numbrid (agendi kood umbes kaks korda sisutihedam ja kulunud kui inimeste repod, 0% range läbimisprotsent) ja Quesma $1,500 RTK benchmark (79k tähte, "89% tokeneid säästetud" oma loenduri järgi, +17% ülesande kohta DeepSeekiga). Samuti: Cognitioni SWE-2 (Kimi K3 trentšmantlis, 92.8 Terminal-Bench 2.1-l vs 27.3 Terminal-Bench 4-l), OpenAI Agents API ja peatatud $200 Pro registreerumised ning reede Hacker News küsis vähem AI-uudiseid. Otsus: REVERT.
Loe kirjalikku väljaannet (inglise keeles) ↗
Mida see video hõlmab
- Armin Ronacher: 35 tundi järelevalveta GPT-6 Astrat, ~$1,200, 79 commit’i, +75k rida, midagi ei tarnitud
- Earendil / SlopCodeBench: agendi kood ~2× nii mahukas ja kulunud kui inimeste repod; range läbimisprotsent 0%
- Quesma: RTK teatab 89% tokenite kokkuhoiust, kuid Terminal-Benchi kulud tõusevad DeepSeekiga 17%; ümberkirjutamise tsükkel ebaõnnestus 339 korda järjest
- Cognition SWE-2: post-treening Kimi K3-st, sobib Fable 5.1-ga Cognitioni enda benchmarkil kolmandiku hinnaga; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
- OpenAI Agents API (Codexi rakendus teenusena, ainult USA, puudub ZDR); $200 Pro registreerumised peatatud Astra nõudluse tõttu
Tõlgitud transkriptsioon
Tõlgitud ingliskeelsest originaaljutustusest. Saadaolevat heli ja subtiitreid kontrollib YouTube.
0:00 Armin Ronacher, mees, kes kirjutas Flaski, andis GPT-6 Astrale ühe viiba ja jättis selle kolmekümne viieks tunniks üksi. See tagastas seitsekümmend viis tuhat rida koodi ja, tema sõnul, absoluutselt mitte midagi väärtuslikku, mis teeb sellest kõige realistlikuma tarkvaravabriku, mis eales ehitatud. Ta postitas ülevaate kolmapäeval. Neljapäeval tarnis Cognition SWE-2 ja OpenAI tarnis Agents API ning peatas registreerumised oma kahesaja dollarise plaani jaoks,
0:24 sest Astra sõi serverid ära. Ja reedel jõudis ülevaade Hacker Newsi esilehele, mõni rida allpool postitust, milles paluti Hacker Newsil palun lõpetada tehisintellekti kohta postitamine. Selles videos: mida päev ja pool järelevalveta Astra toodab, kaks mõõtmist, mis muudavad "slopi" numbriks, miks tööriist seitsmekümne üheksa tuhande tärniga teeb teie arve suuremaks ja kuidas Hacker News püüdis välja filtreerida AI-d, kasutades AI-d. On reede, 11. september, ja see on The Daily Diff.
0:53 Tehas. Üks viip: ehita Python virtuaalsete lõimede ja leksikaalse skoopimisega. Astra hoidis oma märkmeid, käivitas oma alamagendid, ja jooksis, kuni Armin pistiku välja tõmbas, poolteist päeva ja umbes kaksteist sada dollarit hiljem. Seitsekümmend üheksa commit’i, seega viisteist ja pool dollarit commit’i kohta, mis on umbes see, mida inimene küsib, välja arvatud see, et inimene lõpuks lõpetab. Kood on lugu. Muutmise tööriista asemel paigutab Astra C-faile, suunates Pythoni heredoc'e, mis loevad faili, asendavad funktsiooni stringidega ja kirjutavad selle tagasi.
1:20 Ühe Windowsi testi käivitamiseks kirjutas see Pythoni, mis käivitas Node'i, mis käivitas PowerShelli, kõnepinu passiga. Ühikutestides, mille see commit’is, puuduvad tühikud üldsegi, sest ilma taandeta on need tokenites kümme protsenti odavamad. Ja ülesannete loetelu triivis ühest, kahest, kolmest ülesande 8b2c2b2b kontrollpunktini üks, mis annab teada, et praktikant on liiga kaua üksi olnud. Armini teooria: mudelit premeeritakse pikkade ülesannete lõpetamise eest ja vaevu karistatakse inetu koodi eest, nii et tokenitega optimeeritud tööriistakutsed lekivad koodibaasi,
1:48 ja mida vähem inimesi vaatab, seda vähem see loeb. Ta pealkirjastas selle jaotise "See on AGI, kui sa ei vaata". Hacker News lisas majandusliku poole: rohkem koodi tähendab rohkem tokeneid selle hooldamiseks, mis teeb "slopist" mitte vea, vaid tellimuse. Kas "slopi" saab mõõta? Armini oma ettevõte proovis seda sel nädalal. Earendil käivitas SlopCodeBenchi numbrid: agendi kood on umbes kaks korda sisutihedam ja kaks korda kulunud kui inimeste repod, millega seda võrreldakse,
2:10 ja kui benchmark pühib agendi mälu kontrollpunktide vahel, on iga testitud mudeli range läbimisprotsent null. Kõige usaldusväärsem "slopi" mõõdik, mille nad leidsid, oli toorete ridade arv, mis lakkab töötamast kohe, kui keegi seda optimeerima hakkab, nii et palun ärge öelge mudelitele. Siis rahakott. RTK-l on seitsekümmend üheksa tuhat GitHubi tärni ja YouTube'i pisipildid, mis lubavad vähendada teie Claude Code arvet poole võrra; see tihendab terminali väljundit enne, kui agent
2:34 seda loeb. Quesma käivitas selle Terminal-Benchil viieteistkümne saja dollari tokenite eest. Fable'iga langes arve viis protsenti, peaaegu kõik ühe ülesande tõttu; DeepSeekiga muutus keskmine ülesanne seitseteist protsenti kallimaks. Vahepeal teatas RTK oma loenduris kaheksakümmend üheksa protsenti säästmisest, sest see loeb eemaldatud baite, mitte põhjustatud lisakäike: nutikas arvesti, mis esitab arve naabrile. Ja üks versiooniviga kirjutas find'i ümber käsu, mis ebaõnnestus, kolmsada kolmkümmend üheksa korda järjest, üheksa korda kallima hinnaga.
3:01 Tööriistal, mis tapab tokeneid, on tsükkel. Uputus ise. Cognitioni SWE-2 on Kimi K3, avatud Hiina mudel, post-treeninguga, kuni see sobib Fable 5.1-ga Cognitioni enda benchmarkil kolmandiku hinnaga; Hacker News: miks kõik Ameerika AI-mudelid on põhimõtteliselt Kimi trentšmantlis. Terminal-Bench 2.1-l on see kogu tabeli tipus; Terminal-Bench 4-l, mida keegi veel meelde jätnud pole, saab see kakskümmend seitse Fable'i viiekümne kuue vastu,
3:28 nii et slaidiesitluste benchmarkidel on parim veerg eksam, mille kõik juba läbisid. Cognition teatas ka Devin Voice'ist, teie lemmik AI tarkvarainsener sai just lauatelefoni, sest ainus asi, mis agendikoodimisest puudu oli, oli ootemuusika. OpenAI, samal päeval: Agents API, mis on Codexi rakendus teenusena müüdud. OpenAI haldab liivakasti, ainult USA andmete residentsus, puudub null-andmete-säilitamine, nii et agent mäletab teie koodibaasi täpselt sama hästi kui ChatGPT. Siis OpenAI peatas registreerumised kahesaja dollari Pro plaani jaoks,
3:57 sest Astra nõudlus on, tsitaat, enneolematu: esimene toode ootenimekirjaga rohkem maksma. Armin põletas oma tehases täieliku lähtestamise. Tema ongi nõudlus. Mis toob meid reede Ask HN-i juurde: kas me saaksime palun piirata AI-uudiste tulva, kuussada viiskümmend kuus punkti, sest, tsitaat, iga kord, kui keegi OpenAI-s või Anthropicus peeretab, on seal top-kümne postitus.
4:17 Vastused olid filtrid: hcker dot news eemaldab AI-lood BERT-klassifikaatoriga, mis on treenitud kaheksa tuhande näite põhjal, AI AI-d kustutama, rohusöödud; ja uBlocki regulaaravaldis, mis sobib A-I-ga tõstutundmatult, kustutab ka email, daily, main, domain ja train, nii et regulaaravaldis, nagu alati, on pahalane. Samal pärastlõunal, nelisada viisteist kommentaari vaidlesid Claude'i tugilehe üle, mis ütles, et Claude on kaheksateist pluss.
4:38 Leht on dateeritud maikuus. Midagi ei muutunud. Isegi AI-uudised, mis ei ole uudised, on uudised, mis, ausalt öeldes, on ka minu ärimudel. Kui eelistate seda lugeda, mitte kuulda mind seda ütlemas, siis diff jõuab teie postkasti igal hommikul – tasuta aadressil daily diff dot dev, link allpool. See on vältimatult AI-uudis. Nii et – tänane otsus kolmekümne viie tunni tarkvaravabriku kohta: revert. Seitsekümmend üheksa commit’i, mida keegi ei lugenud, ei ole koodibaas, see on kohustus git-i
5:04 logiga; Astra on muljetavaldav ja tehas on see osa, mis tuleb tagasi pöörata. Ja see on tänane diff. Mina olen Niko Axrisist. Ühenda vastutustundlikult.
Allikad
- Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
- HN: Astra for Codingnews.ycombinator.com
- Earendil — Measuring the sloppiness of codeearendil.com
- HN: Measuring the sloppiness of codenews.ycombinator.com
- Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
- HN: RTKnews.ycombinator.com
- RTK (Rust Token Killer)github.com
- Cognition — Introducing SWE-2cognition.com
- HN: Cognition SWE-2news.ycombinator.com
- OpenAI — Agents APIdevelopers.openai.com
- HN: OpenAI Agents APInews.ycombinator.com
- TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
- Ask HN: Can we please limit the AI news flood?news.ycombinator.com
- HN: Claude is only available to people over 18 yearsnews.ycombinator.com



