+− THE DAILY DIFFdev & AI news
REVERT

Armin Ronacher membiarkan GPT-6 Astra sendirian selama 35 jam.

Armin Ronacher (Flask, Jinja) memberi GPT-6 Astra satu prompt dan membiarkannya sendiri selama 35 jam: sekitar satu miliar token, sekitar $1,200, 79 commit, 75.000 baris — dan "sama sekali tidak ada nilai".

Armin Ronacher (Flask, Jinja) memberi GPT-6 Astra satu prompt dan membiarkannya sendiri selama 35 jam: sekitar satu miliar token, sekitar $1,200, 79 commit, 75.000 baris — dan "sama sekali tidak ada nilai". Kode yang berhasil dipulihkan adalah ceritanya: file C yang ditambal oleh heredocs penyambung string Python, Python melahirkan Node melahirkan PowerShell, pengujian unit dengan spasi kosong dihapus karena 10% lebih murah dalam token. Dua pengukuran mendukungnya: angka SlopCodeBench Earendil (kode agen sekitar dua kali lebih bertele-tele dan terkikis daripada repo manusia, tingkat kelulusan ketat 0%) dan benchmark $1,500 Quesma dari RTK (79 ribu bintang, "89% token disimpan" pada penghitungnya sendiri, +17% per tugas dengan DeepSeek). Juga: SWE-2 Cognition (Kimi K3 dalam jas hujan, 92.8 pada Terminal-Bench 2.1 vs 27.3 pada Terminal-Bench 4), OpenAI's Agents API dan pendaftaran Pro $200 yang dijeda, dan Hacker News hari Jumat meminta lebih sedikit berita AI. Putusan: REVERT.

Baca edisi tertulis (Inggris) ↗

Isi video ini

  • Armin Ronacher: 35 jam GPT-6 Astra tanpa pengawasan, ~ $1.200, 79 commit, +75rb baris, tidak ada yang dikirim
  • Earendil / SlopCodeBench: kode agen ~2× lebih bertele-tele dan terkikis daripada repo manusia; tingkat kelulusan ketat 0%
  • Quesma: RTK melaporkan 89% token disimpan, tetapi biaya Terminal-Bench naik 17% dengan DeepSeek; loop penulisan ulang gagal 339 kali berturut-turut
  • Cognition SWE-2: pasca-dilatih dari Kimi K3, cocok dengan Fable 5.1 di FrontierCode dengan harga sepertiga; TB 2.1 92.8 vs TB 4 27.3; Devin Voice
  • OpenAI Agents API (harness Codex sebagai layanan, hanya AS, tanpa ZDR); pendaftaran Pro $200 dijeda karena permintaan Astra

Transkrip terjemahan

Diterjemahkan dari narasi asli bahasa Inggris. Audio dan teks tersedia yang dikontrol oleh YouTube.

0:00 Armin Ronacher, orang yang menulis Flask, memberi GPT-6 Astra satu perintah dan membiarkannya sendiri selama tiga puluh lima jam. Itu kembali dengan tujuh puluh lima ribu baris kode dan, menurut kata-katanya, sama sekali tidak ada nilai, yang membuatnya menjadi yang paling realistis pabrik perangkat lunak yang pernah dibangun. Dia memposting tulisannya pada hari Rabu. Pada hari Kamis, Cognition mengirimkan SWE-2, dan OpenAI mengirimkan API Agen dan menjeda pendaftaran untuk paket dua ratus dolarnya,

0:24 karena Astra memakan server. Dan pada hari Jumat tulisan itu mencapai halaman depan Hacker News, beberapa baris di bawah postingan yang meminta Hacker News untuk berhenti memposting tentang AI. Dalam video ini: apa yang dihasilkan satu setengah hari Astra tanpa pengawasan, dua pengukuran yang mengubah kekacauan menjadi angka, mengapa alat dengan tujuh puluh sembilan ribu bintang membuat tagihan Anda lebih besar, dan bagaimana Hacker News mencoba menyaring AI, menggunakan AI. Ini hari Jumat, 11 September, dan ini The Daily Diff.

0:53 Pabrik. Satu perintah: buat Python dengan thread virtual dan leksikal pembuatan cakupan. Astra menyimpan catatannya sendiri, memunculkan subagennya sendiri, dan berjalan sampai Armin mencabutnya, satu setengah hari dan sekitar dua belas ratus dolar kemudian. Tujuh puluh sembilan commit, jadi lima belas setengah dolar per commit, yang kira-kira sama dengan yang dikenakan manusia, kecuali manusia akhirnya berhenti. Kodenya adalah ceritanya. Alih-alih alat edit, Astra menambal file C dengan memipa heredocs Python yang membaca file, mengganti string fungsi, dan menulisnya kembali.

1:20 Untuk menjalankan satu pengujian Windows, ia menulis Python yang memunculkan Node yang memunculkan PowerShell, tumpukan panggilan dengan paspor. Pengujian unit yang dikomitnya tidak memiliki spasi kosong sama sekali, karena tanpa indentasi harganya sepuluh persen lebih murah dalam token. Dan daftar tugas bergeser dari satu, dua, tiga ke tugas 8b2c2b2b checkpoint satu, begitulah Anda tahu magang sudah terlalu lama sendirian. Teori Armin: model dihargai untuk menyelesaikan tugas-tugas panjang dan nyaris tidak dihukum karena kode yang jelek, sehingga panggilan alat yang di-token-golfkan bocor ke basis kode,

1:48 dan semakin sedikit manusia yang melihat, semakin sedikit masalahnya. Dia memberi judul bagian itu "It's AGI If You Don't Look." Hacker News menambahkan ekonomi: lebih banyak kode berarti lebih banyak token untuk memeliharanya, yang membuat kekacauan bukan bug tetapi langganan. Bisakah Anda mengukur kekacauan? Perusahaan Armin sendiri mencoba minggu ini. Earendil menjalankan angka SlopCodeBench: kode agen sekitar dua kali lebih bertele-tele dan dua kali lebih terkikis daripada repo manusia yang dibandingkan dengannya,

2:10 dan ketika benchmark menghapus memori agen di antara checkpoint, tingkat kelulusan ketat untuk setiap model yang mereka uji adalah nol. Metrik kekacauan paling andal yang mereka temukan adalah jumlah baris mentah, yang berhenti bekerja saat seseorang mengoptimalkannya, jadi tolong jangan beri tahu modelnya. Lalu dompetnya. RTK memiliki tujuh puluh sembilan ribu bintang GitHub dan thumbnail YouTube yang menjanjikan untuk memotong setengah tagihan Claude Code Anda; ia mengompres output terminal sebelum agen

2:34 membacanya. Quesma menjalankannya di Terminal-Bench seharga lima belas ratus dolar token. Dengan Fable tagihan turun lima persen, hampir seluruhnya dari satu tugas; dengan DeepSeek rata-rata tugas menjadi tujuh belas persen lebih mahal. Sementara itu, penghitung RTK sendiri melaporkan delapan puluh sembilan persen disimpan, karena ia menghitung byte yang dihapus, bukan giliran ekstra yang disebabkan: meteran pintar yang menagih tetangga. Dan satu bug versi menulis ulang find menjadi perintah yang gagal, tiga ratus tiga puluh sembilan kali berturut-turut, dengan harga sembilan kali lipat.

3:01 Alat yang membunuh token memiliki loop. Banjir itu sendiri. SWE-2 Cognition adalah Kimi K3, model terbuka Tiongkok, pasca-dilatih hingga cocok dengan Fable 5.1 pada benchmark Cognition sendiri dengan sepertiga harga; Hacker News: mengapa semua model AI Amerika pada dasarnya adalah Kimi dalam jas hujan. Pada Terminal-Bench 2.1 ia menduduki seluruh tabel; pada Terminal-Bench 4, yang belum dihafal siapa pun, ia mencetak dua puluh tujuh dibandingkan lima puluh enam milik Fable,

3:28 jadi pada benchmark slide-deck, kolom terbaik adalah ujian yang sudah semua orang lulus. Cognition juga mengumumkan Devin Voice, insinyur perangkat lunak AI favorit Anda baru saja mendapat telepon rumah, karena satu hal yang kurang dari pengkodean agen adalah musik tunggu. OpenAI, hari yang sama: Agents API, yang merupakan harness Codex yang dijual sebagai layanan. OpenAI menjalankan sandbox, hanya residensi data AS, tanpa retensi data nol, jadi agen mengingat codebase Anda sama persis seperti ChatGPT. Kemudian OpenAI menjeda pendaftaran untuk paket Pro dua ratus dolar,

3:57 karena permintaan Astra, kutipannya, belum pernah terjadi sebelumnya: produk pertama dengan daftar tunggu untuk membayar lebih. Armin melakukan reset penuh pada pabriknya. Dia adalah permintaannya. Yang membawa kita ke Ask HN hari Jumat: bisakah kita membatasi banjir berita AI, enam ratus lima puluh enam poin, karena, kutipannya, setiap kali seseorang di OpenAI atau Anthropic kentut, ada postingan sepuluh teratas.

4:17 Balasan adalah filter: hcker dot news menghapus cerita AI dengan BERT pengklasifikasi yang dilatih pada delapan ribu contoh, AI untuk menghapus AI, makan rumput; dan regex uBlock yang mencocokkan A-I tanpa memperhatikan huruf besar/kecil juga menghapus email, harian, utama, domain, dan latih, jadi regex, seperti biasa, adalah penjahatnya. Sore yang sama, empat ratus lima belas komentar berdebat tentang halaman dukungan Claude yang mengatakan Claude berusia delapan belas tahun ke atas.

4:38 Halaman itu bertanggal Mei. Tidak ada yang berubah. Bahkan berita AI yang bukan berita adalah berita, yang, jujur saja, juga model bisnis saya. Jika Anda lebih suka membaca ini daripada mendengar saya mengatakannya, perbedaan akan mendarat di kotak masuk Anda setiap pagi — gratis di the daily diff dot dev, tautan di bawah. Itu, mau tidak mau, berita AI. Jadi — putusan hari ini tentang pabrik perangkat lunak tiga puluh lima jam: REVERT. Tujuh puluh sembilan commit yang tidak dibaca siapa pun bukanlah basis kode, itu adalah kewajiban dengan log

5:04 git; Astra mengesankan, dan pabrik adalah bagian yang harus digulirkan kembali. Dan itulah perbedaannya untuk hari ini. Saya Niko dari Axrisi. Merge secara bertanggung jawab.

Sumber

  1. Armin Ronacher — Astra for Coding: Why Are We Doing This Again?lucumr.pocoo.org
  2. HN: Astra for Codingnews.ycombinator.com
  3. Earendil — Measuring the sloppiness of codeearendil.com
  4. HN: Measuring the sloppiness of codenews.ycombinator.com
  5. Quesma — RTK reports huge token savings, but our cost benchmarks disagreequesma.com
  6. HN: RTKnews.ycombinator.com
  7. RTK (Rust Token Killer)github.com
  8. Cognition — Introducing SWE-2cognition.com
  9. HN: Cognition SWE-2news.ycombinator.com
  10. OpenAI — Agents APIdevelopers.openai.com
  11. HN: OpenAI Agents APInews.ycombinator.com
  12. TechCrunch — OpenAI puts Pro subscriptions on hold due to Astra demandtechcrunch.com
  13. Ask HN: Can we please limit the AI news flood?news.ycombinator.com
  14. HN: Claude is only available to people over 18 yearsnews.ycombinator.com

Video terkait