Cara mendeteksi nerf Claude (dengan data nyata)
Orang-orang mengatakan Claude menjadi lebih bodoh beberapa minggu setelah setiap peluncuran.
Orang-orang mengatakan Claude menjadi lebih bodoh beberapa minggu setelah setiap peluncuran. Seorang pengembang menyetel Claude Opus 5.5 selama 30 hari sejak minggu peluncuran, dengan pertanyaan-pertanyaan yang dibekukan, Kode Claude yang disematkan, dan aturan-aturan publik, dan ini menunjukkan mengapa tidak ada yang bisa mengetahuinya sebelumnya, dan mengapa jumlah token Anda adalah hal yang perlu diperhatikan. Putusan: SHIP IT.
Baca edisi tertulis (Inggris) ↗
Isi video ini
- Claude menjadi lebih bodoh setelah peluncuran: teori bertemu dengan jam hari-nol
- livenerf: jam 30 hari pada Opus 5.5 dari minggu peluncuran
- Cara menangkap nerf: 78 pertanyaan yang kadang benar
- Apa yang bisa dilihatnya: 7,5 poin, dan jumlah token bergerak lebih dulu
- Titik buta: pertukaran Opus 5 dan 8 kunci jawaban yang salah
Transkrip terjemahan
Diterjemahkan dari narasi asli bahasa Inggris. Audio dan teks tersedia yang dikontrol oleh YouTube.
Claude menjadi lebih bodoh setelah peluncuran: teori bertemu dengan jam hari-nol
0:00 Semua orang tahu Claude menjadi lebih bodoh beberapa minggu setelah peluncuran. Jadi, seorang pengembang menyetel Opus lima koma lima pada jam dari minggu peluncuran, dan jam tersebut mengatakan tidak ada yang bisa mengetahuinya sejauh ini. Dalam video ini, tiga pertanyaan. Bagaimana Anda menangkap nerf? Apa yang bisa dilihat meteran ini? Dan apa yang dikatakan Anthropic? Dan satu baris di kredit repo membuat saya tertawa terbahak-bahak.
0:20 Saya akan membahasnya di akhir. Ini hari Rabu, tiga puluh September, dan ini The Daily Diff. Tiga cerita hari ini, dan yang besar adalah repo GitHub bernama live nerf.
livenerf: jam 30 hari pada Opus 5.5 dari minggu peluncuran
0:30 Selama berbulan-bulan, orang-orang mengatakan Anthropic diam-diam men-nerf modelnya setelah peluncuran. Teori-teori yang biasa adalah model yang diperas, model yang lebih kecil dengan nama yang sama atau hanya kurang berpikir. Repo menyebut setiap argumen sejauh ini vibes versus vibes. Opus lima koma lima dikirim pada dua puluh dua September, dan seminggu yang lalu saya mengatakan kepada Anda bahwa itu menduduki papan independen sambil menulis tiga kali lebih banyak kata daripada model median. Dua setengah hari kemudian, seorang pengembang bernama ninja hawk memulai jam,
0:59 sekali sehari selama tiga puluh hari, dengan log yang tidak dapat diedit siapa pun. Utas Hacker News mencapai hampir delapan ratus poin dan terpecah seperti obrolan tim. Seorang komentator mengatakan nerfing model tidak nyata dalam sebagian besar kasus yang dilaporkan. Yang lain mengatakan orang-orang hanya terbiasa dengan tingkat kecerdasan yang baru. Dan seorang pengguna kekuatan Kode Claude sekarang menolak pop-up nilai-sesi-ini setiap kali, karena menilai Claude tampaknya membuatnya lebih buruk. Tinjauan sejawat. Jadi, pertanyaan satu, bagaimana Anda menangkap nerf?
Cara menangkap nerf: 78 pertanyaan yang kadang benar
1:27 Anda mulai dengan sekitar dua puluh tiga ratus soal ujian sulit, dan Opus mendapatkan sembilan puluh tiga persen benar pada percobaan pertama, yang tidak berguna untuk detektor, karena pertanyaan yang selalu dijawab benar tidak bisa turun. Sembilan puluh tujuh persen selalu benar atau selalu salah, dan tujuh puluh delapan yang hanya kadang-kadang benar menjadi panel. Prompt yang sama, tanpa alat, dan penilaian pencocokan persis tanpa hakim AI, karena hakim juga akan melenceng. Ini berjalan pada langganan Max melalui Claude Code tanpa kepala,
1:55 karena versi API dihargai sekitar enam belas ratus dolar sebulan. Dan versi Claude Code disematkan, karena, dalam kata-kata repo, harness yang diubah terlihat persis seperti model yang diubah. Statistik berasal dari makalah berjudul Menambahkan Batas Kesalahan ke Evaluasi, oleh Evan Miller di Anthropic. Jadi, matematika Anthropic sendiri sekarang mengaudit Anthropic, yang merupakan versi akademis dari mengutip ketentuan layanan kembali ke dukungan pelanggan.
Apa yang bisa dilihatnya: 7,5 poin, dan jumlah token bergerak lebih dulu
2:19 Pertanyaan dua, apa yang bisa dilihatnya? Per jendela sepuluh hari, penurunan sekitar tujuh setengah poin. Untuk membuktikan rig berfungsi, penulis dengan sengaja menurunkan upaya Claude. Upaya sedang mengurangi output sekitar seperempat, dan skor hanya empat poin. Upaya rendah mengurangi output hampir dua pertiga, untuk delapan poin. Itu bagian yang harus dicuri. Kurang berpikir muncul dalam jumlah token sebelum muncul dalam jawaban.
2:43 Jadi sematkan versi model Anda, catat token output per tugas, dan simpan beberapa pertanyaan beku Anda sendiri. Jika agen Anda tiba-tiba menulis lebih pendek, periksa log Anda sebelum Anda memeriksa Reddit. Dan inilah bagian yang jujur.
Titik buta: pertukaran Opus 5 dan 8 kunci jawaban yang salah
2:54 Diam-diam menukar dengan Opus lima yang lebih tua adalah perubahan yang terlalu kecil untuk rig untuk disebut, dan readme mengatakannya di awal. Audit juga menemukan delapan kunci jawaban yang terlihat salah, jadi detektor nerf menemukan bug di benchmark sebelum menemukan nerf.
Anthropic: kami tidak pernah mengurangi kualitas model
3:08 Pertanyaan tiga, apa kata Anthropic? Tahun lalu, setelah gelombang keluhan, Anthropic menerbitkan postmortem. Dikatakan, kutipan, kami tidak pernah mengurangi kualitas model karena permintaan, waktu hari, atau beban server. Posting yang sama mengakui tiga bug telah menurunkan kualitas Claude, dan hampir sepertiga pengguna Claude Code mengenai server yang salah setidaknya sekali. Jadi keluhannya nyata dan penyebabnya adalah bug, itulah mengapa repo memperingatkan bahwa minggu peluncuran bisa menjadi minggu terburuk.
3:35 Enam dari tiga puluh hari sudah berlalu. Panggilan pertama yang mungkin mendarat sekitar dua puluh empat Oktober, jadi jawaban jujur adalah tidak ada yang tahu, termasuk semua orang yang yakin. Omong-omong tentang angka yang tidak dipublikasikan siapa pun.
Pusat data merahasiakan angka mereka; Backblaze menerbitkan
3:46 Lighthouse Reports dan surat kabar Belanda Trouw menemukan bahwa sebagian besar pusat data Eropa merahasiakan penggunaan listrik dan air mereka, meskipun aturan Uni Eropa telah mewajibkan pelaporan selama tiga tahun. Di Belanda, kurang dari seperempat yang menerbitkan. Satu pusat data Microsoft saja menggunakan sekitar satu persen listrik Belanda. Sementara itu, Backblaze melakukan hal yang membosankan lagi. Statistik drive kuartalannya mencakup sekitar tiga ratus lima puluh ribu hard drive, dan tingkat kegagalan naik menjadi satu koma tujuh tiga persen,
4:16 tertinggi dalam beberapa waktu. Tiga model Seagate tidak mengalami kegagalan. Begitulah tampilan baseline publik, kuartal demi kuartal, selama tiga belas tahun.
Baris kredit: Claude membantu membangun meteran
4:25 Sekarang, baris kredit itu. Readme mengakui banyak bagian repo ditulis dengan bantuan Claude, yaitu model yang sedang diukur. Jadi Claude membantu membangun meteran yang memeriksa apakah Claude menjadi lebih bodoh. Itulah mengapa penilai adalah fungsi-fungsi biasa. Dalam kata-kata penulis, Anda tidak seharusnya harus mempercayai penulis, manusia atau lainnya. Jika Anda lebih suka membaca ini daripada mendengarkan saya mengatakannya, diff mendarat di kotak masuk Anda
4:46 setiap pagi, gratis di the daily diff dot dev, tautan di bawah. Jadi, putusan hari ini tentang live nerf.
Putusan: SHIP IT, dan jangan mengutipnya sebelum 24 Oktober
4:51 SHIP IT. Saya akan SHIP IT karena ini adalah argumen nerf pertama yang saya lihat dengan stempel waktu, buku aturan publik, dan titik buta yang dinyatakan. Hanya saja jangan mengutipnya sebelum dua puluh empat Oktober. Dan itulah diff untuk hari ini. Saya Niko dari Axrisi. Gabungkan dengan bertanggung jawab.
Sumber
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



