Cara mengesan nerf Claude (dengan data sebenar)
Orang ramai mengatakan Claude menjadi kurang cekap beberapa minggu selepas setiap pelancaran.
Orang ramai mengatakan Claude menjadi kurang cekap beberapa minggu selepas setiap pelancaran. Seorang pembangun meletakkan Claude Opus 5.5 dalam pemasa 30 hari dari minggu pelancaran, dengan soalan beku, Kod Claude yang disematkan dan peraturan awam, dan ia menunjukkan mengapa tiada siapa yang dapat mengetahui sebelum ini, dan mengapa jumlah token anda adalah perkara yang perlu diperhatikan. Keputusan: SHIP IT.
Baca edisi bertulis (Bahasa Inggeris) ↗
Apa yang diliputi video ini
- Claude menjadi kurang cekap selepas pelancaran: teori ini bertemu pemasa hari sifar
- livenerf: pemasa 30 hari pada Opus 5.5 dari minggu pelancaran
- Bagaimana untuk menangkap nerf: 78 soalan yang kadang-kadang betul
- Apa yang boleh dilihatnya: 7.5 mata, dan jumlah token bergerak dahulu
- Titik buta: pertukaran Opus 5 dan 8 kunci jawapan yang salah
Transkrip terjemahan
Diterjemahkan daripada penceritaan asal Bahasa Inggeris. Audio dan kapsyen yang tersedia dikawal oleh YouTube.
Claude menjadi kurang cekap selepas pelancaran: teori ini bertemu pemasa hari sifar
0:00 Semua orang tahu Claude menjadi kurang cekap beberapa minggu selepas pelancaran. Jadi seorang pembangun meletakkan Opus lima perpuluhan lima pada pemasa dari minggu pelancaran, dan pemasa itu mengatakan tiada siapa yang dapat mengetahui lagi. Dalam video ini, tiga soalan. Bagaimana anda menangkap nerf? Apa yang boleh dilihat oleh meter ini? Dan apa yang Anthropic katakan? Dan satu baris dalam kredit repo membuat saya ketawa terbahak-bahak.
0:20 Saya akan sampai kepadanya pada akhirnya. Ini hari Rabu, tiga puluh September, dan ini adalah The Daily Diff. Tiga cerita hari ini, dan yang besar adalah repo GitHub yang dipanggil live nerf.
livenerf: pemasa 30 hari pada Opus 5.5 dari minggu pelancaran
0:30 Selama berbulan-bulan, orang ramai mengatakan Anthropic secara senyap-senyap men-nerf modelnya selepas pelancaran. Teori biasa adalah model yang diperah, model yang lebih kecil dengan nama yang sama atau hanya kurang berfikir. Repo memanggil setiap hujah setakat ini ‘vibes versus vibes’. Opus lima perpuluhan lima dihantar pada dua puluh dua September, dan seminggu yang lalu saya memberitahu anda ia mendahului papan bebas sambil menulis tiga kali lebih banyak perkataan daripada model median. Dua setengah hari kemudian, seorang pembangun bernama ninja hawk memulakan pemasa,
0:59 sekali sehari selama tiga puluh hari, dengan log yang tiada siapa boleh edit. Benang Hacker News mencapai hampir lapan ratus mata dan berpecah seperti sembang pasukan . Seorang pengulas mengatakan model nerfing tidak nyata dalam sebahagian besar kes yang dilaporkan. Seorang lagi mengatakan orang ramai hanya membiasakan diri dengan tahap kecerdasan yang baru. Dan seorang pengguna kuasa Kod Claude kini menolak pop-up 'rate-this-session' setiap kali, kerana menilai Claude nampaknya menjadikannya lebih teruk. Semakan rakan sebaya. Jadi, soalan satu, bagaimana anda menangkap nerf?
Bagaimana untuk menangkap nerf: 78 soalan yang kadang-kadang betul
1:27 Anda bermula dengan kira-kira dua puluh tiga ratus soalan peperiksaan yang sukar, dan Opus mendapat sembilan puluh tiga peratus betul pada percubaan pertama, yang tidak berguna untuk pengesan, kerana soalan yang selalu betul tidak boleh jatuh. Sembilan puluh tujuh peratus sentiasa betul atau sentiasa salah, dan tujuh puluh lapan yang kadang-kadang sahaja betul menjadi panel. Prompt yang sama, tiada alat, dan penggredan padanan tepat tanpa hakim AI, kerana hakim juga akan hanyut. Ia berjalan pada langganan Max melalui Kod Claude tanpa kepala,
1:55 kerana versi API berharga kira-kira seribu enam ratus dolar sebulan. Dan versi Kod Claude disematkan, kerana, dalam kata-kata repo, harness yang diubah kelihatan sama seperti model yang diubah. Statistik datang daripada kertas kerja bertajuk 'Adding Error Bars to Evals', oleh Evan Miller di Anthropic. Jadi matematik Anthropic sendiri kini mengaudit Anthropic, yang merupakan versi akademik memetik terma perkhidmatan kembali kepada sokongan pelanggan.
Apa yang boleh dilihatnya: 7.5 mata, dan jumlah token bergerak dahulu
2:19 Soalan dua, apa yang boleh dilihatnya? Setiap tetingkap sepuluh hari, penurunan kira-kira tujuh setengah mata. Untuk membuktikan rig berfungsi, penulis sengaja mengurangkan usaha Claude. Usaha sederhana mengurangkan output kira-kira seperempat, dan skor hanya empat mata. Usaha rendah mengurangkan output hampir dua pertiga, untuk lapan mata. Itulah bahagian yang patut dicuri. Kurang berfikir muncul dalam kiraan token sebelum ia muncul dalam jawapan.
2:43 Jadi sematkan versi model anda, log token output setiap tugas, dan simpan beberapa soalan beku anda sendiri. Jika agen anda tiba-tiba menulis lebih pendek, semak log anda sebelum anda menyemak Reddit. Dan inilah bahagian yang jujur.
Titik buta: pertukaran Opus 5 dan 8 kunci jawapan yang salah
2:54 Secara senyap-senyap menukar Opus lima yang lebih lama adalah perubahan yang terlalu kecil untuk rig itu panggil, dan readme mengatakannya di hadapan. Audit itu juga menemui lapan kunci jawapan yang kelihatan salah, jadi pengesan nerf menemui pepijat dalam penanda aras sebelum ia menemui nerf.
Anthropic: kami tidak pernah mengurangkan kualiti model
3:08 Soalan tiga, apa yang dikatakan Anthropic? Tahun lalu, selepas gelombang aduan, Anthropic menerbitkan postmortem. Ia mengatakan, "kami tidak pernah mengurangkan kualiti model kerana permintaan, masa hari atau beban pelayan." Pos yang sama mengakui tiga pepijat telah merendahkan Claude, dan hampir sepertiga pengguna Kod Claude mengalami masalah dengan pelayan yang salah sekurang-kurangnya sekali. Jadi aduan itu nyata dan puncanya adalah pepijat, itulah sebabnya repo memberi amaran bahawa minggu pelancaran boleh menjadi minggu terburuk.
3:35 Enam daripada tiga puluh hari telah berlalu. Panggilan pertama yang mungkin berlaku sekitar dua puluh empat Oktober, jadi jawapan yang jujur ialah tiada siapa yang tahu, termasuk semua orang yang yakin. Bercakap tentang nombor yang tiada siapa menerbitkan.
Pusat data merahsiakan nombor mereka; Backblaze menerbitkan
3:46 Lighthouse Reports dan akhbar Belanda Trouw mendapati bahawa sebahagian besar pusat data Eropah merahsiakan penggunaan kuasa dan air mereka, walaupun peraturan EU telah memerlukan pelaporan selama tiga tahun. Di Belanda, kurang daripada seperempat yang menerbitkan. Satu pusat data Microsoft sahaja menggunakan kira-kira satu peratus elektrik Belanda. Sementara itu, Backblaze melakukan perkara yang membosankan itu lagi. Statistik pemacu suku tahunannya meliputi kira-kira tiga ratus lima puluh ribu pemacu keras, dan kadar kegagalan meningkat kepada satu perpuluhan tujuh tiga peratus,
4:16 yang tertinggi dalam beberapa ketika. Tiga model Seagate mempunyai sifar kegagalan. Itulah rupa garis dasar awam, suku demi suku, selama tiga belas tahun.
Baris kredit: Claude membantu membina meter
4:25 Sekarang, baris kredit itu. Readme mengakui banyak repo ditulis dengan bantuan Claude, yang merupakan model yang diukur. Jadi Claude membantu membina meter yang memeriksa sama ada Claude menjadi kurang cekap. Itulah sebabnya penggred adalah fungsi biasa. Dalam kata-kata penulis, anda tidak sepatutnya perlu mempercayai penulis, manusia atau sebaliknya. Jika anda lebih suka membaca ini daripada mendengar saya mengatakannya, 'the diff' tiba di peti masuk anda
4:46 setiap pagi, percuma di the daily diff dot dev, pautan di bawah. Jadi, keputusan hari ini mengenai live nerf.
Keputusan: SHIP IT, dan jangan petik sebelum 24 Okt
4:51 SHIP IT. Saya akan SHIP IT kerana ia adalah hujah nerf pertama yang saya lihat dengan cap masa, buku peraturan awam dan titik buta yang dinyatakan. Cuma jangan petik sebelum dua puluh empat Oktober. Dan itulah 'the diff' untuk hari ini. Saya Niko dari Axrisi. Gabungkan dengan bertanggungjawab.
Sumber
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



