# Hoe om 'n Claude-nerf op te spoor (met regte data)

Published: 2026-09-30

Mense sê Claude word 'n paar weke na elke bekendstelling dommer. Een ontwikkelaar het Claude Opus 5.5 op 'n 30-dae klok gesit vanaf bekendstellingsweek, met bevrore vrae, 'n vasgespelde Claude Code en publieke reëls, en dit wys waarom niemand voorheen kon geweet het nie, en waarom jou token-telling die ding is om dop te hou. Uitspraak: SHIP IT.

Canonical: https://thedailydiff.dev/af/video/2026-09-30-opus-nerf-meter/

## Wat hierdie video dek

- Claude word dommer na bekendstelling: die teorie ontmoet 'n dag-nul klok
- livenerf: 'n 30-dae klok op Opus 5.5 vanaf bekendstellingsweek
- Hoe om 'n nerf te vang: 78 soms-regte vrae
- Wat dit kan sien: 7.5 punte, en die token-telling beweeg eerste
- Die blinde kol: 'n Opus 5-ruil en 8 verkeerde antwoordsleutels

## Hoofstukke

- 0:00 Claude word dommer na bekendstelling: die teorie ontmoet 'n dag-nul klok
- 0:26 livenerf: 'n 30-dae klok op Opus 5.5 vanaf bekendstellingsweek
- 1:24 Hoe om 'n nerf te vang: 78 soms-regte vrae
- 2:19 Wat dit kan sien: 7.5 punte, en die token-telling beweeg eerste
- 2:53 Die blinde kol: 'n Opus 5-ruil en 8 verkeerde antwoordsleutels
- 3:08 Anthropic: ons verminder nooit modelkwaliteit nie
- 3:45 Datasentrums hou hul syfers geheim; Backblaze publiseer
- 4:25 Die kredietlyn: Claude het gehelp om die meter te bou
- 4:50 Uitspraak: SHIP IT, en moenie dit voor 24 Okt aanhaal nie

## Vertaalde transkripsie

Vertaal uit die oorspronklike Engelse vertelling. Beskikbare klank en onderskrifte word deur YouTube beheer.

### Claude word dommer na bekendstelling: die teorie ontmoet 'n dag-nul klok

0:00 Almal weet Claude word 'n paar weke na bekendstelling dommer. So een ontwikkelaar het Opus vyf punt vyf op 'n klok gesit vanaf bekendstellingsweek, en die klok sê niemand kon nog geweet het nie. In hierdie video, drie vrae. Hoe vang jy 'n nerf? Wat kan hierdie meter sien? En wat sê Anthropic? En een lyn in die repo se krediete het my hardop laat lag.

0:20 Ek sal aan die einde daarby uitkom. Dis Woensdag, dertigste September, en dit is The Daily Diff. Drie stories vandag, en die groot een is 'n GitHub-repo genaamd live nerf.

### livenerf: 'n 30-dae klok op Opus 5.5 vanaf bekendstellingsweek

0:30 Vir maande het mense gesê Anthropic nerf sy modelle stil-stil na bekendstelling. Die gewone teorieë is 'n saamgeperste model, 'n kleiner model onder dieselfde naam of bloot minder denke. Die repo noem elke argument tot dusver vibes teen vibes. Opus vyf punt vyf is op twee-en-twintigste September verskeep, en 'n week gelede het ek jou vertel dit was boaan die onafhanklike bord terwyl dit drie keer meer woorde as die gemiddelde model geskryf het. Twee en 'n half dae later het 'n ontwikkelaar genaamd ninja hawk die klok begin,

0:59 een keer per dag vir dertig dae, met logs wat niemand mag redigeer nie. Die Hacker News-draad het byna agthonderd punte behaal en soos 'n span chat verdeel. Een kommentator sê nerfing van modelle is nie werklik in die oorgrote meerderheid van gerapporteerde gevalle nie. 'n Ander sê mense raak net gewoond aan die nuwe vlak van intelligensie. En een Claude Code-kraggebruiker wys nou elke keer die beoordeel-hierdie-sessie opspringvenster af, want om Claude te beoordeel het gelyk of dit dit erger maak. Portuurbeoordeling. So, vraag een, hoe vang jy 'n nerf?

### Hoe om 'n nerf te vang: 78 soms-regte vrae

1:27 Jy begin met ongeveer drie-en-twintighonderd moeilike eksamenvrae, en Opus kry drie-en-negentig persent reg met die eerste probeerslag, wat nutteloos is vir 'n detektor, aangesien 'n vraag wat dit altyd reg kry, nie kan daal nie. Sewe-en-negentig persent was altyd reg of altyd verkeerd, en die agt-en-sewentig wat dit net soms reg kry, het die paneel geword. Dieselfde prompt, geen gereedskap, en presiese-passing gradering met geen KI-regter nie, want die regter sou ook dryf. Dit loop op 'n Max-intekening deur headless Claude Code,

1:55 aangesien die API-weergawe teen ongeveer sestienhonderd dollar per maand geprys is. En die Claude Code-weergawe is vasgespel, want, in die repo se woorde, 'n veranderde harnas lyk presies soos 'n veranderde model. Die statistieke kom van 'n artikel genaamd Adding Error Bars to Evals, deur Evan Miller by Anthropic. So Anthropic se eie wiskunde is nou besig om Anthropic te oudit, wat die akademiese weergawe is van die aanhaal van die diensbepalings terug aan kliëntediens.

### Wat dit kan sien: 7.5 punte, en die token-telling beweeg eerste

2:19 Vraag twee, wat kan dit sien? Per tien-dae venster, 'n daling van ongeveer sewe en 'n half punte. Om te bewys die tuig werk, het die outeur Claude se poging doelbewus verminder. Medium poging het die uitvoer met ongeveer 'n kwart verminder, en die telling met slegs vier punte. Lae poging het die uitvoer met byna twee derdes verminder, vir agt punte. Dis die deel om te steel. Minder denke verskyn in die token-telling voordat dit in die antwoorde verskyn.

2:43 Spel dus jou modelweergawe vas, log uitvoer-tokens per taak, en hou 'n paar bevrore vrae van jou eie. As jou agent skielik korter skryf, kyk na jou logs voordat jy Reddit nagaan. En hier is die eerlike deel.

### Die blinde kol: 'n Opus 5-ruil en 8 verkeerde antwoordsleutels

2:54 Om stilweg die ouer Opus vyf in te ruil was 'n te klein verandering vir die tuig om te noem, en die readme sê dit reg voor. Die oudit het ook agt antwoordsleutels gevind wat verkeerd lyk, so die nerf-detektor het foute in die maatstaf gevind voordat dit 'n nerf gevind het.

### Anthropic: ons verminder nooit modelkwaliteit nie

3:08 Vraag drie, wat sê Anthropic? Verlede jaar, na 'n golf van klagtes, het Anthropic 'n postmortem gepubliseer. Dit sê, aanhalend, ons verminder nooit modelkwaliteit as gevolg van aanvraag nie, tyd van die dag of bedienerlading nie. Dieselfde pos gee toe dat drie foute Claude verswak het, en byna 'n derde van Claude Code-gebruikers het ten minste een keer die verkeerde bedieners getref. So die klagtes was werklik en die oorsaak was foute, daarom waarsku die repo dat bekendstellingsweek die slegste week kan wees.

3:35 Ses van dertig dae is in. Die eerste moontlike oproep land rondom vier-en-twintigste Oktober, so die eerlike antwoord is dat niemand weet nie, insluitend almal wat seker was. Praat van syfers wat niemand publiseer nie.

### Datasentrums hou hul syfers geheim; Backblaze publiseer

3:46 Lighthouse Reports en die Nederlandse koerant Trouw het bevind dat die oorgrote meerderheid van Europese datasentrums hul krag- en waterverbruik geheim hou, alhoewel 'n EU-reël vir drie jaar verslagdoening vereis het. In Nederland publiseer minder as 'n kwart. Een Microsoft-datasentrum alleen gebruik ongeveer een persent van Nederlandse elektrisiteit. Intussen het Backblaze weer die vervelige ding gedoen. Sy kwartaallikse skyfstatistieke dek ongeveer driehonderd-en-vyftigduisend hardeskywe, en die mislukkingskoers het gestyg tot een punt sewe drie persent,

4:16 die hoogste in 'n rukkie. Drie Seagate-modelle het geen mislukkings gehad nie. Dit is hoe 'n publieke basislyn lyk, kwartaal na kwartaal, vir dertien jaar.

### Die kredietlyn: Claude het gehelp om die meter te bou

4:25 Nou, daardie kredietlyn. Die readme gee toe dat baie van die repo geskryf is met die hulp van Claude, wat die model is wat gemeet word. So Claude het gehelp om die meter te bou wat kontroleer of Claude dommer geword het. Dis hoekom die gradeerders gewone funksies is. In die outeur se woorde, jy behoort nie die outeur te hoef te vertrou nie, menslik of andersins. As jy dit eerder wil lees as om my dit te hoor sê, land die verskil in jou inkassie

4:46 elke oggend, gratis by the daily diff dot dev, skakel hieronder. So, vandag se uitspraak oor live nerf.

### Uitspraak: SHIP IT, en moenie dit voor 24 Okt aanhaal nie

4:51 SHIP IT. Ek sou dit verskeep omdat dit die eerste nerf-argument is wat ek gesien het met 'n tydstempel, 'n publieke reëlboek en 'n vermelde blinde kol. Moet dit net nie voor vier-en-twintigste Oktober aanhaal nie. En dis die verskil vir vandag. Ek is Niko van Axrisi. Samesmelting verantwoordelik.

## Bronne

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
