# Come rilevare un nerf di Claude (con dati reali)

Published: 2026-09-30

La gente dice che Claude diventa meno intelligente poche settimane dopo ogni lancio. Uno sviluppatore ha messo Claude Opus 5.5 sotto osservazione per 30 giorni dalla settimana del lancio, con domande bloccate, un Claude Code "pinnato" e regole pubbliche, e questo dimostra perché nessuno avrebbe potuto saperlo prima, e perché il conteggio dei token è la cosa da tenere d'occhio. Verdetto: SHIP IT.

Canonical: https://thedailydiff.dev/it/video/2026-09-30-opus-nerf-meter/

## Contenuto di questo video

- Claude diventa meno intelligente dopo il lancio: la teoria incontra un orologio "day-zero"
- livenerf: un orologio di 30 giorni su Opus 5.5 dalla settimana di lancio
- Come cogliere un nerf: 78 domande a volte giuste
- Cosa può vedere: 7,5 punti, e il conteggio dei token si muove per primo
- Il punto cieco: uno scambio di Opus 5 e 8 chiavi di risposta sbagliate

## Capitoli

- 0:00 Claude diventa meno intelligente dopo il lancio: la teoria incontra un orologio "day-zero"
- 0:26 livenerf: un orologio di 30 giorni su Opus 5.5 dalla settimana di lancio
- 1:24 Come cogliere un nerf: 78 domande a volte giuste
- 2:19 Cosa può vedere: 7,5 punti, e il conteggio dei token si muove per primo
- 2:53 Il punto cieco: uno scambio di Opus 5 e 8 chiavi di risposta sbagliate
- 3:08 Anthropic: non riduciamo mai la qualità del modello
- 3:45 I data center mantengono segreti i loro numeri; Backblaze pubblica
- 4:25 La riga dei crediti: Claude ha aiutato a costruire il misuratore
- 4:50 Verdetto: SHIP IT, e non citarlo prima del 24 ottobre

## Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

### Claude diventa meno intelligente dopo il lancio: la teoria incontra un orologio "day-zero"

0:00 Tutti sanno che Claude diventa meno intelligente poche settimane dopo il lancio. Quindi uno sviluppatore ha messo Opus cinque punto cinque sotto osservazione dalla settimana di lancio, e l'orologio dice che nessuno avrebbe potuto saperlo ancora. In questo video, tre domande. Come si coglie un nerf? Cosa può vedere questo misuratore? E cosa dice Anthropic? E una riga nei crediti del repository mi ha fatto ridere a crepapelle.

0:20 Ci arriverò alla fine. È mercoledì 30 settembre, e questo è The Daily Diff. Tre storie oggi, e quella importante è un repository GitHub chiamato live nerf.

### livenerf: un orologio di 30 giorni su Opus 5.5 dalla settimana di lancio

0:30 Per mesi, la gente ha detto che Anthropic silenziosamente "nerfa" i suoi modelli dopo il lancio. Le teorie usuali sono un modello "stretto", un modello più piccolo con lo stesso nome o semplicemente meno "pensiero". Il repository definisce ogni argomento finora "vibes versus vibes" (sensazioni contro sensazioni). Opus cinque punto cinque è stato rilasciato il 22 settembre, e una settimana fa vi ho detto che aveva superato la classifica indipendente scrivendo tre volte più parole del modello mediano. Dopo due giorni e mezzo, uno sviluppatore chiamato ninja hawk ha avviato l'orologio,

0:59 una volta al giorno per trenta giorni, con registri che nessuno può modificare. Il thread di Hacker News ha raggiunto quasi ottocento punti e si è diviso come una chat di squadra. Un commentatore dice che il "nerfing" dei modelli non è reale nella stragrande maggioranza dei casi riportati. Un altro dice che la gente si sta solo abituando al nuovo livello di intelligenza. E un utente avanzato di Claude Code ora ignora il pop-up "valuta questa sessione" ogni volta, perché valutare Claude sembrava peggiorarlo. Revisione paritaria. Quindi, domanda uno, come si coglie un nerf?

### Come cogliere un nerf: 78 domande a volte giuste

1:27 Si inizia con circa duemila trecento difficili domande d'esame, e Opus ne indovina il novantatré percento al primo tentativo, il che è inutile per un rilevatore, poiché una domanda che indovina sempre non può calare. Il novantasette percento era sempre giusto o sempre sbagliato, e le settantotto che indovina solo a volte sono diventate il pannello. Stesso prompt, nessun tool e valutazione con corrispondenza esatta senza giudice AI, perché anche il giudice sarebbe "driftato" (deteriorato). Funziona con un abbonamento Max tramite headless Claude Code,

1:55 dato che la versione API aveva un prezzo di circa milleseicento dollari al mese. E la versione di Claude Code è "pinnata", perché, nelle parole del repository, un harness modificato sembra esattamente un modello modificato. Le statistiche provengono da un articolo chiamato "Adding Error Bars to Evals", di Evan Miller di Anthropic. Quindi la matematica di Anthropic ora sta auditando Anthropic, che è la versione accademica di citare i termini di servizio al servizio clienti.

### Cosa può vedere: 7,5 punti, e il conteggio dei token si muove per primo

2:19 Domanda due, cosa può vedere? Per finestra di dieci giorni, un calo di circa sette punti e mezzo. Per dimostrare che il sistema funziona, l'autore ha volutamente ridotto lo "sforzo" di Claude. Lo "sforzo medio" ha ridotto l'output di circa un quarto, e il punteggio di soli quattro punti. Lo "sforzo basso" ha ridotto l'output di quasi due terzi, per otto punti. Questa è la parte da "rubare". Meno "pensiero" si manifesta nel conteggio dei token prima che si manifesti nelle risposte.

2:43 Quindi "pinna" la tua versione del modello, registra i token di output per attività, e tieni alcune tue domande "bloccate". Se il tuo agente scrive improvvisamente meno, controlla i tuoi registri prima di controllare Reddit. Ed ecco la parte onesta.

### Il punto cieco: uno scambio di Opus 5 e 8 chiavi di risposta sbagliate

2:54 Lo scambio silenzioso con il vecchio Opus cinque era un cambiamento troppo piccolo per essere rilevato dal sistema, e il readme lo dice subito. L'audit ha anche trovato otto chiavi di risposta che sembrano sbagliate, quindi il rilevatore di nerf ha trovato bug nel benchmark prima di trovare un nerf.

### Anthropic: non riduciamo mai la qualità del modello

3:08 Domanda tre, cosa dice Anthropic? L'anno scorso, dopo un'ondata di reclami, Anthropic ha pubblicato un postmortem. Dice, cito, "non riduciamo mai la qualità del modello a causa della domanda," "dell'ora del giorno o del carico del server." Lo stesso post ammette che tre bug avevano degradato Claude, e quasi un terzo degli utenti di Claude Code ha colpito i server sbagliati almeno una volta. Quindi i reclami erano reali e la causa erano i bug, motivo per cui il repository avverte che la settimana di lancio potrebbe essere la peggiore settimana.

3:35 Sei giorni su trenta sono passati. La prima possibile chiamata arriva intorno al 24 ottobre, quindi la risposta onesta è che nessuno lo sa, inclusi tutti coloro che ne erano sicuri. Parlando di numeri che nessuno pubblica.

### I data center mantengono segreti i loro numeri; Backblaze pubblica

3:46 Lighthouse Reports e il giornale olandese Trouw hanno scoperto che la stragrande maggioranza dei data center europei mantengono segreti il loro consumo di energia e acqua, anche se una norma UE richiede la segnalazione da tre anni. Nei Paesi Bassi, meno di un quarto pubblica. Un solo data center Microsoft utilizza circa l'uno percento dell'elettricità olandese. Nel frattempo, Backblaze ha fatto di nuovo la cosa noiosa. Le sue statistiche trimestrali sui dischi coprono circa trecentocinquantamila hard disk, e il tasso di fallimento è salito all'uno virgola settantatré percento,

4:16 il più alto da un po'. Tre modelli Seagate hanno avuto zero guasti. Questo è l'aspetto di un baseline pubblico, trimestre dopo trimestre, per tredici anni.

### La riga dei crediti: Claude ha aiutato a costruire il misuratore

4:25 Ora, quella riga di crediti. Il readme ammette che gran parte del repository è stato scritto con l'aiuto di Claude, che è il modello misurato. Quindi Claude ha aiutato a costruire il misuratore che verifica se Claude è diventato meno intelligente. Ecco perché i "grader" sono funzioni semplici. Nelle parole dell'autore, "non dovresti doverti fidare dell'autore," "umano o altro." Se preferisci leggere questo piuttosto che sentirmi dirlo, il "diff" arriva nella tua casella di posta

4:46 ogni mattina, gratuitamente su the daily diff dot dev, link qui sotto. Quindi, il verdetto di oggi su live nerf.

### Verdetto: SHIP IT, e non citarlo prima del 24 ottobre

4:51 SHIP IT. Lo pubblicherei perché è il primo argomento di "nerf" che ho visto con una data, un regolamento pubblico e un punto cieco dichiarato. Basta non citarlo prima del 24 ottobre. E questo è il "diff" per oggi. Sono Niko di Axrisi. Fondi responsabilmente.

## Fonti

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
