Como detectar unha "nerf" de Claude (con datos reais)
A xente di que Claude "se fai máis tonto" unhas semanas despois de cada lanzamento.
A xente di que Claude "se fai máis tonto" unhas semanas despois de cada lanzamento. Un desenvolvedor puxo Claude Opus 5.5 a un reloxo de 30 días dende a semana de lanzamento, con preguntas conxeladas, un código Claude fixado e regras públicas, e mostra por que ninguén o podería saber antes, e por que a túa conta de tokens é o que hai que observar. Veredicto: SHIP IT.
Ler a edición escrita (inglés) ↗
Que abrangue este vídeo
- Claude vólvese máis "tonto" despois do lanzamento: a teoría atópase cun reloxo de día cero
- livenerf: un reloxo de 30 días en Opus 5.5 dende a semana de lanzamento
- Como detectar unha "nerf": 78 preguntas ás veces correctas
- O que pode ver: 7,5 puntos, e a conta de tokens móvese primeiro
- O punto cego: un intercambio de Opus 5 e 8 claves de resposta incorrectas
Transcrición traducida
Traducido da narración orixinal en inglés. O audio e os subtítulos dispoñibles son controlados por YouTube.
Claude vólvese máis "tonto" despois do lanzamento: a teoría atópase cun reloxo de día cero
0:00 Todo o mundo sabe que Claude "se fai máis tonto" unhas semanas despois do lanzamento. Así que un desenvolvedor puxo Opus 5.5 a un reloxo dende a semana de lanzamento, e o reloxo di que ninguén o podería saber aínda. Neste vídeo, tres preguntas. Como se detecta unha "nerf"? Que pode ver este medidor? E que di Anthropic? E unha liña nos créditos do repositorio fíxome rir en voz alta.
0:20 Chegarei a iso ao final. É mércores, trinta de setembro, e este é The Daily Diff. Tres historias hoxe, e a grande é un repositorio de GitHub chamado live nerf.
livenerf: un reloxo de 30 días en Opus 5.5 dende a semana de lanzamento
0:30 Durante meses, a xente dixo que Anthropic "nerfea" silenciosamente os seus modelos despois do lanzamento. As teorías habituais son un modelo comprimido, un modelo máis pequeno co mesmo nome ou simplemente menos "pensamento". O repositorio chama a cada argumento ata agora ""vibes" contra "vibes"". Opus 5.5 lanzouse o vinte e dous de setembro, e hai unha semana díxenlle que encabezaba a táboa independente mentres escribía tres veces máis palabras que o modelo medio. Dous días e medio despois, un desenvolvedor chamado ninja hawk comezou o reloxo,
0:59 unha vez ao día durante trinta días, con rexistros que ninguén pode editar. O fío de Hacker News acadou case oitocentos puntos e dividiuse coma un chat de equipo. Un comentarista di que "nerfear" modelos non é real na gran maioría dos casos informados. Outro di que a xente simplemente se está acostumando ao novo nivel de intelixencia. E un "power user" de Claude Code agora ignora o "pop-up" de "valorar esta sesión" cada vez, porque valorar a Claude parecía empeoralo. Revisión por pares. Entón, pregunta un, como se detecta unha "nerf"?
Como detectar unha "nerf": 78 preguntas ás veces correctas
1:27 Comezas con aproximadamente dous mil trescentas preguntas de exame difíciles, e Opus acerta o noventa e tres por cento na primeira oportunidade, o que é inútil para un detector, xa que unha pregunta que sempre acerta non pode baixar. O noventa e sete por cento sempre estaba ben ou sempre mal, e as setenta e oito que só ás veces acerta convertéronse no panel. Mesmo "prompt", sen ferramentas, e cualificación de coincidencia exacta sen xuíz de IA, porque o xuíz tamén "derivería". Funciona cunha subscrición Max a través de Claude Code sen cabeza,
1:55 xa que a versión da API tiña un prezo de aproximadamente mil seiscentos dólares ao mes. E a versión de Claude Code está fixada, porque, en palabras do repositorio, un arnés cambiado parece exactamente un modelo cambiado. As estatísticas proveñen dun artigo chamado "Engadindo barras de erro ás avaliacións", de Evan Miller de Anthropic. Así que as propias matemáticas de Anthropic agora están a auditar a Anthropic, que é a versión académica de citar os termos de servizo ao servizo de atención ao cliente.
O que pode ver: 7,5 puntos, e a conta de tokens móvese primeiro
2:19 Pregunta dous, que pode ver? Por cada xanela de dez días, unha caída de aproximadamente sete puntos e medio. Para probar que o aparello funciona, o autor reduciu o esforzo de Claude a propósito. O esforzo medio reduciu a saída en aproximadamente un cuarto, e a puntuación en só catro puntos. O esforzo baixo reduciu a saída en case dous terzos, para oito puntos. Esa é a parte que hai que copiar. Menos "pensamento" aparece na conta de tokens antes de que apareza nas respostas.
2:43 Así que fixa a túa versión do modelo, rexistra os tokens de saída por tarefa, e garda algunhas das túas propias preguntas conxeladas. Se o teu axente de súpeto escribe máis curto, revisa os teus rexistros antes de revisar Reddit. E aquí está a parte honesta.
O punto cego: un intercambio de Opus 5 e 8 claves de resposta incorrectas
2:54 Cambiar silenciosamente polo Opus 5 máis antigo foi un cambio demasiado pequeno para que o aparello o detectase, e o "readme" o di de antemán. A auditoría tamén atopou oito claves de resposta que parecen incorrectas, así que o detector de "nerfs" atopou erros na referencia antes de atopar unha "nerf".
Anthropic: nunca reducimos a calidade do modelo
3:08 Pregunta tres, que di Anthropic? O ano pasado, despois dunha vaga de queixas, Anthropic publicou un "postmortem". Di, e cito, "nunca reducimos a calidade do modelo debido á demanda," "hora do día ou carga do servidor." A mesma publicación admite que tres erros degradaran a Claude, e case un terzo dos usuarios de Claude Code "chocaron" cos servidores incorrectos polo menos unha vez. Así que as queixas eran reais e a causa eran erros, razón pola que o repositorio advirte que a semana de lanzamento podería ser a peor semana.
3:35 Seis de trinta días están dentro. A primeira posible chamada aterrará arredor do vinte e catro de outubro, así que a resposta honesta é que ninguén o sabe, incluído todo o mundo que estaba seguro. Falando de números que ninguén publica.
Os centros de datos manteñen os seus números en segredo; Backblaze publica
3:46 Lighthouse Reports e o xornal holandés Trouw descubriron que a gran maioría dos centros de datos europeos manteñen en segredo o seu uso de enerxía e auga, aínda que unha norma da UE esixe informar dende hai tres anos. Nos Países Baixos, menos dun cuarto publica. Un só centro de datos de Microsoft usa aproximadamente o un por cento da electricidade holandesa. Mentres tanto, Backblaze fixo de novo o aburrido. As súas estatísticas trimestrais de unidades cobren uns trescentos cincuenta mil discos duros, e a taxa de fallos aumentou a un punto setenta e tres por cento,
4:16 a máis alta en moito tempo. Tres modelos de Seagate tiveron cero fallos. Así é como se ve unha liña base pública, trimestre tras trimestre, durante trece anos.
A liña de créditos: Claude axudou a construír o medidor
4:25 Agora, esa liña de créditos. O "readme" admite que gran parte do repositorio foi escrito coa axuda de Claude, que é o modelo que se está medindo. Así que Claude axudou a construír o medidor que verifica se Claude "se fixo máis tonto". Por iso os cualificadores son funcións simples. En palabras do autor, non deberías ter que confiar no autor, humano ou doutro xeito. Se preferirías ler isto que escoitarme dicilo, o "diff" chega á túa caixa de entrada
4:46 todas as mañás, de balde en the daily diff dot dev, ligazón a continuación. Entón, o veredicto de hoxe sobre live nerf.
Veredicto: SHIP IT, e non o cites antes do 24 de outubro
4:51 SHIP IT. Eu o enviaría porque é o primeiro argumento de "nerf" que vin cunha marca de tempo, un regulamento público e un punto cego declarado. Simplemente non o cites antes do vinte e catro de outubro. E esa é a "diff" de hoxe. Son Niko de Axrisi. Fusionar con responsabilidade.
Fontes
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



