# Cómo detectar una "nerf" de Claude (con datos reales)

Published: 2026-09-30

La gente dice que Claude se vuelve más tonto unas semanas después de cada lanzamiento. Un desarrollador puso Claude Opus 5.5 en un reloj de 30 días desde la semana de lanzamiento, con preguntas congeladas, un Claude Code fijado y reglas públicas, y esto muestra por qué nadie podría haberlo sabido antes, y por qué tu recuento de tokens es lo que hay que observar. Veredicto: SHIP IT.

Canonical: https://thedailydiff.dev/es-US/video/2026-09-30-opus-nerf-meter/

## Lo que cubre este video

- Claude se vuelve más tonto después del lanzamiento: la teoría se enfrenta a un reloj de día cero
- livenerf: un reloj de 30 días en Opus 5.5 desde la semana de lanzamiento
- Cómo detectar una "nerf": 78 preguntas a veces correctas
- Lo que puede ver: 7.5 puntos, y el recuento de tokens se mueve primero
- El punto ciego: un intercambio de Opus 5 y 8 claves de respuesta incorrectas

## Capítulos

- 0:00 Claude se vuelve más tonto después del lanzamiento: la teoría se enfrenta a un reloj de día cero
- 0:26 livenerf: un reloj de 30 días en Opus 5.5 desde la semana de lanzamiento
- 1:24 Cómo detectar una "nerf": 78 preguntas a veces correctas
- 2:19 Lo que puede ver: 7.5 puntos, y el recuento de tokens se mueve primero
- 2:53 El punto ciego: un intercambio de Opus 5 y 8 claves de respuesta incorrectas
- 3:08 Anthropic: nunca reducimos la calidad del modelo
- 3:45 Los centros de datos mantienen sus números en secreto; Backblaze los publica
- 4:25 La línea de créditos: Claude ayudó a construir el medidor
- 4:50 Veredicto: SHIP IT, y no lo cites antes del 24 de octubre

## Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles son controlados por YouTube.

### Claude se vuelve más tonto después del lanzamiento: la teoría se enfrenta a un reloj de día cero

0:00 Todo el mundo sabe que Claude se vuelve más tonto unas semanas después del lanzamiento. Así que un desarrollador puso Opus cinco punto cinco en un reloj desde la semana de lanzamiento, y el reloj dice que nadie podría haberlo sabido todavía. En este video, tres preguntas. ¿Cómo se detecta una "nerf"? ¿Qué puede ver este medidor? ¿Y qué dice Anthropic? Y una línea en los créditos del repositorio me hizo reír a carcajadas.

0:20 Llegaré a eso al final. Es miércoles, treinta de septiembre, y esto es The Daily Diff. Tres historias hoy, y la grande es un repositorio de GitHub llamado live nerf.

### livenerf: un reloj de 30 días en Opus 5.5 desde la semana de lanzamiento

0:30 Durante meses, la gente ha dicho que Anthropic silencia sus modelos después del lanzamiento. Las teorías habituales son un modelo comprimido, un modelo más pequeño bajo el mismo nombre o simplemente menos pensamiento. El repositorio llama a cada argumento hasta ahora "vibes versus vibes". Opus cinco punto cinco se lanzó el veintidós de septiembre, y hace una semana les dije que encabezaba la tabla independiente mientras escribía tres veces más palabras que el modelo promedio. Dos días y medio después, un desarrollador llamado ninja hawk comenzó el reloj,

0:59 una vez al día durante treinta días, con registros que nadie puede editar. El hilo de Hacker News alcanzó casi ochocientos puntos y se dividió como un chat de equipo. Un comentarista dice que "nerfear" modelos no es real en la gran mayoría de los casos reportados. Otro dice que la gente simplemente se está acostumbrando al nuevo nivel de inteligencia. Y un usuario avanzado de Claude Code ahora descarta la ventana emergente de "califica esta sesión" cada vez, porque calificar a Claude parecía empeorarlo. Revisión por pares. Entonces, pregunta uno, ¿cómo se detecta una "nerf"?

### Cómo detectar una "nerf": 78 preguntas a veces correctas

1:27 Se empieza con unas dos mil trescientas preguntas de examen difíciles, y Opus acierta el noventa y tres por ciento a la primera, lo cual es inútil para un detector, ya que una pregunta que siempre acierta no puede caer. El noventa y siete por ciento siempre fueron correctas o siempre incorrectas, y las setenta y ocho que solo a veces acierta se convirtieron en el panel. Misma indicación, sin herramientas, y calificación de coincidencia exacta sin juez de IA, porque el juez también se desviaría. Se ejecuta en una suscripción Max a través de headless Claude Code,

1:55 ya que la versión de la API tenía un precio de unos mil seiscientos dólares al mes. Y la versión de Claude Code está fijada, porque, en palabras del repositorio, un arnés cambiado se ve exactamente como un modelo cambiado. Las estadísticas provienen de un artículo llamado "Adding Error Bars to Evals", de Evan Miller en Anthropic. Así que las propias matemáticas de Anthropic ahora están auditando a Anthropic, que es la versión académica de citar los términos de servicio de vuelta al soporte al cliente.

### Lo que puede ver: 7.5 puntos, y el recuento de tokens se mueve primero

2:19 Pregunta dos, ¿qué puede ver? Por ventana de diez días, una caída de unos siete puntos y medio. Para probar que el sistema funciona, el autor redujo el esfuerzo de Claude a propósito. Un esfuerzo medio redujo la producción en aproximadamente un cuarto, y la puntuación en solo cuatro puntos. Un esfuerzo bajo redujo la producción en casi dos tercios, por ocho puntos. Esa es la parte que hay que robar. Menos pensamiento aparece en el recuento de tokens antes de que aparezca en las respuestas.

2:43 Así que fija tu versión del modelo, registra los tokens de salida por tarea, y guarda algunas preguntas congeladas tuyas. Si tu agente de repente escribe más corto, revisa tus registros antes de revisar Reddit. Y aquí está la parte honesta.

### El punto ciego: un intercambio de Opus 5 y 8 claves de respuesta incorrectas

2:54 El intercambio silencioso del Opus cinco más antiguo fue un cambio demasiado pequeño para que el sistema lo detectara, y el "readme" lo dice de antemano. La auditoría también encontró ocho claves de respuesta que parecen incorrectas, así que el detector de "nerf" encontró errores en el "benchmark" antes de encontrar una "nerf".

### Anthropic: nunca reducimos la calidad del modelo

3:08 Pregunta tres, ¿qué dice Anthropic? El año pasado, después de una ola de quejas, Anthropic publicó un "postmortem". Dice, cito, nunca reducimos la calidad del modelo debido a la demanda, la hora del día o la carga del servidor. El mismo "post" admite que tres errores habían degradado a Claude, y casi un tercio de los usuarios de Claude Code llegaron a los servidores equivocados al menos una vez. Así que las quejas eran reales y la causa eran errores, por lo que el repositorio advierte que la semana de lanzamiento podría ser la peor semana.

3:35 Seis de treinta días ya pasaron. La primera posible llamada aterriza alrededor del veinticuatro de octubre, así que la respuesta honesta es que nadie lo sabe, incluyendo a todos los que estaban seguros. Hablando de números que nadie publica.

### Los centros de datos mantienen sus números en secreto; Backblaze los publica

3:46 Lighthouse Reports y el periódico holandés Trouw descubrieron que la gran mayoría de los centros de datos europeos mantienen en secreto su uso de energía y agua, aunque una norma de la UE ha exigido la notificación durante tres años. En los Países Bajos, menos de una cuarta parte publica. Solo un centro de datos de Microsoft utiliza aproximadamente el uno por ciento de la electricidad holandesa. Mientras tanto, Backblaze hizo lo aburrido de nuevo. Sus estadísticas trimestrales de unidades cubren aproximadamente trescientos cincuenta mil discos duros, y la tasa de fallos subió al uno punto setenta y tres por ciento,

4:16 la más alta en mucho tiempo. Tres modelos de Seagate no tuvieron fallos. Así es como se ve una línea base pública, trimestre tras trimestre, durante trece años.

### La línea de créditos: Claude ayudó a construir el medidor

4:25 Ahora, esa línea de créditos. El "readme" admite que gran parte del repositorio fue escrito con la ayuda de Claude, que es el modelo que se está midiendo. Así que Claude ayudó a construir el medidor que comprueba si Claude se volvió más tonto. Por eso los calificadores son funciones simples. En palabras del autor, no se debería tener que confiar en el autor, humano o no. Si prefieres leer esto antes que oírme decirlo, el "diff" llega a tu bandeja de entrada

4:46 todas las mañanas, gratis en the daily diff dot dev, enlace abajo. Entonces, el veredicto de hoy sobre live nerf.

### Veredicto: SHIP IT, y no lo cites antes del 24 de octubre

4:51 SHIP IT. Lo enviaría porque es el primer argumento de "nerf" que he visto con una marca de tiempo, un libro de reglas público y un punto ciego declarado. Simplemente no lo cites antes del veinticuatro de octubre. Y esa es la diferencia de hoy. Soy Niko de Axrisi. Fusiona responsablemente.

## Fuentes

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
