+− THE DAILY DIFFdev & AI news
SHIP IT

Com detectar una "nerf" de Claude (amb dades reals)

La gent diu que Claude es torna més tonto poques setmanes després de cada llançament.

La gent diu que Claude es torna més tonto poques setmanes després de cada llançament. Un desenvolupador va posar Claude Opus 5.5 en un rellotge de 30 dies des de la setmana de llançament, amb preguntes congelades, un Claude Code fixat i regles públiques, i això mostra per què ningú podria haver-ho sabut abans, i per què el vostre recompte de tokens és el que cal observar. Veredicte: SHIP IT.

Llegeix l'edició escrita (anglès) ↗

Què cobreix aquest vídeo

  • Claude es torna més tonto després del llançament: la teoria es troba amb un rellotge de dia zero
  • livenerf: un rellotge de 30 dies a Opus 5.5 des de la setmana de llançament
  • Com detectar una "nerf": 78 preguntes a vegades correctes
  • Què pot veure: 7,5 punts, i el recompte de tokens es mou primer
  • El punt cec: un intercanvi d'Opus 5 i 8 claus de resposta incorrectes

Transcripció traduïda

Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.

Claude es torna més tonto després del llançament: la teoria es troba amb un rellotge de dia zero

0:00 Tothom sap que Claude es torna més tonto poques setmanes després del llançament. Així que un desenvolupador va posar Opus 5.5 en un rellotge des de la setmana de llançament, i el rellotge diu que ningú ho podria haver sabut encara. En aquest vídeo, tres preguntes. Com es detecta una "nerf"? Què pot veure aquest mesurador? I què diu Anthropic? I una línia als crèdits del repositori em va fer riure a gust.

0:20 Ho explicaré al final. És dimecres, 30 de setembre, i això és The Daily Diff. Tres històries avui, i la més important és un repositori de GitHub anomenat live nerf.

livenerf: un rellotge de 30 dies a Opus 5.5 des de la setmana de llançament

0:30 Durant mesos, la gent ha dit que Anthropic debilita els seus models en silenci després del llançament. Les teories habituals són un model reduït, un model més petit amb el mateix nom o simplement menys capacitat de pensament. El repositori anomena cada argument fins ara "sensacions contra sensacions". Opus 5.5 es va llançar el 22 de setembre, i fa una setmana us vaig dir que encapçalava el rànquing independent mentre escrivia tres vegades més paraules que el model mitjà. Dos dies i mig després, un desenvolupador anomenat ninja hawk va iniciar el rellotge,

0:59 un cop al dia durant trenta dies, amb registres que ningú pot editar. El fil de Hacker News va arribar a gairebé vuit-cents punts i es va dividir com un xat d'equip. Un comentarista diu que la "nerf" de models no és real en la gran majoria dels casos reportats. Un altre diu que la gent s'està acostumant al nou nivell d' intel·ligència. I un usuari avançat de Claude Code ara descarta la finestra emergent "valora aquesta sessió" cada vegada, perquè puntuar Claude semblava empitjorar-lo. Revisió per parells. Així, pregunta u, com es detecta una "nerf"?

Com detectar una "nerf": 78 preguntes a vegades correctes

1:27 Es comença amb unes dues mil tres-centes preguntes d'examen difícils, i Opus encerta el noranta-tres per cent a la primera, cosa que és inútil per a un detector, ja que una pregunta que sempre encerta no pot baixar. El noranta-set per cent sempre eren correctes o sempre incorrectes, i les setanta-vuit que només encerta de vegades van formar el panell. La mateixa indicació, sense eines, i una avaluació de concordança exacta sense jutge d'IA, perquè el jutge també derivaria. Funciona amb una subscripció Max a través de Claude Code sense interfície gràfica,

1:55 ja que la versió de l'API tenia un preu d'uns mil sis-cents dòlars al mes. I la versió de Claude Code està fixada, perquè, segons les paraules del repositori, un arnés canviat s'assembla exactament a un model canviat. Les estadístiques provenen d'un article anomenat "Adding Error Bars to Evals", d'Evan Miller d'Anthropic. Així que les pròpies matemàtiques d'Anthropic estan ara auditant Anthropic, que és la versió acadèmica de citar els termes de servei al servei d'atenció al client.

Què pot veure: 7,5 punts, i el recompte de tokens es mou primer

2:19 Pregunta dos, què pot veure? Per cada finestra de deu dies, una caiguda d'uns set punts i mig. Per provar que l'aparell funciona, l'autor va reduir l'esforç de Claude a propòsit. Un esforç mitjà va reduir la sortida en aproximadament una quarta part, i la puntuació en només quatre punts. Un esforç baix va reduir la sortida en gairebé dos terços, per vuit punts. Aquesta és la part a robar. Menys capacitat de pensament apareix en el recompte de tokens abans que aparegui en les respostes.

2:43 Així que fixeu la versió del vostre model, registreu els tokens de sortida per tasca, i conserveu algunes preguntes congelades pròpies. Si el vostre agent de sobte escriu més curt, reviseu els vostres registres abans de revisar Reddit. I aquí la part honesta.

El punt cec: un intercanvi d'Opus 5 i 8 claus de resposta incorrectes

2:54 El canvi en silenci a l'Opus 5 antic va ser un canvi massa petit perquè l'aparell el detectés, i el "readme" ho diu clarament. L'auditoria també va trobar vuit claus de resposta que semblen incorrectes, així que el detector de "nerfs" va trobar errors en el "benchmark" abans de trobar una "nerf".

Anthropic: mai reduïm la qualitat del model

3:08 Pregunta tres, què diu Anthropic? L'any passat, després d'una onada de queixes, Anthropic va publicar un "postmortem". Diu, cito, "mai reduïm la qualitat del model a causa de la demanda," "l'hora del dia o la càrrega del servidor". La mateixa publicació admet que tres errors havien degradat Claude, i gairebé un terç dels usuaris de Claude Code van accedir als servidors equivocats almenys una vegada. Així que les queixes eren reals i la causa eren errors, per això el repositori adverteix que la setmana de llançament podria ser la pitjor setmana.

3:35 Sis de trenta dies ja han passat. La primera possible detecció arribarà al voltant del 24 d'octubre, així que la resposta honesta és que ningú ho sap, incloent tots els que n'estaven segurs. Parlant de números que ningú publica.

Els centres de dades mantenen els seus números en secret; Backblaze publica

3:46 Lighthouse Reports i el diari neerlandès Trouw van trobar que la gran majoria dels centres de dades europeus mantenen en secret el seu consum d'energia i aigua, tot i que una norma de la UE ha exigit la declaració durant tres anys. Als Països Baixos, menys d'una quarta part publica. Un centre de dades de Microsoft només utilitza al voltant de l'u per cent de l'electricitat neerlandesa. Mentrestant, Backblaze va tornar a fer el que és avorrit. Les seves estadístiques trimestrals de discs cobreixen uns tres-cents cinquanta mil discs durs, i la taxa de fallada va augmentar a l'u punt setanta-tres per cent,

4:16 la més alta en un temps. Tres models de Seagate van tenir zero fallades. Així és com es veu una línia base pública, trimestre rere trimestre, durant tretze anys.

La línia de crèdits: Claude va ajudar a construir el mesurador

4:25 Ara, aquesta línia de crèdits. El "readme" admet que gran part del repositori es va escriure amb l'ajuda de Claude, que és el model que s'està mesurant. Així que Claude va ajudar a construir el mesurador que comprova si Claude es va tornar més tonto. Per això els avaluadors són funcions simples. Segons les paraules de l'autor, "no hauries de confiar en l'autor", "humà o no". Si preferiu llegir això que sentir-me dir-ho, la diferència arriba a la vostra safata d'entrada

4:46 cada matí, gratuïtament a the daily diff dot dev, enllaç a continuació. Així, el veredicte d'avui sobre live nerf.

Veredicte: SHIP IT, i no el citeu abans del 24 d'octubre

4:51 SHIP IT. El llançaria perquè és el primer argument de "nerf" que he vist amb una marca de temps, un reglament públic i un punt cec declarat. Simplement no el citeu abans del 24 d'octubre. I aquesta és la diferència d'avui. Sóc en Niko d'Axrisi. Fusioneu amb responsabilitat.

Fonts

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Vídeos relacionats