# Hur man upptäcker en Claude nerf (med verklig data)

Published: 2026-09-30

Folk säger att Claude blir dummare några veckor efter varje lansering. En utvecklare satte Claude Opus 5.5 på en 30-dagars klocka från lanseringsveckan, med frysta frågor, en fäst Claude-kod och offentliga regler, och det visar varför ingen kunde ha vetat tidigare, och varför ditt tokenantal är det du ska titta på. Dom: SHIP IT.

Canonical: https://thedailydiff.dev/sv/video/2026-09-30-opus-nerf-meter/

## Vad den här videon täcker

- Claude blir dummare efter lansering: teorin möter en dag-noll-klocka
- livenerf: en 30-dagars klocka på Opus 5.5 från lanseringsveckan
- Hur man fångar en nerf: 78 ibland rätt frågor
- Vad den kan se: 7,5 poäng, och tokenantalet rör sig först
- Den blinda fläcken: ett Opus 5-byte och 8 felaktiga svarsnycklar

## Kapitel

- 0:00 Claude blir dummare efter lansering: teorin möter en dag-noll-klocka
- 0:26 livenerf: en 30-dagars klocka på Opus 5.5 från lanseringsveckan
- 1:24 Hur man fångar en nerf: 78 ibland rätt frågor
- 2:19 Vad den kan se: 7,5 poäng, och tokenantalet rör sig först
- 2:53 Den blinda fläcken: ett Opus 5-byte och 8 felaktiga svarsnycklar
- 3:08 Anthropic: vi minskar aldrig modellkvaliteten
- 3:45 Datacenter håller sina siffror hemliga; Backblaze publicerar
- 4:25 Kreditlinjen: Claude hjälpte till att bygga mätaren
- 4:50 Dom: SHIP IT, och citera det inte före den 24 oktober

## Översatt transkription

Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.

### Claude blir dummare efter lansering: teorin möter en dag-noll-klocka

0:00 Alla vet att Claude blir dummare några veckor efter lanseringen. Så en utvecklare satte Opus 5.5 på en klocka från lanseringsveckan, och klockan säger att ingen kunde ha vetat ännu. I den här videon, tre frågor. Hur fångar man en nerf? Vad kan den här mätaren se? Och vad säger Anthropic? Och en rad i repo:s krediter fick mig att skratta högt.

0:20 Jag återkommer till det i slutet. Det är onsdag den 30 september, och detta är The Daily Diff. Tre berättelser idag, och den stora är en GitHub-repo som heter live nerf.

### livenerf: en 30-dagars klocka på Opus 5.5 från lanseringsveckan

0:30 I månader har folk sagt att Anthropic tyst nerfar sina modeller efter lanseringen. De vanliga teorierna är en pressad modell, en mindre modell under samma namn eller helt enkelt mindre tänkande. Repon kallar varje argument hittills för vibbar kontra vibbar. Opus 5.5 lanserades den tjugoandra september, och för en vecka sedan berättade jag att den toppade den oberoende listan samtidigt som den skrev tre gånger fler ord än medianmodellen. Två och en halv dag in, började en utvecklare som heter ninja hawk klockan,

0:59 en gång om dagen i trettio dagar, med loggar som ingen får redigera. The Hacker News-tråden fick nästan åtta hundra poäng och delades som en team- chatt. En kommentator säger att nerfing av modeller inte är verkligt i de allra flesta rapporterade fallen. En annan säger att folk bara vänjer sig vid den nya nivån av intelligens. Och en Claude Code power user avfärdar nu rate-this-session- pop-up varje gång, eftersom att betygsätta Claude verkade göra det sämre. Kamratgranskning. Så, fråga ett, hur fångar man en nerf?

### Hur man fångar en nerf: 78 ibland rätt frågor

1:27 Man börjar med cirka tjugotre hundra svåra examensfrågor, och Opus får nittiotre procent rätt på första försöket, vilket är värdelöst för en detektor, eftersom en fråga den alltid får rätt inte kan falla. Nittiosju procent var alltid rätt eller alltid fel, och de sjuttiotioåtta den bara ibland får rätt blev panelen. Samma prompt, inga verktyg och exakt matchning med ingen AI-domare, eftersom domaren också skulle driva iväg. Den körs på ett Max-abonnemang via headless Claude Code,

1:55 eftersom API-versionen kostade cirka sextiohundra dollar i månaden. Och Claude Code-versionen är fäst, eftersom, med repo:s ord, en ändrad sele ser exakt ut som en ändrad modell. Statistiken kommer från en artikel som heter Adding Error Bars to Evals, av Evan Miller på Anthropic. Så Anthropics egen matematik granskar nu Anthropic, vilket är den akademiska versionen av att citera användarvillkoren tillbaka till kundtjänsten.

### Vad den kan se: 7,5 poäng, och tokenantalet rör sig först

2:19 Fråga två, vad kan den se? Per tiodygn, ett tapp på cirka sju och en halv poäng. För att bevisa att riggen fungerar, sänkte författaren Claude:s ansträngning medvetet. Medel ansträngning minskade utdata med cirka en fjärdedel, och poängen med bara fyra poäng. Låg ansträngning minskade utdata med nästan två tredjedelar, för åtta poäng. Det är den delen att stjäla. Mindre tänkande syns i tokenantalet innan det syns i svaren.

2:43 Så fäst din modellversion, logga utdata-tokens per uppgift, och behåll några frysta frågor själv. Om din agent plötsligt skriver kortare, kolla dina loggar innan du kollar Reddit. Och här är den ärliga delen.

### Den blinda fläcken: ett Opus 5-byte och 8 felaktiga svarsnycklar

2:54 Att tyst byta in den äldre Opus 5 var en för liten förändring för att riggen skulle kalla, och readme säger så direkt. Granskningen hittade också åtta svarsnycklar som ser felaktiga ut, så nerf-detektorn hittade buggar i riktmärket innan den hittade en nerf.

### Anthropic: vi minskar aldrig modellkvaliteten

3:08 Fråga tre, vad säger Anthropic? Förra året, efter en våg av klagomål, publicerade Anthropic en postmortem. Den säger, citat, vi minskar aldrig modellkvaliteten på grund av efterfrågan, tid på dygnet eller serverbelastning. Samma inlägg erkänner att tre buggar hade försämrat Claude, och nästan en tredjedel av Claude Code-användarna hamnade på fel servrar minst en gång. Så klagomålen var verkliga och orsaken var buggar, vilket är anledningen till att repon varnar för att lanseringsveckan kan vara den värsta veckan.

3:35 Sex av trettio dagar är inne. Det första möjliga samtalet landar runt den 24 oktober, så det ärliga svaret är att ingen vet, inklusive alla som var säkra. På tal om siffror som ingen publicerar.

### Datacenter håller sina siffror hemliga; Backblaze publicerar

3:46 Lighthouse Reports och den holländska tidningen Trouw fann att de allra flesta europeiska datacenter håller sin el- och vattenförbrukning hemlig, även om en EU-regel har krävt rapportering i tre år. I Nederländerna publicerar färre än en fjärdedel. Ett Microsoft-datacenter använder ensamt cirka en procent av nederländsk el. Under tiden gjorde Backblaze det tråkiga igen. Dess kvartalsvisa enhetsstatistik täcker cirka trehundrafemtiotusen hårddiskar, och felfrekvensen steg till 1,73 procent,

4:16 den högsta på ett tag. Tre Seagate-modeller hade noll fel. Så ser en offentlig baslinje ut, kvartal efter kvartal, i tretton år.

### Kreditlinjen: Claude hjälpte till att bygga mätaren

4:25 Nu, den kreditlinjen. Readme erkänner att mycket av repon skrevs med hjälp av Claude, vilket är modellen som mäts. Så Claude hjälpte till att bygga mätaren som kontrollerar om Claude blev dummare. Det är därför granskarna är enkla funktioner. Med författarens ord, du ska inte behöva lita på författaren, människa eller annat. Om du hellre vill läsa detta än att höra mig säga det, landar diffen i din inkorg

4:46 varje morgon, gratis på the daily diff dot dev, länk nedan. Så, dagens dom om live nerf.

### Dom: SHIP IT, och citera det inte före den 24 oktober

4:51 SHIP IT. Jag skulle SHIP IT eftersom det är det första nerf-argumentet jag har sett med en tidsstämpel, en offentlig regelbok och en angiven blind fläck. Citera det bara inte före den tjugofjärde oktober. Och det är diffen för idag. Jag är Niko från Axrisi. Sammanfoga ansvarsfullt.

## Källor

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
