# Hogyan lehet észlelni egy Claude nerfet (valós adatokkal)

Published: 2026-09-30

Az emberek azt mondják, Claude minden indítás után néhány héttel butább lesz. Egy fejlesztő 30 napra állította be a Claude Opus 5.5-öt az indítás hetétől számítva, rögzített kérdésekkel, rögzített Claude kóddal és nyilvános szabályokkal, és ez megmutatja, miért nem tudhatta senki korábban, és miért a token számlálóra kell figyelni. Ítélet: SHIP IT.

Canonical: https://thedailydiff.dev/hu/video/2026-09-30-opus-nerf-meter/

## Amit ez a videó tartalmaz

- Claude butább lesz az indítás után: az elmélet találkozik a nulla-napi órával
- élő nerf: egy 30 napos óra az Opus 5.5-ön az indítás hetétől
- Hogyan kapjunk el egy nerfet: 78 néha-jó kérdés
- Mit láthat: 7,5 pont, és a token számláló mozog először
- A vakfolt: egy Opus 5 csere és 8 rossz válaszkulcs

## Fejezetek

- 0:00 Claude butább lesz az indítás után: az elmélet találkozik a nulla-napi órával
- 0:26 élő nerf: egy 30 napos óra az Opus 5.5-ön az indítás hetétől
- 1:24 Hogyan kapjunk el egy nerfet: 78 néha-jó kérdés
- 2:19 Mit láthat: 7,5 pont, és a token számláló mozog először
- 2:53 A vakfolt: egy Opus 5 csere és 8 rossz válaszkulcs
- 3:08 Anthropic: soha nem csökkentjük a modell minőségét
- 3:45 Az adatközpontok titokban tartják a számaikat; a Backblaze közzéteszi
- 4:25 A kreditsor: Claude segített felépíteni a mérőt
- 4:50 Ítélet: SHIP IT, és ne idézd október 24 előtt

## Lefordított átirat

Az eredeti angol narrációból fordítva. A rendelkezésre álló hangot és feliratokat a YouTube vezérli.

### Claude butább lesz az indítás után: az elmélet találkozik a nulla-napi órával

0:00 Mindenki tudja, hogy Claude butább lesz néhány héttel az indítás után. Így egy fejlesztő harminc napra állította az Opus ötpontötös órát az indítás hetétől, és az óra szerint senki sem tudhatta még. Ebben a videóban három kérdés. Hogyan kapunk el egy nerfet? Mit láthat ez a mérő? És mit mond az Anthropic? És egy sor a repo kreditjeiben hangosan felnevettetett.

0:20 A végén rátérek. Szeptember harmincada szerda van, és ez a The Daily Diff. Három történet ma, és a nagy egy egy GitHub repo, neve élő nerf.

### élő nerf: egy 30 napos óra az Opus 5.5-ön az indítás hetétől

0:30 Hónapok óta mondják az emberek, hogy az Anthropic csendben butítja a modelljeit az indítás után. A szokásos elméletek szerint egy összenyomott modell, egy kisebb modell ugyanazon név alatt vagy egyszerűen kevesebb gondolkodás. A repo eddig minden érvet hangulat kontra hangulatként ír le. Az Opus ötpontötös szeptember huszonkettedikén jelent meg, és egy hete elmondtam, hogy vezette a független táblázatot, miközben háromszor annyi szót írt, mint a medián modell. Két és fél nappal később egy ninja hawk nevű fejlesztő elindította az órát,

0:59 naponta egyszer harminc napig, olyan naplókkal, amelyeket senki sem szerkeszthet. A Hacker News szál közel nyolcszáz pontot ért el, és szétvált, mint egy csoportos chat. Egy kommentelő szerint a modellek butítása nem valós a bejelentett esetek túlnyomó többségében. Egy másik szerint az emberek csak hozzászoknak az új intelligencia szinthez. És egy Claude Code haladó felhasználó mostantól minden alkalommal elutasítja az „értékeld ezt a munkamenetet” előugró ablakot, mert Claude értékelése rontani látszott a teljesítményét. Szakértői felülvizsgálat. Szóval, első kérdés, hogyan kapunk el egy nerfet?

### Hogyan kapjunk el egy nerfet: 78 néha-jó kérdés

1:27 Körülbelül huszonháromszáz nehéz vizsgakérdéssel kezdjük, és az Opus kilencvenhárom százalékot old meg helyesen első próbálkozásra, ami haszontalan egy detektor számára, mivel egy kérdés, amit mindig helyesen old meg, nem csökkenhet. Kilencvenhét százalék mindig helyes vagy mindig helytelen volt, és a hetvennyolc, amit csak néha old meg helyesen, lett a panel. Ugyanaz a prompt, nincs eszköz, és pontosan egyező értékelés AI bíró nélkül, mert a bíró is eltévedne. Max előfizetéssel fut headless Claude Code-on keresztül,

1:55 mivel az API verzió ára havonta körülbelül ezerhatszáz dollár volt. És a Claude Code verzió rögzített, mert a repo szavaival élve, egy megváltozott keret pontosan úgy néz ki, mint egy megváltozott modell. A statisztikák egy „Adding Error Bars to Evals” című tanulmányból származnak, Evan Miller tollából az Anthropic-nál. Tehát az Anthropic saját matematikája most az Anthropicot auditálja, ami az akadémiai verziója annak, hogy az ügyfélszolgálatnak idézzük vissza a szolgáltatási feltételeket.

### Mit láthat: 7,5 pont, és a token számláló mozog először

2:19 Második kérdés, mit láthat? Tíz napos ablakonként körülbelül hét és fél pontos csökkenés. Hogy bizonyítsa a berendezés működését, a szerző szándékosan lecsökkentette Claude erőfeszítését. A közepes erőfeszítés körülbelül negyedével csökkentette a kimenetet, és csak négy ponttal a pontszámot. Az alacsony erőfeszítés majdnem kétharmadával csökkentette a kimenetet, nyolc pontért. Ezt kell ellopni. A kevesebb gondolkodás előbb megjelenik a token számlálóban, mint a válaszokban.

2:43 Tehát rögzítse a modell verzióját, naplózza a kimeneti tokeneket feladatonként, és tartson néhány saját, rögzített kérdést. Ha az ügynöke hirtelen rövidebben ír, ellenőrizze a naplóit, mielőtt a Redditre néz. És itt jön az őszinte rész.

### A vakfolt: egy Opus 5 csere és 8 rossz válaszkulcs

2:54 Az idősebb Opus öt csendes cseréje túl kicsi változás volt ahhoz, hogy a berendezés jelezze, és a readme ezt előre is mondja. Az audit nyolc hibásnak tűnő válaszkulcsot is talált, tehát a nerf detektor hibákat talált a benchmarkban, mielőtt nerfet talált volna.

### Anthropic: soha nem csökkentjük a modell minőségét

3:08 Harmadik kérdés, mit mond az Anthropic? Tavaly, egy panaszáradat után, az Anthropic közzétett egy utólagos elemzést. Azt mondja, idézem: soha nem csökkentjük a modell minőségét a kereslet, a napszak vagy a szerverterhelés miatt. Ugyanez a poszt elismeri, hogy három hiba rontotta Claude-ot, és a Claude Code felhasználók majdnem egyharmada legalább egyszer rossz szervereket talált el. Tehát a panaszok valósak voltak, és az ok hibák voltak, ezért figyelmeztet a repo, hogy az indítás hete lehet a legrosszabb hét.

3:35 Harminc napból hat már eltelt. Az első lehetséges jelzés október huszonnegyedike körül várható, tehát az őszinte válasz az, hogy senki sem tudja, beleértve azokat is, akik biztosak voltak. Apropó, számok, amiket senki sem publikál.

### Az adatközpontok titokban tartják a számaikat; a Backblaze közzéteszi

3:46 A Lighthouse Reports és a holland Trouw újság megállapította, hogy az európai adatközpontok túlnyomó többsége titokban tartja áram- és vízfogyasztását, bár egy uniós szabály három éve előírja a jelentéstételt. Hollandiában kevesebb mint negyedük publikál. Egyetlen Microsoft adatközpont egyedül a holland villamos energia körülbelül egy százalékát használja fel. Eközben a Backblaze ismét megtette az unalmas dolgot. Negyedéves meghajtó statisztikái körülbelül háromszázötven ezer merevlemezt fednek le, és a meghibásodási arány egy pont hetvenhárom százalékra nőtt,

4:16 ami egy ideje a legmagasabb. Három Seagate modellben nulla meghibásodás volt. Így néz ki egy nyilvános alapvonal, negyedévről negyedévre, tizenhárom éven át.

### A kreditsor: Claude segített felépíteni a mérőt

4:25 Most az a kreditsor. A readme elismeri, hogy a repo nagy részét Claude segítségével írták, ami a mért modell. Tehát Claude segített felépíteni a mérőt, amely ellenőrzi, hogy Claude butább lett-e. Ezért vannak az osztályozók egyszerű függvények. A szerző szavaival élve, nem kellene bíznod a szerzőben, emberben vagy másban. Ha inkább elolvasnád ezt, mint hallanád, minden reggel megkapod a diffet az e-mail fiókodba,

4:46 ingyen a the daily diff.dev címen, link lent. Tehát, a mai ítélet az élő nerfről.

### Ítélet: SHIP IT, és ne idézd október 24 előtt

4:51 SHIP IT. Én SHIP IT-nek nyilvánítanám, mert ez az első nerf érv, amit láttam, időbélyeggel, nyilvános szabálykönyvvel és megállapított vakfolttal. Csak ne idézd október huszonnegyedik előtt. És ez a mai diff. Niko vagyok az Axrisi-től. Felelősségteljesen egyesíts.

## Források

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
