+− THE DAILY DIFFdev & AI news
SHIP IT

Jak wykryć nerfa Claude (z prawdziwymi danymi)

Ludzie mówią, że Claude staje się głupszy kilka tygodni po każdym uruchomieniu.

Ludzie mówią, że Claude staje się głupszy kilka tygodni po każdym uruchomieniu. Jeden deweloper uruchomił Claude Opus 5.5 na 30-dniowym zegarze od tygodnia premiery, z zamrożonymi pytaniami, przypiętym kodem Claude Code i publicznymi zasadami, a to pokazuje, dlaczego nikt nie mógł o tym wcześniej wiedzieć i dlaczego liczba tokenów jest rzeczą, na którą należy zwracać uwagę. Werdykt: SHIP IT.

Przeczytaj wydanie pisemne (angielski) ↗

Co obejmuje ten film

  • Claude staje się głupszy po uruchomieniu: teoria spotyka zegar dnia zerowego
  • livenerf: 30-dniowy zegar na Opus 5.5 od tygodnia premiery
  • Jak złapać nerfa: 78 pytań, które czasem są poprawne
  • Co widzi: 7,5 punktu, a liczba tokenów przesuwa się pierwsza
  • Martwy punkt: zamiana Opus 5 i 8 błędnych kluczy odpowiedzi

Przetłumaczona transkrypcja

Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.

Claude staje się głupszy po uruchomieniu: teoria spotyka zegar dnia zerowego

0:00 Wszyscy wiedzą, że Claude staje się głupszy kilka tygodni po uruchomieniu. Więc jeden deweloper uruchomił Opus 5.5 na zegarze od tygodnia premiery, a zegar mówi, że nikt jeszcze nie mógł o tym wiedzieć. W tym filmie trzy pytania. Jak złapać nerfa? Co widzi ten miernik? I co mówi Anthropic? A jedna linijka w kredytach repozytorium rozśmieszyła mnie na głos.

0:20 Przejdę do tego na koniec. Jest środa, trzydziesty września, a to jest The Daily Diff. Dziś trzy historie, a ta duża to repozytorium GitHub o nazwie live nerf.

livenerf: 30-dniowy zegar na Opus 5.5 od tygodnia premiery

0:30 Od miesięcy ludzie mówią, że Anthropic po cichu osłabia swoje modele po uruchomieniu. Zwykłe teorie to ściśnięty model, mniejszy model pod tą samą nazwą lub po prostu mniej myślenia. Repozytorium nazywa każdy dotychczasowy argument "wibracje kontra wibracje". Opus 5.5 został wysłany 22 września, a tydzień temu powiedziałem, że uplasował się na czele niezależnej listy, pisząc trzy razy więcej słów niż przeciętny model. Po dwóch i pół dniach deweloper o pseudonimie ninja hawk uruchomił zegar,

0:59 raz dziennie przez trzydzieści dni, z logami, których nikt nie może edytować. Wątek na Hacker News osiągnął prawie osiemset punktów i rozpadł się jak czat zespołowy. Jeden komentator mówi, że osłabianie modeli nie jest prawdziwe w zdecydowanej większości zgłoszonych przypadków. Inny mówi, że ludzie po prostu przyzwyczajają się do nowego poziomu inteligencji. A jeden zaawansowany użytkownik Claude Code teraz zawsze odrzuca wyskakujące okienko "oceń tę sesję", ponieważ ocenianie Claude wydawało się pogarszać jego działanie. Recenzja. Pytanie pierwsze: jak złapać nerfa?

Jak złapać nerfa: 78 pytań, które czasem są poprawne

1:27 Zaczynasz od około dwóch tysięcy trzystu trudnych pytań egzaminacyjnych, a Opus uzyskuje dziewięćdziesiąt trzy procent poprawnych odpowiedzi za pierwszym razem, co jest bezużyteczne dla detektora, ponieważ pytanie, na które zawsze odpowiada poprawnie, nie może spaść. Dziewięćdziesiąt siedem procent zawsze było poprawnych lub zawsze błędnych, a siedemdziesiąt osiem, na które tylko czasem odpowiada poprawnie, stało się panelem. Ten sam prompt, bez narzędzi i ocena dokładnego dopasowania bez sędziego AI, ponieważ sędzia też by się zmieniał. Działa na subskrypcji Max przez bezgłowy Claude Code,

1:55 ponieważ wersja API kosztowała około szesnastu tysięcy dolarów miesięcznie. A wersja Claude Code jest przypięta, ponieważ, jak mówi repozytorium, zmieniona uprząż wygląda dokładnie tak samo jak zmieniony model. Statystyki pochodzą z artykułu zatytułowanego "Adding Error Bars to Evals", autorstwa Evana Millera z Anthropic. Więc własna matematyka Anthropic audytuje teraz Anthropic, co jest akademicką wersją cytowania warunków usługi z powrotem do obsługi klienta.

Co widzi: 7,5 punktu, a liczba tokenów przesuwa się pierwsza

2:19 Pytanie drugie: co widzi? Na każde dziesięciodniowe okno, spadek o około siedem i pół punktu. Aby udowodnić, że platforma działa, autor celowo zmniejszył wysiłek Claude. Średni wysiłek zmniejszył wynik o około jedną czwartą, a wynik tylko o cztery punkty. Niski wysiłek zmniejszył wynik o prawie dwie trzecie, za osiem punktów. To jest część, którą należy ukraść. Mniej myślenia pojawia się w liczbie tokenów, zanim pojawi się w odpowiedziach.

2:43 Więc przypnij swoją wersję modelu, loguj tokeny wyjściowe na zadanie, i zachowaj kilka własnych zamrożonych pytań. Jeśli twój agent nagle pisze krócej, sprawdź logi, zanim sprawdzisz Reddit. A oto szczera część.

Martwy punkt: zamiana Opus 5 i 8 błędnych kluczy odpowiedzi

2:54 Cicha zamiana na starszy Opus 5 była zbyt małą zmianą, aby platforma mogła ją wykryć, i readme mówi o tym od razu. Audyt wykrył również osiem kluczy odpowiedzi, które wydają się błędne, więc detektor nerfa znalazł błędy w benchmarku, zanim znalazł nerfa.

Anthropic: nigdy nie obniżamy jakości modelu

3:08 Pytanie trzecie: co mówi Anthropic? W zeszłym roku, po fali skarg, Anthropic opublikował analizę poincydentalną. Mówi ona, cytuję, nigdy nie zmniejszamy jakości modelu z powodu popytu, pory dnia ani obciążenia serwera. Ten sam post przyznaje, że trzy błędy zdegradowały Claude, a prawie jedna trzecia użytkowników Claude Code przynajmniej raz trafiła na niewłaściwe serwery. Więc skargi były prawdziwe, a przyczyną były błędy, dlatego repozytorium ostrzega, że tydzień premiery może być najgorszym tygodniem.

3:35 Sześć z trzydziestu dni już minęło. Pierwsza możliwa ocena nastąpi około 24 października, więc szczerą odpowiedzią jest, że nikt nie wie, w tym wszyscy, którzy byli pewni. Mówiąc o liczbach, których nikt nie publikuje.

Centra danych utrzymują swoje liczby w tajemnicy; Backblaze publikuje

3:46 Lighthouse Reports i holenderska gazeta Trouw odkryły, że zdecydowana większość europejskich centrów danych utrzymuje w tajemnicy zużycie energii i wody, chociaż przepis UE wymaga raportowania od trzech lat. W Holandii publikuje mniej niż jedna czwarta. Jedno centrum danych Microsoftu zużywa około jednego procenta holenderskiej energii elektrycznej. Tymczasem Backblaze znowu zrobił to, co nudne. Jego kwartalne statystyki dysków obejmują około trzystu pięćdziesięciu tysięcy dysków twardych, a wskaźnik awaryjności wzrósł do jednego przecinek siedemdziesiąt trzy procent,

4:16 najwyższego od dłuższego czasu. Trzy modele Seagate miały zero awarii. Tak wygląda publiczna baza odniesienia, kwartał po kwartale, przez trzynaście lat.

Linia kredytów: Claude pomógł zbudować miernik

4:25 Teraz ta linijka kredytów. W readme przyznano, że duża część repozytorium została napisana z pomocą Claude, czyli modelu, który jest mierzony. Więc Claude pomógł zbudować miernik, który sprawdza, czy Claude stał się głupszy. Dlatego oceniający są prostymi funkcjami. Słowami autora, nie powinieneś ufać autorowi, ludzkiemu ani innemu. Jeśli wolisz to przeczytać, niż usłyszeć, jak to mówię, The Daily Diff ląduje w Twojej skrzynce odbiorczej

4:46 każdego ranka, bezpłatnie na thedailydiff.dev, link poniżej. Więc dzisiejszy werdykt na temat live nerf.

Werdykt: SHIP IT i nie cytuj przed 24 października

4:51 SHIP IT. Wysłałbym to, bo to pierwszy argument dotyczący nerfa, jaki widziałem z znacznikiem czasu, publicznym regulaminem i zadeklarowanym martwym punktem. Tylko nie cytuj tego przed 24 października. I to wszystko na dziś. Jestem Niko z Axrisi. Łącz odpowiedzialnie.

Źródła

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Powiązane filmy