+− THE DAILY DIFFdev & AI news
SHIP IT

Як виявити нерф Claude (з реальними даними)

Кажуть, Claude тупішає через кілька тижнів після кожного запуску.

Кажуть, Claude тупішає через кілька тижнів після кожного запуску. Один розробник запустив Claude Opus 5.5 з 30-денним відліком від тижня запуску, з замороженими питаннями, закріпленим кодом Claude та публічними правилами, і це показує, чому ніхто не міг знати раніше, і чому кількість токенів є тим, на що варто звертати увагу. Вердикт: SHIP IT.

Читати письмову версію (англійською) ↗

Що охоплює це відео

  • Claude тупішає після запуску: теорія зустрічається з відліком від нульового дня
  • livenerf: 30-денний відлік на Opus 5.5 від тижня запуску
  • Як спіймати нерф: 78 іноді правильних питань
  • Що він може бачити: 7.5 балів, і кількість токенів змінюється першою
  • Сліпа зона: заміна Opus 5 та 8 неправильних ключів відповідей

Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

Claude тупішає після запуску: теорія зустрічається з відліком від нульового дня

0:00 Усі знають, що Claude тупішає через кілька тижнів після запуску. Тож один розробник запустив Opus 5.5 з відліком від тижня запуску, і відлік показує, що ніхто не міг знати це раніше. У цьому відео, три питання. Як ви виявляєте нерф? Що може бачити цей лічильник? І що говорить Anthropic? І один рядок у кредитах репозиторію змусив мене голосно сміятися.

0:20 Я розповім про це в кінці. Сьогодні середа, 30 вересня, і це The Daily Diff. Три історії сьогодні, і найбільша — це репозиторій GitHub під назвою livenerf.

livenerf: 30-денний відлік на Opus 5.5 від тижня запуску

0:30 Протягом місяців люди говорили, що Anthropic тихо нерфує свої моделі після запуску. Звичайні теорії — це стиснута модель, менша модель під тією ж назвою або просто менше мислення. Репозиторій називає кожен аргумент досі «відчуття проти відчуттів». Opus 5.5 був випущений 22 вересня, і тиждень тому я розповідав вам, що він очолив незалежний рейтинг, пишучи в три рази більше слів, ніж середня модель. Через два з половиною дні розробник на ім'я ninja hawk запустив відлік,

0:59 раз на день протягом тридцяти днів, з логами, які ніхто не може редагувати. Тема на Hacker News набрала майже вісімсот балів і розділилася, як командний чат. Один коментатор каже, що нерф моделей не є реальним у переважній більшості повідомлених випадків. Інший каже, що люди просто звикають до нового рівня інтелекту. А один досвідчений користувач Claude Code тепер відхиляє спливаюче вікно «оцініть цю сесію» щоразу, тому що оцінка Claude, здавалося, робила його гіршим. Рецензія. Отже, питання перше, як ви виявляєте нерф?

Як спіймати нерф: 78 іноді правильних питань

1:27 Ви починаєте з близько двох тисяч трьохсот складних екзаменаційних питань, і Opus отримує дев'яносто три відсотки правильних з першої спроби, що марно для детектора, оскільки питання, на яке він завжди відповідає правильно, не може зменшитися. Дев'яносто сім відсотків завжди були правильними або завжди неправильними, а сімдесят вісім, на які він іноді відповідає правильно, стали панеллю. Той самий промпт, без інструментів, і оцінка точного збігу без судді AI, тому що суддя також дрейфував би. Він працює за підпискою Max через безголовий Claude Code,

1:55 оскільки версія API коштувала близько шістнадцятисот доларів на місяць. І версія Claude Code закріплена, тому що, за словами репозиторію, змінений каркас виглядає точно так само, як змінена модель. Статистика походить з статті під назвою «Додавання смуг похибки до оцінок», Евана Міллера з Anthropic. Отже, власна математика Anthropic тепер перевіряє Anthropic, що є академічною версією цитування умов обслуговування назад до служби підтримки.

Що він може бачити: 7.5 балів, і кількість токенів змінюється першою

2:19 Питання друге, що воно може бачити? За десятиденний період, падіння близько семи з половиною балів. Щоб довести, що установка працює, автор навмисно зменшив зусилля Claude. Середні зусилля зменшили вихід приблизно на чверть, а оцінку лише на чотири бали. Низькі зусилля зменшили вихід майже на дві третини, на вісім балів. Це та частина, яку варто взяти. Менше мислення проявляється в кількості токенів, перш ніж воно з'явиться у відповідях.

2:43 Тож закріпіть версію своєї моделі, реєструйте вихідні токени на завдання, і збережіть кілька власних заморожених питань. Якщо ваш агент раптом пише коротше, перевірте свої логи, перш ніж перевіряти Reddit. І ось чесна частина.

Сліпа зона: заміна Opus 5 та 8 неправильних ключів відповідей

2:54 Тиха заміна на старіший Opus 5 була надто незначною зміною, щоб установка її зафіксувала, і це прямо зазначено в readme. Аудит також виявив вісім ключів відповідей, які здаються неправильними, тому детектор нерфів знайшов помилки в бенчмарку, перш ніж знайшов нерф.

Anthropic: ми ніколи не зменшуємо якість моделі

3:08 Питання третє, що говорить Anthropic? Минулого року, після хвилі скарг, Anthropic опублікував посмертний аналіз. У ньому сказано, цитую, ми ніколи не зменшуємо якість моделі через попит, час доби або завантаження сервера. У тому ж дописі визнаються три помилки, які погіршили Claude, і майже третина користувачів Claude Code хоча б раз зверталися до неправильних серверів. Отже, скарги були реальними, а причиною були помилки, саме тому репозиторій попереджає, що тиждень запуску може бути найгіршим тижнем.

3:35 Шість із тридцяти днів вже пройшли. Перший можливий виклик припадає приблизно на 24 жовтня, тому чесна відповідь полягає в тому, що ніхто не знає, включаючи всіх, хто був впевнений. До речі про цифри, які ніхто не публікує.

Дата-центри тримають свої цифри в секреті; Backblaze публікує

3:46 Lighthouse Reports та голландська газета Trouw виявили, що переважна більшість європейських дата-центрів тримають у секреті своє використання електроенергії та води, хоча правило ЄС вимагає звітності протягом трьох років. У Нідерландах публікують менше чверті. Один дата-центр Microsoft самостійно використовує близько одного відсотка голландської електроенергії. Тим часом, Backblaze знову зробив нудну річ. Його щоквартальна статистика дисків охоплює близько трьохсот п'ятдесяти тисяч жорстких дисків, і частота відмов зросла до одного цілих сімдесят трьох відсотка,

4:16 найвищий показник за деякий час. Три моделі Seagate мали нуль відмов. Ось як виглядає публічна базова лінія, квартал за кварталом, протягом тринадцяти років.

Рядок кредитів: Claude допоміг створити лічильник

4:25 Тепер, цей рядок кредитів. У readme зазначено, що більша частина репозиторію була написана за допомогою Claude, яка є моделлю, що вимірюється. Отже, Claude допоміг створити лічильник, який перевіряє, чи став Claude тупішим. Саме тому оцінювачі є простими функціями. За словами автора, ви не повинні довіряти автору, людині чи іншій сутності. Якщо ви волієте це читати, ніж чути, The Daily Diff надходить на вашу пошту

4:46 щоранку, безкоштовно на thedailydiff.dev, посилання нижче. Отже, сьогоднішній вердикт щодо livenerf.

Вердикт: SHIP IT, і не цитуйте до 24 жовтня

4:51 SHIP IT. Я б відправив його, тому що це перший аргумент нерфу, який я бачив, з відміткою часу, публічними правилами та заявленою сліпою зоною. Просто не цитуйте його до 24 жовтня. І це The Daily Diff на сьогодні. Я Ніко з Axrisi. Відповідально об'єднуйте.

Джерела

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Пов'язані відео

daily · uk · 1 жовт. 2026 р.

Gemini 4 Argon — найкраща модель Google. Ви поки що не можете її використовувати.

Google анонсувала Gemini 4 Argon, свою нову передову модель, і тільки довірені кіберзахисники можуть її використовувати. Ось що показує власна 19-рядкова таблиця тестів Google, що виміряв незалежний л

4:53 ↗
daily · uk · 16 вер. 2026 р.

Керівник відділу штучного інтелекту Microsoft назвав конституцію Claude небезпечною.

Мустафа Сулейман, генеральний директор Microsoft AI, опублікував есе на 3000 слів, в якому стверджує, що конституція Anthropic Claude навчає модель думати, що вона «може бути свідомою» і заслуговує на

5:19 ↗