+− THE DAILY DIFFdev & AI news
SHIP IT

Как обнаружить «нерф» Claude (с реальными данными)

Люди говорят, что Claude становится глупее через несколько недель после каждого запуска.

Люди говорят, что Claude становится глупее через несколько недель после каждого запуска. Один разработчик запустил Claude Opus 5.5 с 30-дневным отсчетом с момента запуска, с замороженными вопросами, закрепленным Claude Code и публичными правилами, и это показывает, почему никто не мог знать раньше, и почему количество ваших токенов — это то, за чем стоит следить. Вердикт: SHIP IT.

Читать письменное издание (на английском) ↗

Что освещается в этом видео

  • Claude становится глупее после запуска: теория встречается с отсчетом с нулевого дня
  • livenerf: 30-дневный отсчет для Opus 5.5 с недели запуска
  • Как поймать «нерф»: 78 иногда правильных вопросов
  • Что он может видеть: 7,5 баллов, и количество токенов движется первым
  • Слепое пятно: замена Opus 5 и 8 неправильных ключей ответов

Переведенная стенограмма

Переведено с оригинального английского повествования. Доступные аудио и субтитры контролируются YouTube.

Claude становится глупее после запуска: теория встречается с отсчетом с нулевого дня

0:00 Все знают, что Claude становится глупее через несколько недель после запуска. Поэтому один разработчик запустил Opus 5.5 с отсчетом с недели запуска, и этот отсчет показывает, что никто не мог знать раньше. В этом видео — три вопроса. Как поймать «нерф»? Что может видеть этот измеритель? И что говорит Anthropic? И одна строка в благодарностях репозитория заставила меня громко рассмеяться.

0:20 Я дойду до этого в конце. Сегодня среда, тридцатое сентября, и это The Daily Diff. Три истории сегодня, и самая большая — это репозиторий на GitHub под названием livenerf.

livenerf: 30-дневный отсчет для Opus 5.5 с недели запуска

0:30 Месяцами люди говорили, что Anthropic тихо «нерфит» свои модели после запуска. Обычные теории — это сжатая модель, меньшая модель под тем же названием или просто меньше «думания». Репозиторий называет каждый аргумент до сих пор «вайбами против вайбов». Opus 5.5 был выпущен двадцать второго сентября, и неделю назад я сказал вам, что он возглавил независимую таблицу, написав в три раза больше слов, чем средняя модель. Через два с половиной дня разработчик под ником ninjahawk запустил отсчет,

0:59 раз в день в течение тридцати дней, с логами, которые никто не может редактировать. Ветка на Hacker News набрала почти восемьсот очков и разделилась, как командный чат. Один комментатор говорит, что «нерфинг» моделей нереален в подавляющем большинстве сообщаемых случаев. Другой говорит, что люди просто привыкают к новому уровню интеллекта. И один опытный пользователь Claude Code теперь каждый раз отключает всплывающее окно «оцените эту сессию», потому что оценка Claude, казалось, ухудшала его работу. Рецензирование. Итак, вопрос первый: как поймать «нерф»?

Как поймать «нерф»: 78 иногда правильных вопросов

1:27 Вы начинаете примерно с двух тысяч трехсот сложных экзаменационных вопросов, и Opus с первого раза дает девяносто три процента правильных ответов, что бесполезно для детектора, так как вопрос, на который он всегда дает правильный ответ, не может упасть. Девяносто семь процентов были всегда правильными или всегда неправильными, и семьдесят восемь, на которые он лишь иногда дает правильные ответы, стали панелью. Тот же промпт, без инструментов, и точная оценка соответствия без ИИ-судьи, потому что судья тоже мог бы «дрейфовать». Он работает по подписке Max через headless Claude Code,

1:55 поскольку версия API стоила около шестнадцати сотен долларов в месяц. И версия Claude Code закреплена, потому что, по словам репозитория, измененный фреймворк выглядит точно так же, как измененная модель. Статистика взята из статьи под названием «Добавление полос ошибок к оценкам», Эвана Миллера из Anthropic. Так что собственная математика Anthropic теперь проверяет Anthropic, что является академической версией цитирования условий обслуживания в ответ службе поддержки клиентов.

Что он может видеть: 7,5 баллов, и количество токенов движется первым

2:19 Вопрос второй: что он может видеть? За каждые десятидневное окно — падение примерно на семь с половиной баллов. Чтобы доказать работоспособность установки, автор намеренно снизил усилия Claude. Средние усилия сократили выходной результат примерно на четверть, а оценку — всего на четыре балла. Низкие усилия сократили выходной результат почти на две трети, на восемь баллов. Это та часть, которую стоит украсть. Меньшее «думание» проявляется в количестве токенов раньше, чем в ответах.

2:43 Так что закрепите версию вашей модели, логируйте выходные токены на задачу, и сохраните несколько своих замороженных вопросов. Если ваш агент внезапно стал писать короче, проверьте логи, прежде чем проверять Reddit. И вот честная часть.

Слепое пятно: замена Opus 5 и 8 неправильных ключей ответов

2:54 Тихая замена на более старый Opus 5 была слишком незначительным изменением для обнаружения установкой, и это прямо указано в readme. Аудит также выявил восемь ключей ответов, которые выглядят неверными, так что детектор «нерфов» обнаружил ошибки в бенчмарке раньше, чем обнаружил «нерф».

Anthropic: мы никогда не снижаем качество модели

3:08 Вопрос третий: что говорит Anthropic? В прошлом году, после волны жалоб, Anthropic опубликовал постмортем. В нем говорится, цитирую: «Мы никогда не снижаем качество модели из-за спроса, времени суток или нагрузки на сервер». В том же посте признаются три ошибки, которые ухудшили работу Claude, и почти треть пользователей Claude Code хотя бы раз попадали на неправильные серверы. Так что жалобы были реальными, а причиной были ошибки, поэтому репозиторий предупреждает, что неделя запуска может быть худшей неделей.

3:35 Прошло шесть из тридцати дней. Первый возможный звонок приходится примерно на двадцать четвертое октября, так что честный ответ: никто не знает, включая всех, кто был уверен. Кстати о числах, которые никто не публикует.

ЦОДы держат свои цифры в секрете; Backblaze публикует

3:46 Lighthouse Reports и голландская газета Trouw обнаружили, что подавляющее большинство европейских центров обработки данных держат свое энерго- и водопотребление в секрете, хотя правило ЕС требует отчетности уже три года. В Нидерландах публикуют данные менее четверти. Один центр обработки данных Microsoft потребляет около одного процента всей электроэнергии Нидерландов. Тем временем Backblaze снова сделал скучную вещь. Их квартальная статистика по дискам охватывает около трехсот пятидесяти тысяч жестких дисков, и процент отказов вырос до одной целой семидесяти трех сотых процента,

4:16 самый высокий за последнее время. Три модели Seagate имели нулевые отказы. Вот как выглядит публичная база, квартал за кварталом, в течение тринадцати лет.

Строка благодарностей: Claude помог создать измеритель

4:25 Теперь, эта строка благодарностей. В readme признается, что большая часть репозитория была написана с помощью Claude, то есть модели, которая измеряется. Так что Claude помог создать измеритель, который проверяет, стал ли Claude глупее. Вот почему градеры — это простые функции. По словам автора, «вы не должны доверять автору», человеку или кому-либо еще. Если вы предпочитаете читать это, а не слушать, The Daily Diff приходит на вашу почту

4:46 каждое утро, бесплатно на the daily diff dot dev, ссылка ниже. Итак, сегодняшний вердикт по livenerf.

Вердикт: SHIP IT, и не цитируйте до 24 октября

4:51 SHIP IT. Я бы одобрил это, потому что это первый аргумент о «нерфе», который я видел, с временной меткой, публичным сводом правил и заявленным слепым пятном. Просто не цитируйте это до двадцать четвертого октября. И это The Daily Diff на сегодня. Я Нико из Axrisi. Объединяйте ответственно.

Источники

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Похожие видео

daily · ru · 1 окт. 2026 г.

Gemini 4 Argon — лучшая модель Google. Вы пока не можете ею пользоваться.

Google анонсировал Gemini 4 Argon, свою новую модель-первооткрывателя, и только проверенные киберзащитники могут ею пользоваться. Вот что показывает собственная 19-строчная таблица бенчмарков Google,

4:53 ↗