+− THE DAILY DIFFdev & AI news
SHIP IT

Como detectar um nerf do Claude (com dados reais)

As pessoas dizem que Claude fica mais burro algumas semanas após cada lançamento.

As pessoas dizem que Claude fica mais burro algumas semanas após cada lançamento. Um desenvolvedor colocou Claude Opus 5.5 em um relógio de 30 dias a partir da semana de lançamento, com perguntas congeladas, um Claude Code fixo e regras públicas, e isso mostra por que ninguém poderia ter sabido antes, e por que sua contagem de tokens é o que você deve observar. Veredito: SHIP IT.

Leia a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Claude fica mais burro após o lançamento: a teoria encontra um relógio do dia zero
  • livenerf: um relógio de 30 dias no Opus 5.5 a partir da semana de lançamento
  • Como pegar um nerf: 78 perguntas às vezes certas
  • O que ele pode ver: 7,5 pontos, e a contagem de tokens se move primeiro
  • O ponto cego: uma troca do Opus 5 e 8 chaves de resposta erradas

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

Claude fica mais burro após o lançamento: a teoria encontra um relógio do dia zero

0:00 Todo mundo sabe que Claude fica mais burro algumas semanas após o lançamento. Então, um desenvolvedor colocou o Opus cinco ponto cinco em um relógio a partir da semana de lançamento, e o relógio diz que ninguém poderia ter sabido ainda. Neste vídeo, três perguntas. Como você pega um nerf? O que este medidor pode ver? E o que a Anthropic diz? E uma linha nos créditos do repositório me fez rir alto.

0:20 Chegarei a isso no final. É quarta-feira, trinta de setembro, e este é The Daily Diff. Três histórias hoje, e a grande é um repositório GitHub chamado live nerf.

livenerf: um relógio de 30 dias no Opus 5.5 a partir da semana de lançamento

0:30 Por meses, as pessoas disseram que a Anthropic secretamente nerfa seus modelos após o lançamento. As teorias usuais são um modelo comprimido, um modelo menor com o mesmo nome ou simplesmente menos pensamento. O repositório chama cada argumento até agora de vibes versus vibes. O Opus cinco ponto cinco foi lançado em vinte e dois de setembro, e uma semana atrás eu disse que ele liderou a tabela independente enquanto escrevia três vezes mais palavras do que o modelo mediano. Dois dias e meio depois, um desenvolvedor chamado ninja hawk iniciou o relógio,

0:59 uma vez por dia durante trinta dias, com registros que ninguém pode editar. O tópico do Hacker News atingiu quase oitocentos pontos e se dividiu como um bate-papo em equipe. Um comentarista diz que nerfar modelos não é real na grande maioria dos casos relatados. Outro diz que as pessoas estão apenas se acostumando com o novo nível de inteligência. E um usuário avançado do Claude Code agora ignora o pop-up de avaliar esta sessão toda vez, porque avaliar Claude parecia piorá-lo. Revisão por pares. Então, pergunta um, como você pega um nerf?

Como pegar um nerf: 78 perguntas às vezes certas

1:27 Você começa com cerca de dois mil e trezentas questões difíceis de exames, e o Opus acerta noventa e três por cento na primeira tentativa, o que é inútil para um detector, já que uma pergunta que ele sempre acerta não pode cair. Noventa e sete por cento estavam sempre certos ou sempre errados, e os setenta e oito que ele só às vezes acerta se tornaram o painel. Mesmo prompt, sem ferramentas, e avaliação de correspondência exata sem juiz de IA, porque o juiz também se desviaria. Ele roda em uma assinatura Max através do Claude Code sem cabeça,

1:55 já que a versão da API tinha um preço de cerca de mil e seiscentos dólares por mês. E a versão do Claude Code está fixada, porque, nas palavras do repositório, um harness alterado parece exatamente como um modelo alterado. As estatísticas vêm de um artigo chamado Adding Error Bars to Evals, de Evan Miller da Anthropic. Então a própria matemática da Anthropic está agora auditando a Anthropic, que é a versão acadêmica de citar os termos de serviço de volta para o suporte ao cliente.

O que ele pode ver: 7,5 pontos, e a contagem de tokens se move primeiro

2:19 Pergunta dois, o que ele pode ver? Por janela de dez dias, uma queda de cerca de sete pontos e meio. Para provar que o aparelho funciona, o autor reduziu o esforço de Claude de propósito. Esforço médio cortou a saída em cerca de um quarto, e a pontuação em apenas quatro pontos. Esforço baixo cortou a saída em quase dois terços, para oito pontos. Essa é a parte a ser roubada. Menos pensamento aparece na contagem de tokens antes de aparecer nas respostas.

2:43 Então fixe sua versão do modelo, registre os tokens de saída por tarefa, e mantenha algumas perguntas congeladas suas. Se seu agente de repente escreve mais curto, verifique seus registros antes de verificar o Reddit. E aqui está a parte honesta.

O ponto cego: uma troca do Opus 5 e 8 chaves de resposta erradas

2:54 Trocar silenciosamente pelo Opus cinco mais antigo foi uma mudança muito pequena para o aparelho detectar, e o readme diz isso de antemão. A auditoria também encontrou oito chaves de resposta que parecem erradas, então o detector de nerf encontrou bugs no benchmark antes de encontrar um nerf.

Anthropic: nunca reduzimos a qualidade do modelo

3:08 Pergunta três, o que a Anthropic diz? No ano passado, após uma onda de reclamações, a Anthropic publicou uma análise pós-morte. Ela diz, cito, nunca reduzimos a qualidade do modelo devido à demanda, hora do dia ou carga do servidor. A mesma postagem admite que três bugs degradaram Claude, e quase um terço dos usuários do Claude Code atingiram os servidores errados pelo menos uma vez. Então as reclamações eram reais e a causa eram bugs, razão pela qual o repositório alerta que a semana de lançamento poderia ser a pior semana.

3:35 Seis dos trinta dias se passaram. A primeira possível chamada ocorre por volta de vinte e quatro de outubro, então a resposta honesta é que ninguém sabe, incluindo todos que tinham certeza. Falando em números que ninguém publica.

Centros de dados mantêm seus números em segredo; Backblaze publica

3:46 A Lighthouse Reports e o jornal holandês Trouw descobriram que a grande maioria dos centros de dados europeus mantêm seu consumo de energia e água em segredo, embora uma regra da UE exija relatórios há três anos. Na Holanda, menos de um quarto publica. Um único centro de dados da Microsoft usa cerca de um por cento da eletricidade holandesa. Enquanto isso, a Backblaze fez a coisa chata novamente. Suas estatísticas trimestrais de drives cobrem cerca de trezentos e cinquenta mil discos rígidos, e a taxa de falha subiu para um ponto setenta e três por cento,

4:16 a mais alta em um tempo. Três modelos Seagate tiveram zero falhas. É assim que uma linha de base pública se parece, trimestre após trimestre, por treze anos.

A linha de créditos: Claude ajudou a construir o medidor

4:25 Agora, essa linha de créditos. O readme admite que grande parte do repositório foi escrita com a ajuda de Claude, que é o modelo que está sendo medido. Então Claude ajudou a construir o medidor que verifica se Claude ficou mais burro. É por isso que os avaliadores são funções simples. Nas palavras do autor, você não deveria ter que confiar no autor, humano ou de outra forma. Se você preferir ler isso a me ouvir dizer, o diff chega à sua caixa de entrada

4:46 todas as manhãs, gratuitamente em the daily diff dot dev, link abaixo. Então, o veredito de hoje sobre live nerf.

Veredito: SHIP IT, e não cite antes de 24 de outubro

4:51 SHIP IT. Eu o enviaria porque é o primeiro argumento de nerf que vi com um carimbo de data/hora, um livro de regras público e um ponto cego declarado. Apenas não o cite antes de vinte e quatro de outubro. E essa é a diferença de hoje. Sou Niko da Axrisi. Mesclar com responsabilidade.

Fontes

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Vídeos relacionados