+− THE DAILY DIFFdev & AI news
SHIP IT

Como detetar um nerf do Claude (com dados reais)

As pessoas dizem que o Claude fica mais burro algumas semanas após cada lançamento.

As pessoas dizem que o Claude fica mais burro algumas semanas após cada lançamento. Um programador colocou o Claude Opus 5.5 num relógio de 30 dias a partir da semana de lançamento, com perguntas "congeladas", um Claude Code "fixado" e regras públicas, e isto mostra porque ninguém poderia ter sabido antes, e porque a sua contagem de tokens é o que deve ser observado. Veredito: SHIP IT.

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Claude fica mais burro após o lançamento: a teoria encontra um relógio de dia zero
  • livenerf: um relógio de 30 dias no Opus 5.5 a partir da semana de lançamento
  • Como detetar um nerf: 78 perguntas "às vezes certas"
  • O que pode ver: 7,5 pontos, e a contagem de tokens move-se primeiro
  • O ponto cego: uma troca do Opus 5 e 8 chaves de resposta erradas

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

Claude fica mais burro após o lançamento: a teoria encontra um relógio de dia zero

0:00 Todos sabem que o Claude fica mais burro algumas semanas após o lançamento. Então, um programador colocou o Opus 5.5 num relógio a partir da semana de lançamento, e o relógio diz que ninguém poderia ter sabido ainda. Neste vídeo, três perguntas. Como se deteta um nerf? O que pode este medidor ver? E o que diz a Anthropic? E uma linha nos créditos do repositório fez-me rir às gargalhadas.

0:20 Chegarei a isso no final. É quarta-feira, 30 de setembro, e este é o The Daily Diff. Três histórias hoje, e a grande é um repositório GitHub chamado livenerf.

livenerf: um relógio de 30 dias no Opus 5.5 a partir da semana de lançamento

0:30 Durante meses, as pessoas têm dito que a Anthropic secretamente aplica nerfs aos seus modelos após o lançamento. As teorias habituais são um modelo "apertado", um modelo menor com o mesmo nome ou simplesmente menos "pensamento". O repositório chama a cada argumento até agora "vibes versus vibes". O Opus 5.5 foi lançado em 22 de setembro, e há uma semana eu disse-vos que ele liderava o painel independente enquanto escrevia três vezes mais palavras do que o modelo médio. Dois dias e meio depois, um programador chamado ninja hawk iniciou o relógio,

0:59 uma vez por dia durante trinta dias, com registos que ninguém pode editar. A discussão no Hacker News atingiu quase oitocentos pontos e dividiu-se como um chat de equipa. Um comentador diz que "nerfar" modelos não é real na vasta maioria dos casos relatados. Outro diz que as pessoas estão apenas a habituar-se ao novo nível de inteligência. E um utilizador avançado do Claude Code agora ignora o pop-up "avaliar esta sessão" sempre, porque classificar o Claude parecia piorá-lo. Revisão por pares. Então, pergunta um, como se deteta um nerf?

Como detetar um nerf: 78 perguntas "às vezes certas"

1:27 Começa com cerca de dois mil e trezentas perguntas difíceis de exame, e o Opus acerta 93% na primeira tentativa, o que é inútil para um detetor, uma vez que uma pergunta que ele sempre acerta não pode cair. Noventa e sete por cento estavam sempre certas ou sempre erradas, e as 78 que ele só às vezes acerta tornaram-se o painel. Mesma "prompt", sem ferramentas, e avaliação de correspondência exata sem juiz de IA, porque o juiz também "derraparia". Funciona com uma subscrição Max através de um Claude Code "headless",

1:55 uma vez que a versão da API custava cerca de mil e seiscentos dólares por mês. E a versão do Claude Code está "fixada", porque, nas palavras do repositório, um "arnês" alterado parece exatamente um modelo alterado. As estatísticas vêm de um artigo chamado "Adicionando Barras de Erro a Evals", por Evan Miller da Anthropic. Então, a própria matemática da Anthropic está agora a auditar a Anthropic, o que é a versão académica de citar os termos de serviço de volta ao apoio ao cliente.

O que pode ver: 7,5 pontos, e a contagem de tokens move-se primeiro

2:19 Pergunta dois, o que pode ver? Por janela de dez dias, uma queda de cerca de sete e meio pontos. Para provar que o "rig" funciona, o autor reduziu o esforço do Claude de propósito. Esforço médio cortou a saída em cerca de um quarto, e a pontuação em apenas quatro pontos. Baixo esforço cortou a saída em quase dois terços, para oito pontos. Essa é a parte a roubar. Menos "pensamento" aparece na contagem de tokens antes de aparecer nas respostas.

2:43 Então, "fixe" a sua versão do modelo, registe os tokens de saída por tarefa, e mantenha algumas perguntas "congeladas" suas. Se o seu agente de repente escreve menos, verifique os seus registos antes de verificar o Reddit. E aqui está a parte honesta.

O ponto cego: uma troca do Opus 5 e 8 chaves de resposta erradas

2:54 A troca silenciosa para o Opus 5 mais antigo foi uma mudança pequena demais para o "rig" detetar, e o "readme" diz isso logo de início. A auditoria também encontrou oito chaves de resposta que parecem erradas, então o detetor de "nerf" encontrou "bugs" no "benchmark" antes de encontrar um "nerf".

Anthropic: nunca reduzimos a qualidade do modelo

3:08 Pergunta três, o que diz a Anthropic? No ano passado, após uma onda de queixas, a Anthropic publicou uma "post-mortem". Diz, citação, nunca reduzimos a qualidade do modelo devido à procura, hora do dia ou carga do servidor. A mesma publicação admite que três "bugs" tinham degradado o Claude, e quase um terço dos utilizadores do Claude Code atingiram os servidores errados pelo menos uma vez. Então as queixas eram reais e a causa eram os "bugs", razão pela qual o repositório avisa que a semana de lançamento poderia ser a pior semana.

3:35 Seis de trinta dias já decorreram. A primeira possível "chamada" ocorre por volta de 24 de outubro, então a resposta honesta é que ninguém sabe, incluindo todos os que tinham a certeza. Falando de números que ninguém publica.

Os centros de dados mantêm os seus números em segredo; a Backblaze publica

3:46 A Lighthouse Reports e o jornal holandês Trouw descobriram que a vasta maioria dos centros de dados europeus mantêm o seu consumo de energia e água em segredo, embora uma regra da UE exija relatórios há três anos. Na Holanda, menos de um quarto publica. Um centro de dados da Microsoft sozinho usa cerca de um por cento da eletricidade holandesa. Entretanto, a Backblaze fez a coisa "chata" novamente. As suas estatísticas trimestrais de "drives" cobrem cerca de trezentos e cinquenta mil discos rígidos, e a taxa de falha subiu para 1,73%,

4:16 a mais alta em algum tempo. Três modelos Seagate tiveram zero falhas. É assim que é uma linha de base pública, trimestre após trimestre, durante treze anos.

A linha de créditos: Claude ajudou a construir o medidor

4:25 Agora, essa linha de créditos. O "readme" admite que grande parte do repositório foi escrita com a ajuda do Claude, que é o modelo que está a ser medido. Então, o Claude ajudou a construir o medidor que verifica se o Claude ficou mais burro. É por isso que os avaliadores são funções simples. Nas palavras do autor, não se deve ter que confiar no autor, humano ou não. Se preferir ler isto a ouvir-me dizer, o "diff" chega à sua caixa de entrada

4:46 todas as manhãs, gratuitamente em thedailydiff.dev, link abaixo. Então, o veredito de hoje sobre o "livenerf".

Veredito: SHIP IT, e não cite antes de 24 de outubro

4:51 SHIP IT. Eu "shipparia" porque é o primeiro argumento de "nerf" que vi com um carimbo de data/hora, um livro de regras público e um ponto cego declarado. Só não o cite antes de 24 de outubro. E essa é a "diff" de hoje. Eu sou o Niko da Axrisi. Faça a fusão responsavelmente.

Fontes

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Vídeos relacionados