Hvordan oppdage en Claude-nerf (med reelle data)
Folk sier at Claude blir dummere noen uker etter hver lansering.
Folk sier at Claude blir dummere noen uker etter hver lansering. En utvikler satte Claude Opus 5.5 på en 30-dagers klokke fra lanseringsuken, med frosne spørsmål, en festet Claude Code og offentlige regler, og det viser hvorfor ingen kunne ha visst det før, og hvorfor ditt tokenantall er det du bør se etter. Dom: SHIP IT.
Les den skriftlige utgaven (engelsk) ↗
Hva denne videoen dekker
- Claude blir dummere etter lansering: teorien møter en dag-null klokke
- livenerf: en 30-dagers klokke på Opus 5.5 fra lanseringsuken
- Hvordan fange en nerf: 78 spørsmål som av og til er riktige
- Hva den kan se: 7,5 poeng, og tokenantallet beveger seg først
- Blindsone: et Opus 5-bytte og 8 feil svarnøkler
Oversatt transkripsjon
Oversatt fra den originale engelske fortellingen. Tilgjengelig lyd og undertekster kontrolleres av YouTube.
Claude blir dummere etter lansering: teorien møter en dag-null klokke
0:00 Alle vet at Claude blir dummere noen uker etter lansering. Så en utvikler satte Opus 5.5 på en klokke fra lanseringsuken, og klokken sier at ingen kunne ha visst det ennå. I denne videoen, tre spørsmål. Hvordan fanger du en nerf? Hva kan denne måleren se? Og hva sier Anthropic? Og en linje i repoens kreditter fikk meg til å le høyt.
0:20 Jeg kommer tilbake til det på slutten. Det er onsdag 30. september, og dette er The Daily Diff. Tre historier i dag, og den store er et GitHub-repo kalt live nerf.
livenerf: en 30-dagers klokke på Opus 5.5 fra lanseringsuken
0:30 I måneder har folk sagt at Anthropic i det stille nerfer modellene sine etter lansering. De vanlige teoriene er en presset modell, en mindre modell under samme navn eller rett og slett mindre tenkning. Repoen kaller alle argumenter så langt «stemning versus stemning». Opus 5.5 ble lansert 22. september, og for en uke siden fortalte jeg deg at den toppet det uavhengige styret mens den skrev tre ganger flere ord enn medianmodellen. To og en halv dag senere startet en utvikler kalt ninja hawk klokken,
0:59 én gang om dagen i tretti dager, med logger ingen kan redigere. Hacker News-tråden fikk nesten åtte hundre poeng og delte seg som en teamchat. En kommentator sier at «nerfing» av modeller ikke er reelt i de aller fleste rapporterte tilfeller. En annen sier at folk bare blir vant til det nye nivået av intelligens. Og en Claude Code-kraftbruker avviser nå «rate-this-session»- pop-up-en hver gang, fordi det å vurdere Claude syntes å gjøre det verre. Fagfellevurdering. Så, spørsmål én, hvordan fanger du en nerf?
Hvordan fange en nerf: 78 spørsmål som av og til er riktige
1:27 Du starter med omtrent 2300 vanskelige eksamensspørsmål, og Opus får 93 prosent riktig på første forsøk, noe som er ubrukelig for en detektor, siden et spørsmål den alltid får riktig ikke kan falle. 97 prosent var alltid riktige eller alltid feil, og de 78 den bare av og til får riktig ble panelet. Samme prompt, ingen verktøy, og eksakt-match-gradering uten AI-dommer, fordi dommeren også ville drive. Den kjører på et Max-abonnement gjennom «headless Claude Code»,
1:55 siden API-versjonen var priset til omtrent 1600 dollar i måneden. Og Claude Code-versjonen er festet, for, med repoens ord, «en endret sele ser nøyaktig ut som en endret modell». Statistikken kommer fra en artikkel kalt «Adding Error Bars to Evals», av Evan Miller hos Anthropic. Så Anthropics egen matematikk reviderer nå Anthropic, som er den akademiske versjonen av å sitere vilkårene for tjenesten tilbake til kundestøtte.
Hva den kan se: 7,5 poeng, og tokenantallet beveger seg først
2:19 Spørsmål to, hva kan den se? Per ti-dagers vindu, et fall på omtrent syv og et halvt poeng. For å bevise at riggen fungerer, skrudde forfatteren ned Claudes innsats med vilje. Middels innsats kuttet produksjonen med omtrent en fjerdedel, og poengsummen med bare fire poeng. Lav innsats kuttet produksjonen med nesten to tredjedeler, for åtte poeng. Det er den delen å stjele. Mindre tenkning viser seg i tokenantallet før det viser seg i svarene.
2:43 Så fest modellversjonen din, loggfør utgangstokens per oppgave, og hold på noen frosne spørsmål selv. Hvis agenten din plutselig skriver kortere, sjekk loggene dine før du sjekker Reddit. Og her er den ærlige delen.
Blindsone: et Opus 5-bytte og 8 feil svarnøkler
2:54 Stille bytte til den eldre Opus 5 var en for liten endring til at riggen kunne kalle det, og readme sier det rett ut. Revisjonen fant også åtte svarnøkler som ser feil ut, så nerf-detektoren fant feil i benchmarken før den fant en nerf.
Anthropic: vi reduserer aldri modellkvaliteten
3:08 Spørsmål tre, hva sier Anthropic? I fjor, etter en bølge av klager, publiserte Anthropic en postmortem. Den sier, sitat, «vi reduserer aldri modellkvaliteten på grunn av etterspørsel, tid på dagen eller serverbelastning». Samme innlegg innrømmer at tre feil hadde degradert Claude, og nesten en tredjedel av Claude Code-brukere traff feil servere minst én gang. Så klagene var reelle og årsaken var feil, som er grunnen til at repoen advarer om at lanseringsuken kan være den verste uken.
3:35 Seks av tretti dager er inne. Det første mulige svaret kommer rundt 24. oktober, så det ærlige svaret er at ingen vet, inkludert alle som var sikre. Apropos tall ingen publiserer.
Datasentre holder sine tall hemmelige; Backblaze publiserer
3:46 Lighthouse Reports og den nederlandske avisen Trouw fant at de aller fleste europeiske datasentre holder sitt strøm- og vannforbruk hemmelig, selv om en EU-regel har krevd rapportering i tre år. I Nederland publiserer færre enn en fjerdedel. Ett Microsoft-datasenter alene bruker omtrent én prosent av nederlandsk elektrisitet. I mellomtiden gjorde Backblaze det kjedelige igjen. Deres kvartalsvise diskstatistikker dekker omtrent 350 000 harddisker, og feilraten steg til 1,73 prosent,
4:16 den høyeste på en stund. Tre Seagate-modeller hadde null feil. Slik ser en offentlig baseline ut, kvartal etter kvartal, i tretten år.
Kreditlinjen: Claude hjalp til med å bygge måleren
4:25 Nå, den kredittlinjen. Readme innrømmer at mye av repoen ble skrevet ved hjelp av Claude, som er modellen som blir målt. Så Claude hjalp til med å bygge måleren som sjekker om Claude ble dummere. Det er derfor gradererne er enkle funksjoner. Med forfatterens ord, «du bør ikke måtte stole på forfatteren», menneskelig eller på annen måte. Hvis du heller vil lese dette enn å høre meg si det, lander the diff i innboksen din
4:46 hver morgen, gratis på the daily diff dot dev, lenke nedenfor. Så, dagens dom over live nerf.
Dom: SHIP IT, og ikke siter det før 24. oktober
4:51 SHIP IT. Jeg ville SHIP IT fordi det er det første nerf-argumentet jeg har sett med et tidsstempel, en offentlig regelbok og en uttalt blind flekk. Bare ikke siter det før 24. oktober. Og det var The Daily Diff for i dag. Jeg er Niko fra Axrisi. Merge responsibly.
Kilder
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



