Hoe een Claude-nerf te detecteren (met echte data)
Mensen zeggen dat Claude een paar weken na elke lancering dommer wordt.
Mensen zeggen dat Claude een paar weken na elke lancering dommer wordt. Een ontwikkelaar zette Claude Opus 5.5 op een 30-dagen klok vanaf de lanceringsweek, met bevroren vragen, een gepinde Claude Code en openbare regels, en het laat zien waarom niemand het eerder had kunnen weten, en waarom je token count het ding is om in de gaten te houden. Oordeel: SHIP IT.
Lees de geschreven editie (Engels) ↗
Wat deze video behandelt
- Claude wordt dommer na lancering: de theorie ontmoet een dag-nul klok
- livenerf: een 30-dagen klok op Opus 5.5 vanaf de lanceringsweek
- Hoe een nerf te vangen: 78 soms-juiste vragen
- Wat het kan zien: 7.5 punten, en de token count beweegt als eerste
- De blinde vlek: een Opus 5 ruil en 8 foute antwoordsleutels
Vertaald transcript
Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.
Claude wordt dommer na lancering: de theorie ontmoet een dag-nul klok
0:00 Iedereen weet dat Claude een paar weken na de lancering dommer wordt. Dus zette een ontwikkelaar Opus vijf punt vijf op een klok vanaf de lanceringsweek, en de klok zegt dat niemand het nog had kunnen weten. In deze video, drie vragen. Hoe vang je een nerf? Wat kan deze meter zien? En wat zegt Anthropic? En één zin in de aftiteling van de repo deed me hardop lachen.
0:20 Daar kom ik aan het einde op terug. Het is woensdag 30 september, en dit is The Daily Diff. Drie verhalen vandaag, en de grootste is een GitHub-repo genaamd live nerf.
livenerf: een 30-dagen klok op Opus 5.5 vanaf de lanceringsweek
0:30 Maandenlang hebben mensen gezegd dat Anthropic zijn modellen stilletjes 'nerft' na de lancering. De gebruikelijke theorieën zijn een geknepen model, een kleiner model onder dezelfde naam of simpelweg minder denken. De repo noemt elk argument tot nu toe vibes versus vibes. Opus vijf punt vijf werd verzonden op tweeëntwintig september, en een week geleden vertelde ik je dat het de onafhankelijke lijst aanvoerde terwijl het drie keer meer woorden schreef dan het mediane model. Twee en een halve dag later startte een ontwikkelaar genaamd ninja hawk de klok,
0:59 één keer per dag gedurende dertig dagen, met logs die niemand mag bewerken. De Hacker News-thread behaalde bijna achthonderd punten en splitste zich als een team chat. Een commenter zegt dat 'nerfen' van modellen niet echt is in de overgrote meerderheid van gemelde gevallen. Een ander zegt dat mensen gewoon wennen aan het nieuwe niveau van intelligentie. En een Claude Code power user negeert nu de 'beoordeel-deze-sessie'- pop-up elke keer, omdat het beoordelen van Claude het erger leek te maken. Peer review. Dus, vraag één, hoe vang je een nerf?
Hoe een nerf te vangen: 78 soms-juiste vragen
1:27 Je begint met ongeveer drieëntwintighonderd moeilijke examenvragen, en Opus krijgt drieënnegentig procent de eerste keer goed, wat nutteloos is voor een detector, aangezien een vraag die het altijd goed krijgt niet kan dalen. Zevenennegentig procent was altijd goed of altijd fout, en de achtenzeventig die het soms goed krijgt, werden het panel. Dezelfde prompt, geen tools, en exacte-match beoordeling zonder AI-rechter, omdat de rechter ook zou driften. Het draait op een Max-abonnement via headless Claude Code,
1:55 aangezien de API-versie geprijsd was op ongeveer zestienhonderd dollar per maand. En de Claude Code-versie is gepind, want, in de woorden van de repo, een veranderd harnas ziet er precies uit als een veranderd model. De statistieken komen uit een paper genaamd 'Adding Error Bars to Evals', door Evan Miller bij Anthropic. Dus Anthropic's eigen wiskunde controleert nu Anthropic, wat de academische versie is van het citeren van de servicevoorwaarden terug naar de klantenservice.
Wat het kan zien: 7.5 punten, en de token count beweegt als eerste
2:19 Vraag twee, wat kan het zien? Per tien-dagen venster, een daling van ongeveer zeven en een half punt. Om te bewijzen dat de opstelling werkt, verlaagde de auteur Claude's inspanning opzettelijk. Medium inspanning verminderde de output met ongeveer een kwart, en de score met slechts vier punten. Lage inspanning verminderde de output met bijna twee derde, voor acht punten. Dat is het deel om te stelen. Minder denken komt naar voren in de token count voordat het naar voren komt in de antwoorden.
2:43 Dus pin je modelversie, log output tokens per taak, en bewaar een paar bevroren vragen van jezelf. Als je agent plotseling korter schrijft, controleer dan je logs voordat je Reddit controleert. En hier is het eerlijke deel.
De blinde vlek: een Opus 5 ruil en 8 foute antwoordsleutels
2:54 Het stilletjes wisselen naar de oudere Opus vijf was een te kleine verandering voor de opstelling om te roepen, en de readme zegt dat van tevoren. De audit vond ook acht antwoordsleutels die er fout uitzien, dus de nerfdetector vond bugs in de benchmark voordat het een nerf vond.
Anthropic: we verminderen de modelkwaliteit nooit
3:08 Vraag drie, wat zegt Anthropic? Vorig jaar, na een golf van klachten, publiceerde Anthropic een postmortem. Het zegt, quote, we verminderen de modelkwaliteit nooit vanwege vraag, tijd van de dag of serverbelasting. Hetzelfde bericht geeft toe dat drie bugs Claude hadden verslechterd, en bijna een derde van Claude Code-gebruikers kwamen minstens één keer op de verkeerde servers terecht. Dus de klachten waren echt en de oorzaak waren bugs, daarom waarschuwt de repo dat de lanceringsweek de slechtste week zou kunnen zijn.
3:35 Zes van de dertig dagen zijn voorbij. De eerste mogelijke oproep landt rond vierentwintig oktober, dus het eerlijke antwoord is dat niemand het weet, inclusief iedereen die zeker was. Over getallen gesproken die niemand publiceert.
Datacenters houden hun cijfers geheim; Backblaze publiceert
3:46 Lighthouse Reports en de Nederlandse krant Trouw ontdekten dat de overgrote meerderheid van Europese datacenters hun energie- en waterverbruik geheim houden, hoewel een EU-regel al drie jaar rapportage vereist. In Nederland publiceert minder dan een kwart. Eén Microsoft-datacenter alleen al gebruikt ongeveer één procent van de Nederlandse elektriciteit. Ondertussen deed Backblaze weer het saaie ding. De driemaandelijkse drive statistieken omvatten ongeveer driehonderdvijftigduizend harde schijven, en het uitvalpercentage steeg naar één punt drieënzeventig procent,
4:16 het hoogste in een tijdje. Drie Seagate-modellen hadden nul storingen. Zo ziet een openbare baseline eruit, kwartaal na kwartaal, dertien jaar lang.
De aftiteling: Claude hielp de meter te bouwen
4:25 Nu, die aftiteling. De readme geeft toe dat veel van de repo is geschreven met behulp van Claude, wat het model is dat wordt gemeten. Dus Claude hielp de meter te bouwen die controleert of Claude dommer is geworden. Daarom zijn de beoordelaars eenvoudige functies. In de woorden van de auteur, je hoeft de auteur niet te vertrouwen, menselijk of anderszins. Als je dit liever leest dan mij het hoort zeggen, de diff landt elke ochtend in je inbox,
4:46 gratis op the daily diff dot dev, link hieronder. Dus, het oordeel van vandaag over live nerf.
Oordeel: SHIP IT, en citeer het niet voor 24 oktober
4:51 SHIP IT. Ik zou het verzenden omdat het het eerste nerf-argument is dat ik heb gezien met een tijdstempel, een openbaar regelboek en een vermelde blinde vlek. Citeer het alleen niet voor vierentwintig oktober. En dat is de diff voor vandaag. Ik ben Niko van Axrisi. Verantwoord samenvoegen.
Bronnen
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



