Comment détecter un "nerf" de Claude (avec des données réelles)
Les gens disent que Claude devient plus bête quelques semaines après chaque lancement.
Les gens disent que Claude devient plus bête quelques semaines après chaque lancement. Un développeur a mis Claude Opus 5.5 sous surveillance pendant 30 jours à partir de la semaine de lancement, avec des questions figées, un Claude Code épinglé et des règles publiques, et cela montre pourquoi personne n'aurait pu le savoir avant, et pourquoi le nombre de vos jetons est la chose à surveiller. Verdict : SHIP IT.
Lire l'édition écrite (anglais) ↗
Ce que couvre cette vidéo
- Claude devient plus bête après le lancement : la théorie rencontre une horloge "jour zéro"
- livenerf : une horloge de 30 jours sur Opus 5.5 à partir de la semaine de lancement
- Comment attraper un "nerf" : 78 questions parfois justes
- Ce qu'il peut voir : 7,5 points, et le nombre de jetons bouge en premier
- L'angle mort : un échange d'Opus 5 et 8 mauvaises clés de réponse
Transcription traduite
Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont gérés par YouTube.
Claude devient plus bête après le lancement : la théorie rencontre une horloge "jour zéro"
0:00 Tout le monde sait que Claude devient plus bête quelques semaines après son lancement. Alors un développeur a mis Opus cinq point cinq sous surveillance à partir de la semaine de lancement, et l'horloge indique que personne n'aurait pu le savoir encore. Dans cette vidéo, trois questions. Comment attraper un "nerf" ? Que peut voir ce compteur ? Et que dit Anthropic ? Et une ligne dans les crédits du dépôt m'a fait rire aux éclats.
0:20 J'y reviendrai à la fin. Nous sommes mercredi 30 septembre, et voici The Daily Diff. Trois histoires aujourd'hui, et la grande est un dépôt GitHub appelé live nerf.
livenerf : une horloge de 30 jours sur Opus 5.5 à partir de la semaine de lancement
0:30 Depuis des mois, les gens disent qu'Anthropic "nerfe" discrètement ses modèles après le lancement. Les théories habituelles sont un modèle compressé, un modèle plus petit sous le même nom ou simplement moins de réflexion. Le dépôt qualifie chaque argument jusqu'à présent de "vibes contre vibes". Opus cinq point cinq a été lancé le 22 septembre, et il y a une semaine, je vous ai dit qu'il dominait le classement indépendant tout en écrivant trois fois plus de mots que le modèle médian. Deux jours et demi plus tard, un développeur appelé ninja hawk a lancé le chronomètre,
0:59 une fois par jour pendant trente jours, avec des journaux que personne ne peut modifier. Le fil Hacker News a atteint près de huit cents points et s'est divisé comme un chat d'équipe. Un commentateur dit que le "nerf" des modèles n'est pas réel dans la grande majorité des cas signalés. Un autre dit que les gens s'habituent simplement au nouveau niveau d'intelligence. Et un utilisateur expérimenté de Claude Code ignore maintenant la fenêtre contextuelle "évaluer cette session" à chaque fois, car évaluer Claude semblait le rendre pire. Évaluation par les pairs. Alors, première question, comment attraper un "nerf" ?
Comment attraper un "nerf" : 78 questions parfois justes
1:27 Vous commencez avec environ deux mille trois cents questions d'examen difficiles, et Opus obtient quatre-vingt-treize pour cent de bonnes réponses du premier coup, ce qui est inutile pour un détecteur, car une question à laquelle il répond toujours correctement ne peut pas baisser. Quatre-vingt-dix-sept pour cent étaient toujours bonnes ou toujours fausses, et les soixante-dix-huit qu'il ne réussit que parfois sont devenues le panel. Même prompt, pas d'outils, et une notation par correspondance exacte sans juge IA, car le juge dériverait aussi. Il fonctionne sur un abonnement Max via Claude Code sans tête,
1:55 car la version API était tarifée à environ mille six cents dollars par mois. Et la version de Claude Code est épinglée, car, selon les mots du dépôt, un harnais modifié ressemble exactement à un modèle modifié. Les statistiques proviennent d'un article intitulé "Ajouter des barres d'erreur aux évaluations", par Evan Miller chez Anthropic. Ainsi, les propres calculs d'Anthropic auditent maintenant Anthropic, ce qui est la version académique de citer les conditions de service au support client.
Ce qu'il peut voir : 7,5 points, et le nombre de jetons bouge en premier
2:19 Deuxième question, que peut-il voir ? Par fenêtre de dix jours, une baisse d'environ sept points et demi. Pour prouver que le dispositif fonctionne, l'auteur a volontairement réduit l'effort de Claude. Un effort moyen a réduit la production d'environ un quart, et le score de seulement quatre points. Un faible effort a réduit la production de presque deux tiers, pour huit points. C'est la partie à voler. Moins de réflexion apparaît dans le nombre de jetons avant d'apparaître dans les réponses.
2:43 Alors épinglez la version de votre modèle, enregistrez les jetons de sortie par tâche, et gardez quelques-unes de vos propres questions figées. Si votre agent écrit soudainement plus court, vérifiez vos journaux avant de vérifier Reddit. Et voici la partie honnête.
L'angle mort : un échange d'Opus 5 et 8 mauvaises clés de réponse
2:54 Échanger discrètement l'ancien Opus cinq était un changement trop minime pour que le dispositif puisse le signaler, et le readme le dit d'emblée. L'audit a également trouvé huit clés de réponse qui semblent fausses, donc le détecteur de "nerf" a trouvé des bugs dans le benchmark avant de trouver un "nerf".
Anthropic : nous ne réduisons jamais la qualité du modèle
3:08 Troisième question, que dit Anthropic ? L'année dernière, après une vague de plaintes, Anthropic a publié un postmortem. Il dit, je cite, nous ne réduisons jamais la qualité du modèle en raison de la demande, de l'heure de la journée ou de la charge du serveur. Le même article admet que trois bugs avaient dégradé Claude, et près d'un tiers des utilisateurs de Claude Code ont atteint les mauvais serveurs au moins une fois. Donc les plaintes étaient réelles et la cause était des bugs, ce qui explique pourquoi le dépôt avertit que la semaine de lancement pourrait être la pire semaine.
3:35 Six des trente jours sont passés. Le premier appel possible aura lieu vers le 24 octobre, donc la réponse honnête est que personne ne sait, y compris tous ceux qui en étaient sûrs. En parlant de chiffres que personne ne publie.
Les centres de données gardent leurs chiffres secrets ; Backblaze publie
3:46 Lighthouse Reports et le journal néerlandais Trouw ont constaté que la grande majorité des centres de données européens gardent secrets leur consommation d'énergie et d'eau, bien qu'une règle de l'UE exige une déclaration depuis trois ans. Aux Pays-Bas, moins d'un quart publient. Un seul centre de données Microsoft utilise environ un pour cent de l'électricité néerlandaise. Pendant ce temps, Backblaze a refait le truc ennuyeux. Ses statistiques trimestrielles sur les disques couvrent environ trois cent cinquante mille disques durs, et le taux de défaillance a augmenté à un virgule soixante-treize pour cent,
4:16 le plus élevé depuis un certain temps. Trois modèles Seagate n'ont eu aucune défaillance. Voilà à quoi ressemble une ligne de base publique, trimestre après trimestre, pendant treize ans.
La ligne de crédits : Claude a aidé à construire le compteur
4:25 Maintenant, cette ligne de crédits. Le readme admet qu'une grande partie du dépôt a été écrite avec l'aide de Claude, qui est le modèle mesuré. Donc Claude a aidé à construire le compteur qui vérifie si Claude est devenu plus bête. C'est pourquoi les évaluateurs sont de simples fonctions. Selon les mots de l'auteur, vous ne devriez pas avoir à faire confiance à l'auteur, humain ou autre. Si vous préférez lire ceci plutôt que de m'entendre le dire, le diff arrive dans votre boîte de réception
4:46 tous les matins, gratuitement sur the daily diff point dev, lien ci-dessous. Alors, le verdict d'aujourd'hui sur live nerf.
Verdict : SHIP IT, et ne le citez pas avant le 24 octobre
4:51 SHIP IT. Je l'expédierais car c'est le premier argument de "nerf" que j'ai vu avec un horodatage, un règlement public et un angle mort déclaré. Ne le citez pas avant le 24 octobre. Et c'est le diff pour aujourd'hui. Je suis Niko d'Axrisi. Fusionnez de manière responsable.
Sources
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



