+− THE DAILY DIFFdev & AI news
SHIP IT

Comment détecter un "nerf" de Claude (avec des données réelles)

Les gens disent que Claude devient moins intelligent quelques semaines après chaque lancement.

Les gens disent que Claude devient moins intelligent quelques semaines après chaque lancement. Un développeur a mis Claude Opus 5.5 sous surveillance pendant 30 jours à partir de la semaine de lancement, avec des questions figées, un code Claude épinglé et des règles publiques, et cela montre pourquoi personne n'aurait pu le savoir avant, et pourquoi votre nombre de jetons est la chose à surveiller. Verdict : SHIP IT.

Lire l'édition écrite (anglais) ↗

Ce que cette vidéo couvre

  • Claude devient moins intelligent après le lancement : la théorie rencontre une surveillance dès le premier jour
  • livenerf : une surveillance de 30 jours sur Opus 5.5 à partir de la semaine de lancement
  • Comment attraper un "nerf" : 78 questions parfois bonnes
  • Ce qu'il peut voir : 7,5 points, et le nombre de jetons bouge en premier
  • L'angle mort : un échange d'Opus 5 et 8 mauvaises clés de réponse

Transcription traduite

Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont contrôlés par YouTube.

Claude devient moins intelligent après le lancement : la théorie rencontre une surveillance dès le premier jour

0:00 Tout le monde sait que Claude devient moins intelligent quelques semaines après son lancement. Alors un développeur a mis Opus 5.5 sous surveillance à partir de la semaine de lancement, et la surveillance dit que personne n'aurait pu le savoir encore. Dans cette vidéo, trois questions. Comment attrape-t-on un "nerf" ? Que peut voir ce compteur ? Et que dit Anthropic ? Et une ligne dans les crédits du dépôt m'a fait rire aux éclats.

0:20 J'y reviendrai à la fin. C'est mercredi 30 septembre, et voici The Daily Diff. Trois histoires aujourd'hui, et la grande est un dépôt GitHub appelé live nerf.

livenerf : une surveillance de 30 jours sur Opus 5.5 à partir de la semaine de lancement

0:30 Pendant des mois, les gens ont dit qu'Anthropic réduisait discrètement la performance de ses modèles après le lancement. Les théories habituelles sont un modèle comprimé, un modèle plus petit sous le même nom, ou simplement moins de réflexion. Le dépôt qualifie chaque argument jusqu'à présent de "vibes versus vibes". Opus 5.5 a été lancé le 22 septembre, et il y a une semaine, je vous ai dit qu'il avait dominé le classement indépendant en écrivant trois fois plus de mots que le modèle médian. Deux jours et demi après, un développeur nommé ninja hawk a lancé la surveillance,

0:59 une fois par jour pendant 30 jours, avec des journaux que personne ne peut modifier. Le fil Hacker News a atteint près de 800 points et s'est divisé comme un "chat" d'équipe. Un commentateur dit que le "nerfing" des modèles n'est pas réel dans la grande majorité des cas signalés. Un autre dit que les gens s'habituent simplement au nouveau niveau d' intelligence. Et un utilisateur avancé de Claude Code ignore désormais la fenêtre contextuelle "évaluer cette session" chaque fois, car évaluer Claude semblait le rendre pire. Examen par les pairs. Donc, question un, comment attrape-t-on un "nerf" ?

Comment attraper un "nerf" : 78 questions parfois bonnes

1:27 Vous commencez avec environ 2300 questions d'examen difficiles, et Opus obtient 93 % de bonnes réponses du premier coup, ce qui est inutile pour un détecteur, car une question à laquelle il répond toujours correctement ne peut pas chuter. 97 % étaient toujours bonnes ou toujours fausses, et les 78 qu'il réussissait parfois seulement sont devenues le panel. Même "prompt", pas d'outils, et une évaluation par correspondance exacte sans juge IA, car le juge dériverait aussi. Il fonctionne sur un abonnement Max via Claude Code sans interface graphique ("headless"),

1:55 car la version API était tarifée à environ 1600 dollars par mois. Et la version de Claude Code est "épinglée", car, selon les mots du dépôt, un harnais modifié ressemble exactement à un modèle modifié. Les statistiques proviennent d'un article intitulé "Adding Error Bars to Evals", par Evan Miller chez Anthropic. Donc, les propres calculs d'Anthropic auditent maintenant Anthropic, ce qui est la version académique de citer les conditions d'utilisation au service client.

Ce qu'il peut voir : 7,5 points, et le nombre de jetons bouge en premier

2:19 Question deux, que peut-il voir ? Par fenêtre de dix jours, une baisse d'environ 7,5 points. Pour prouver que le système fonctionne, l'auteur a délibérément réduit l'effort de Claude. Un effort moyen a réduit la production d'environ un quart, et le score de seulement quatre points. Un faible effort a réduit la production de près de deux tiers, pour huit points. C'est la partie à retenir. Moins de réflexion apparaît dans le nombre de jetons avant d'apparaître dans les réponses.

2:43 Alors épinglez la version de votre modèle, enregistrez les jetons de sortie par tâche, et gardez quelques-unes de vos propres questions figées. Si votre agent écrit soudainement plus court, vérifiez vos journaux avant de vérifier Reddit. Et voici la partie honnête.

L'angle mort : un échange d'Opus 5 et 8 mauvaises clés de réponse

2:54 Le remplacement discret par l'ancien Opus 5 était un changement trop minime pour que le système le signale, et le "readme" le dit d'emblée. L'audit a également trouvé huit clés de réponse qui semblent fausses, donc le détecteur de "nerf" a trouvé des bogues dans le "benchmark" avant de trouver un "nerf".

Anthropic : nous ne réduisons jamais la qualité du modèle

3:08 Question trois, que dit Anthropic ? L'année dernière, après une vague de plaintes, Anthropic a publié un "postmortem". Il dit, je cite, "nous ne réduisons jamais la qualité du modèle en raison de la demande," de l'heure de la journée ou de la charge du serveur. Le même article admet que trois bogues avaient dégradé Claude, et près d'un tiers des utilisateurs de Claude Code ont atteint les mauvais serveurs au moins une fois. Donc les plaintes étaient réelles et la cause était des bogues, c'est pourquoi le dépôt avertit que la semaine de lancement pourrait être la pire semaine.

3:35 Six des trente jours sont passés. Le premier appel possible aura lieu vers le 24 octobre, donc la réponse honnête est que personne ne sait, y compris tous ceux qui étaient sûrs. En parlant de chiffres que personne ne publie.

Les centres de données gardent leurs chiffres secrets ; Backblaze les publie

3:46 Lighthouse Reports et le journal néerlandais Trouw ont découvert que la grande majorité des centres de données européens gardent secrets leur consommation d'énergie et d'eau, bien qu'une règle de l'UE exige une déclaration depuis trois ans. Aux Pays-Bas, moins d'un quart publie. Un seul centre de données Microsoft utilise environ 1 % de l'électricité néerlandaise. Pendant ce temps, Backblaze a refait le truc ennuyeux. Ses statistiques trimestrielles sur les disques couvrent environ 350 000 disques durs, et le taux de défaillance est passé à 1,73 %,

4:16 le plus élevé depuis un certain temps. Trois modèles Seagate n'ont eu aucune défaillance. Voici à quoi ressemble une référence publique, trimestre après trimestre, depuis 13 ans.

La ligne de crédits : Claude a aidé à construire le compteur

4:25 Maintenant, cette ligne de crédits. Le "readme" admet qu'une grande partie du dépôt a été écrite avec l'aide de Claude, qui est le modèle mesuré. Donc Claude a aidé à construire le compteur qui vérifie si Claude est devenu moins intelligent. C'est pourquoi les évaluateurs sont de simples fonctions. Selon les mots de l'auteur, vous ne devriez pas avoir à faire confiance à l'auteur, humain ou autre. Si vous préférez lire ceci plutôt que de m'entendre le dire, le "diff" arrive dans votre boîte de réception

4:46 chaque matin, gratuitement sur "thedailydiff.dev", lien ci-dessous. Donc, le verdict d'aujourd'hui sur live nerf.

Verdict : SHIP IT, et ne le citez pas avant le 24 octobre

4:51 SHIP IT. Je le "shipperait" parce que c'est le premier argument de "nerf" que j'ai vu avec un horodatage, un règlement public et un angle mort déclaré. Ne le citez pas avant le 24 octobre. Et c'est le "diff" pour aujourd'hui. Je suis Niko d'Axrisi. Fusionnez de manière responsable.

Sources

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Vidéos similaires