Wie man einen Claude-Nerf erkennt (mit echten Daten)
Die Leute sagen, Claude wird ein paar Wochen nach jeder Einführung dümmer.
Die Leute sagen, Claude wird ein paar Wochen nach jeder Einführung dümmer. Ein Entwickler hat Claude Opus 5.5 von der Startwoche an auf eine 30-Tage-Uhr gesetzt, mit eingefrorenen Fragen, einem angepinnten Claude Code und öffentlichen Regeln, und es zeigt, warum niemand es vorher wissen konnte und warum Ihre Token-Anzahl das ist, worauf man achten muss. Urteil: SHIP IT.
Die schriftliche Ausgabe lesen (Englisch) ↗
Was dieses Video behandelt
- Claude wird nach dem Start dümmer: Die Theorie trifft auf eine Tag-Null-Uhr
- livenerf: Eine 30-Tage-Uhr für Opus 5.5 ab der Startwoche
- Wie man einen Nerf fängt: 78 manchmal richtige Fragen
- Was es sehen kann: 7,5 Punkte, und die Token-Anzahl bewegt sich zuerst
- Der blinde Fleck: Ein Opus 5-Tausch und 8 falsche Antwortschlüssel
Übersetztes Transkript
Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.
Claude wird nach dem Start dümmer: Die Theorie trifft auf eine Tag-Null-Uhr
0:00 Jeder weiß, dass Claude ein paar Wochen nach dem Start dümmer wird. Also hat ein Entwickler Opus 5.5 von der Startwoche an auf eine Uhr gesetzt, und die Uhr sagt, dass es noch niemand wissen konnte. In diesem Video: drei Fragen. Wie erkennt man einen Nerf? Was kann dieses Messgerät sehen? Und was sagt Anthropic? Und eine Zeile in den Credits des Repos hat mich laut lachen lassen.
0:20 Ich komme am Ende dazu. Es ist Mittwoch, der dreißigste September, und dies ist The Daily Diff. Drei Geschichten heute, und die große ist ein GitHub-Repo namens live nerf.
livenerf: Eine 30-Tage-Uhr für Opus 5.5 ab der Startwoche
0:30 Seit Monaten sagen die Leute, dass Anthropic seine Modelle nach dem Start leise "nerft". Die üblichen Theorien sind ein gequetschtes Modell, ein kleineres Modell unter dem gleichen Namen oder einfach weniger Denken. Das Repo nennt jedes bisherige Argument "Stimmungen gegen Stimmungen". Opus 5.5 wurde am zweiundzwanzigsten September ausgeliefert, und vor einer Woche erzählte ich Ihnen, dass es das unabhängige Board anführte, während es dreimal mehr Wörter schrieb als das durchschnittliche Modell. Zweieinhalb Tage später startete ein Entwickler namens ninja hawk die Uhr,
0:59 einmal täglich für dreißig Tage, mit Protokollen, die niemand bearbeiten darf. Der Hacker News-Thread erreichte fast achthundert Punkte und teilte sich wie ein Team-Chat. Ein Kommentator sagt, dass das Nerfen von Modellen in den allermeisten gemeldeten Fällen nicht real ist. Ein anderer sagt, die Leute gewöhnen sich nur an das neue Niveau der Intelligenz. Und ein Claude Code Power-User ignoriert jetzt jedes Mal das "diese-Sitzung-bewerten"-Pop-up, weil das Bewerten von Claude es anscheinend schlechter machte. Peer-Review. Also, Frage eins, wie fängt man einen Nerf?
Wie man einen Nerf fängt: 78 manchmal richtige Fragen
1:27 Man beginnt mit etwa zweitausenddreihundert schweren Prüfungsfragen, und Opus bekommt dreiundneunzig Prozent beim ersten Versuch richtig, was für einen Detektor nutzlos ist, da eine Frage, die es immer richtig beantwortet, nicht fallen kann. Siebenundneunzig Prozent waren immer richtig oder immer falsch, und die siebenundsiebzig, die es nur manchmal richtig beantwortete, bildeten das Panel. Gleicher Prompt, keine Tools und exakte Übereinstimmungsbewertung ohne KI-Richter, weil der Richter auch abdriften würde. Es läuft über ein Max-Abonnement über headless Claude Code,
1:55 da die API-Version etwa sechzehnhundert Dollar pro Monat kostete. Und die Claude Code-Version ist angepinnt, denn, so die Worte des Repos, ein geändertes Harness sieht genau wie ein geändertes Modell aus. Die Statistiken stammen aus einem Papier namens "Adding Error Bars to Evals", von Evan Miller bei Anthropic. Also prüft Anthropic's eigene Mathematik nun Anthropic, was die akademische Version davon ist, die Nutzungsbedingungen dem Kundensupport entgegenzuhalten.
Was es sehen kann: 7,5 Punkte, und die Token-Anzahl bewegt sich zuerst
2:19 Frage zwei, was kann es sehen? Pro Zehn-Tages-Fenster ein Rückgang von etwa siebeneinhalb Punkten. Um zu beweisen, dass das System funktioniert, hat der Autor Claudes Anstrengung absichtlich reduziert. Mittlerer Aufwand reduzierte die Ausgabe um etwa ein Viertel und die Punktzahl um nur vier Punkte. Geringer Aufwand reduzierte die Ausgabe um fast zwei Drittel, für acht Punkte. Das ist der Teil, den man klauen sollte. Weniger Denken zeigt sich in der Token-Anzahl, bevor es sich in den Antworten zeigt.
2:43 Also pinnen Sie Ihre Modellversion, protokollieren Sie die Ausgabe-Tokens pro Aufgabe, und behalten Sie ein paar Ihrer eigenen eingefrorenen Fragen. Wenn Ihr Agent plötzlich kürzer schreibt, überprüfen Sie Ihre Protokolle, bevor Sie Reddit überprüfen. Und hier ist der ehrliche Teil.
Der blinde Fleck: Ein Opus 5-Tausch und 8 falsche Antwortschlüssel
2:54 Das heimliche Austauschen des älteren Opus 5 war eine zu kleine Änderung, als dass das System es hätte melden können, und das Readme sagt das von vornherein. Die Prüfung fand auch acht Antwortschlüssel, die falsch aussehen, so dass der Nerf-Detektor Fehler im Benchmark fand, bevor er einen Nerf fand.
Anthropic: Wir reduzieren niemals die Modellqualität
3:08 Frage drei, was sagt Anthropic? Letztes Jahr, nach einer Welle von Beschwerden, veröffentlichte Anthropic eine Post-Mortem-Analyse. Darin heißt es, Zitat, "wir reduzieren niemals die Modellqualität aufgrund von Nachfrage, Tageszeit oder Serverlast." Der gleiche Beitrag gibt zu, dass drei Bugs Claude beeinträchtigt hatten, und fast ein Drittel der Claude Code-Benutzer mindestens einmal die falschen Server trafen. Die Beschwerden waren also real und die Ursache waren Bugs, weshalb das Repo warnt, dass die Startwoche die schlimmste Woche sein könnte.
3:35 Sechs von dreißig Tagen sind vorbei. Der erste mögliche Aufruf landet um den 24. Oktober, also ist die ehrliche Antwort, dass niemand es weiß, einschließlich aller, die sich sicher waren. Apropos Zahlen, die niemand veröffentlicht.
Rechenzentren halten ihre Zahlen geheim; Backblaze veröffentlicht
3:46 Lighthouse Reports und die niederländische Zeitung Trouw fanden heraus, dass die überwiegende Mehrheit der europäischen Rechenzentren ihren Strom- und Wasserverbrauch geheim hält, obwohl eine EU-Regel seit drei Jahren eine Meldepflicht vorschreibt. In den Niederlanden veröffentlichen weniger als ein Viertel. Ein Microsoft-Rechenzentrum allein verbraucht etwa ein Prozent des niederländischen Stroms. Unterdessen hat Backblaze wieder das langweilige getan. Die vierteljährlichen Festplattenstatistiken umfassen etwa dreihundertfünfzigtausend Festplatten, und die Ausfallrate stieg auf 1,73 Prozent,
4:16 die höchste seit langem. Drei Seagate-Modelle hatten keine Ausfälle. So sieht eine öffentliche Basislinie aus, Quartal für Quartal, seit dreizehn Jahren.
Die Credits-Zeile: Claude half beim Bau des Messgeräts
4:25 Nun, diese Credits-Zeile. Das Readme gibt zu, dass ein Großteil des Repos mit Hilfe von Claude geschrieben wurde, was das gemessene Modell ist. Claude half also beim Bau des Messgeräts, das überprüft, ob Claude dümmer geworden ist. Deshalb sind die Grader einfache Funktionen. In den Worten des Autors, man sollte dem Autor nicht trauen müssen, menschlich oder anderweitig. Wenn Sie dies lieber lesen möchten, als es mich sagen zu hören, landet der Diff jeden Morgen in Ihrem
4:46 Posteingang, kostenlos unter thedailydiff.dev, Link unten. Also, das heutige Urteil zu live nerf.
Urteil: SHIP IT, und zitieren Sie es nicht vor dem 24. Oktober
4:51 SHIP IT. Ich würde es "shippen", weil es das erste Nerf-Argument ist, das ich mit einem Zeitstempel, einem öffentlichen Regelwerk und einem erklärten blinden Fleck gesehen habe. Zitieren Sie es nur nicht vor dem 24. Oktober. Und das ist der Diff für heute. Ich bin Niko von Axrisi. Verantwortungsbewusst zusammenführen.
Quellen
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



