+− THE DAILY DIFFdev & AI news
SHIP IT

Kuidas tuvastada Claude'i nõrgenemist (reaalsete andmetega)

Inimesed ütlevad, et Claude muutub pärast iga lansseerimist mõne nädala pärast rumalamaks.

Inimesed ütlevad, et Claude muutub pärast iga lansseerimist mõne nädala pärast rumalamaks. Üks arendaja pani Claude Opus 5.5-le 30-päevase kella käima alates lansseerimisnädalast, kasutades külmutatud küsimusi, kinnitatud Claude koodi ja avalikke reegleid, ja see näitab, miks keegi ei saanud varem teada ja miks teie tokenite arv on see, mida tuleb jälgida. Kohtuotsus: SHIP IT.

Loe kirjalikku väljaannet (inglise keeles) ↗

Mida see video hõlmab

  • Claude muutub pärast lansseerimist rumalamaks: teooria kohtub päev-null kellaga
  • livenerf: 30-päevane kell Opus 5.5-le alates lansseerimisnädalast
  • Kuidas tuvastada nõrgenemist: 78 mõnikord õiget küsimust
  • Mida see näha saab: 7,5 punkti ja tokenite arv liigub esimesena
  • Pimeala: Opus 5 vahetus ja 8 vale vastusevõtit

Tõlgitud transkriptsioon

Tõlgitud ingliskeelsest originaaljutustusest. Saadaolevat heli ja subtiitreid kontrollib YouTube.

Claude muutub pärast lansseerimist rumalamaks: teooria kohtub päev-null kellaga

0:00 Kõik teavad, et Claude muutub pärast lansseerimist mõne nädala pärast rumalamaks. Nii pani üks arendaja Opus viie punkti viiele kella käima alates lansseerimisnädalast, ja kell näitab, et keegi ei saanud veel teada. Selles videos kolm küsimust. Kuidas te tuvastate nõrgenemise? Mida see arvesti näha saab? Ja mida ütleb Anthropic? Ja üks rida repositooriumi autorites pani mind kõva häälega naerma.

0:20 Ma jõuan selle juurde lõpus. On kolmapäev, kolmekümnes september, ja see on The Daily Diff. Kolm lugu täna, ja suurim on GitHubi repositoorium nimega live nerf.

livenerf: 30-päevane kell Opus 5.5-le alates lansseerimisnädalast

0:30 Kuude kaupa on inimesed öelnud, et Anthropic nõrgendab vaikselt oma mudeleid pärast lansseerimist. Tavalised teooriad on kokku surutud mudel, väiksem mudel sama nime all või lihtsalt vähem mõtlemist. Repositoorium nimetab iga argumenti seni meeleoludeks versus meeleoludeks. Opus viis punkti viis lansseeriti 22. septembril, ja nädal aega tagasi ütlesin teile, et see oli sõltumatute edetabelite tipus, kirjutades kolm korda rohkem sõnu kui keskmine mudel. Kaks ja pool päeva hiljem pani arendaja nimega ninja hawk kella käima,

0:59 üks kord päevas kolmekümne päeva jooksul, logidega, mida keegi ei tohi muuta. Hacker Newsi teema kogus peaaegu kaheksasada punkti ja jagunes nagu meeskonna vestlus. Üks kommenteerija ütleb, et mudelite nõrgendamine pole enamiku teatatud juhtumite puhul reaalne. Teine ütleb, et inimesed lihtsalt harjuvad uue intellektitasemega. Ja üks Claude Code'i edasijõudnud kasutaja lükkab nüüd "hinda seda sessiooni" hüpikakna iga kord tagasi, sest Claude'i hindamine tundus seda halvemaks tegevat. Vastastikune hindamine. Niisiis, küsimus üks, kuidas te tuvastate nõrgenemise?

Kuidas tuvastada nõrgenemist: 78 mõnikord õiget küsimust

1:27 Alustate umbes kahekümne kolmesaja raske eksamiküsimusega, ja Opus saab esimesel katsel õigesti vastata 93 protsenti, mis on detektori jaoks kasutu, sest küsimus, millele see alati õigesti vastab, ei saa langeda. 97 protsenti olid alati õiged või alati valed, ja need 78, millele see ainult mõnikord õigesti vastab, said paneeliks. Sama viip, tööriistadeta ja täpne hindamine ilma AI kohtunikuta, sest ka kohtunik triiviks. See töötab Maxi tellimusega peata Claude Code'i kaudu,

1:55 kuna API versiooni hind oli umbes kuusteist tuhat dollarit kuus. Ja Claude Code'i versioon on kinnitatud, sest repositooriumi sõnul muudetud rakmed näevad välja täpselt nagu muudetud mudel. Statistika pärineb paberist nimega "Veabarra lisamine hindamistele", Anthropicu Evan Milleri poolt. Nii et Anthropicu enda matemaatika auditeerib nüüd Anthropicut, mis on akadeemiline versioon teenusetingimuste tsiteerimisest klienditoele.

Mida see näha saab: 7,5 punkti ja tokenite arv liigub esimesena

2:19 Küsimus kaks, mida see näha saab? Kümne päeva jooksul umbes seitsme ja poole punkti langus. Seadme töö tõestamiseks vähendas autor Claude'i pingutust meelega. Keskmine pingutus vähendas väljundit umbes veerandi võrra ja skoori ainult nelja punkti võrra. Madal pingutus vähendas väljundit peaaegu kahe kolmandiku võrra, kaheksa punkti võrra. See on see osa, mida varastada. Vähem mõtlemist ilmneb tokenite arvus enne, kui see ilmneb vastustes.

2:43 Seega kinnitage oma mudeli versioon, logige väljundtokenid ülesande kohta, ja hoidke mõned oma külmutatud küsimused. Kui teie agent hakkab järsku lühemalt kirjutama, kontrollige oma logisid enne, kui kontrollite Redditit. Ja siin on aus osa.

Pimeala: Opus 5 vahetus ja 8 vale vastusevõtit

2:54 Vana Opus viie vaikne asendamine oli seadme jaoks liiga väike muutus, ja readme ütleb seda kohe alguses. Auditi käigus leiti ka kaheksa vastusevõtit, mis tundusid valed, nii leidis nõrgenemise detektor vead etalonis enne, kui see leidis nõrgenemise.

Anthropic: me ei vähenda kunagi mudeli kvaliteeti

3:08 Küsimus kolm, mida ütleb Anthropic? Eelmisel aastal, pärast kaebuste lainet, avaldas Anthropic postmortemi. See ütleb, tsiteerides: me ei vähenda kunagi mudeli kvaliteeti nõudluse tõttu, kellaaja või serveri koormuse tõttu. Sama postitus tunnistab, et kolm viga olid Claude'i rikkunud, ja peaaegu kolmandik Claude Code'i kasutajatest sattusid vähemalt korra valedesse serveritesse. Nii et kaebused olid reaalsed ja põhjuseks olid vead, mistõttu repositoorium hoiatab, et lansseerimisnädal võib olla halvim nädal.

3:35 Kolmekümnest päevast on kuus möödas. Esimene võimalik teade saabub umbes 24. oktoobril, nii et aus vastus on, et keegi ei tea, kaasa arvatud kõik, kes olid kindlad. Rääkides numbritest, mida keegi ei avalda.

Andmekeskused hoiavad oma numbrid saladuses; Backblaze avaldab

3:46 Lighthouse Reports ja Hollandi ajaleht Trouw leidsid, et enamik Euroopa andmekeskustest hoiab oma energia- ja veetarbimist saladuses, kuigi EL-i reegel on nõudnud aruandlust kolm aastat. Hollandis avaldab vähem kui veerand. Üks Microsofti andmekeskus üksi kasutab umbes üks protsent Hollandi elektrist. Vahepeal tegi Backblaze jälle igava asja. Selle kvartaalsed kõvaketta statistika hõlmab umbes kolmsada viiskümmend tuhat kõvaketast, ja rikete määr tõusis 1,73 protsendini,

4:16 kõrgeimaks mõnda aega. Kolmel Seagate'i mudelil oli null riket. See on see, milline näeb välja avalik baasjoon, kvartalist kvartalisse, kolmteist aastat.

Autorirea: Claude aitas arvestit ehitada

4:25 Nüüd, see autorirea. Readme tunnistab, et suur osa repositooriumist kirjutati Claude'i abiga, mis on mudel, mida mõõdetakse. Nii aitas Claude ehitada arvesti, mis kontrollib, kas Claude muutus rumalamaks. Sellepärast on hindajad lihtsad funktsioonid. Autori sõnade kohaselt ei peaks te autorit usaldama, inimest ega muud. Kui te pigem loeksite seda, kui kuuleksite mind seda ütlemas, saabub erinevus teie postkasti

4:46 igal hommikul, tasuta saidil the daily diff dot dev, link allpool. Niisiis, tänane otsus live nerfi kohta.

Kohtuotsus: SHIP IT, ja ärge tsiteerige enne 24. oktoobrit

4:51 SHIP IT. Ma saadaksin selle, sest see on esimene nõrgenemise argument, mida ma olen näinud ajatemplit, avalikku reeglistikku ja teatatud pimealaga. Lihtsalt ärge tsiteerige seda enne 24. oktoobrit. Ja see on tänane erinevus. Ma olen Niko Axrisist. Ühendage vastutustundlikult.

Allikad

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Seotud videod