+− THE DAILY DIFFdev & AI news
SHIP IT

Miten Claude-heikennys havaitaan (aidolla datalla)

Ihmiset sanovat, että Claude tyhmistyy muutaman viikon kuluttua jokaisesta julkaisusta.

Ihmiset sanovat, että Claude tyhmistyy muutaman viikon kuluttua jokaisesta julkaisusta. Eräs kehittäjä laittoi Claude Opus 5.5:n 30 päivän kellon käyntiin julkaisuviikosta alkaen, käyttäen jäädytettyjä kysymyksiä, lukittua Claude Codea ja julkisia sääntöjä, ja tämä osoittaa, miksi kukaan ei olisi voinut tietää aiemmin, ja miksi token-määräsi on asia, jota kannattaa seurata. Tuomio: SHIP IT.

Lue kirjoitettu versio (englanniksi) ↗

Mitä tämä video käsittelee

  • Claude tyhmistyy julkaisun jälkeen: teoria kohtaa nollapäivän kellon
  • livenerf: 30 päivän kello Opus 5.5:lle julkaisuviikosta alkaen
  • Miten heikennys havaitaan: 78 joskus oikeaa kysymystä
  • Mitä se näkee: 7.5 pistettä, ja token-määrä liikkuu ensin
  • Sokea piste: Opus 5 -vaihto ja 8 väärää vastausavainta

Käännetty transkriptio

Käännetty alkuperäisestä englanninkielisestä selostuksesta. Käytettävissä olevan äänen ja tekstitysten hallinta tapahtuu YouTuben kautta.

Claude tyhmistyy julkaisun jälkeen: teoria kohtaa nollapäivän kellon

0:00 Kaikki tietävät, että Claude tyhmistyy muutaman viikon kuluttua julkaisusta. Joten eräs kehittäjä laittoi Opus 5.5:n kellon käyntiin julkaisuviikosta alkaen, ja kello kertoo, ettei kukaan olisi vielä voinut tietää. Tällä videolla, kolme kysymystä. Miten heikennys havaitaan? Mitä tämä mittari näkee? Ja mitä Anthropic sanoo? Ja yksi rivi repositorion krediiteissä sai minut nauramaan ääneen.

0:20 Palaan siihen lopussa. On keskiviikko, syyskuun 30. päivä, ja tämä on The Daily Diff. Kolme tarinaa tänään, ja suurin on GitHub-repositorio nimeltä livenerf.

livenerf: 30 päivän kello Opus 5.5:lle julkaisuviikosta alkaen

0:30 Kuukausia ihmiset ovat sanoneet, että Anthropic hiljaa heikentää mallejaan julkaisun jälkeen. Tavallisia teorioita ovat puristettu malli, pienempi malli samalla nimellä tai yksinkertaisesti vähemmän ajattelua. Repositorio kutsuu jokaista argumenttia tähän mennessä tuntemukseksi tuntemusta vastaan. Opus 5.5 julkaistiin syyskuun 22. päivä, ja viikko sitten kerroin, että se oli itsenäisen listan kärjessä kirjoittaen kolme kertaa enemmän sanoja kuin mediaanimalli. Kaksi ja puoli päivää myöhemmin kehittäjä nimeltä ninjahawk aloitti kellon,

0:59 kerran päivässä kolmenkymmenen päivän ajan, lokiensa kanssa, joita kukaan ei saa muokata. Hacker News -ketju saavutti lähes kahdeksansataa pistettä ja jakautui kuin tiimichatti. Yksi kommentoija sanoo, että mallien heikentäminen ei ole todellista valtaosassa raportoiduista tapauksista. Toinen sanoo, että ihmiset vain tottuvat uuteen älykkyyden tasoon. Ja yksi Claude Code -tehokäyttäjä hylkää nyt tämän istunnon arvioinnin ponnahdusikkunan joka kerta, koska Clauden arvioiminen näytti pahentavan sitä. Vertaisarviointi. Joten, kysymys yksi, miten heikennys havaitaan?

Miten heikennys havaitaan: 78 joskus oikeaa kysymystä

1:27 Aloitat noin kahdellakymmenelläkolmella sadalla vaikealla koekysymyksellä, ja Opus saa 93 prosenttia oikein ensimmäisellä yrittämällä, mikä on hyödytöntä ilmaisimelle, koska kysymys, jonka se aina saa oikein, ei voi laskea. 97 prosenttia oli aina oikein tai aina väärin, ja ne 78, jotka se saa vain joskus oikein, muodostivat paneelin. Sama kehotus, ei työkaluja, ja täsmälleen vastaava arviointi ilman tekoälytuomaria, koska tuomarikin ajautuisi. Se toimii Max-tilauksella päättömän Claude Coden kautta,

1:55 koska API-version hinta oli noin 1600 dollaria kuukaudessa. Ja Claude Code -versio on lukittu, koska, repositorion sanoin, muuttunut kehys näyttää täsmälleen muuttuneelta mallilta. Tilastot ovat peräisin artikkelista nimeltä Adding Error Bars to Evals, kirjoittanut Evan Miller Anthropicilta. Joten Anthropickin oma matematiikka tarkastaa nyt Anthropicia, mikä on akateeminen versio käyttöehtojen lainaamisesta takaisin asiakaspalveluun.

Mitä se näkee: 7.5 pistettä, ja token-määrä liikkuu ensin

2:19 Kysymys kaksi, mitä se näkee? Kymmenen päivän välein, pudotus noin seitsemän ja puoli pistettä. Todistaakseen, että järjestelmä toimii, kirjoittaja käänsi Clauden ponnistelua tahallaan alas. Keskitason ponnistelu leikkasi tuotantoa noin neljänneksellä, ja pisteitä vain neljä pistettä. Matala ponnistelu leikkasi tuotantoa melkein kahdella kolmasosalla, kahdeksan pistettä. Se on se osa, joka kannattaa varastaa. Vähempi ajattelu näkyy tokenien määrässä ennen kuin se näkyy vastauksissa.

2:43 Joten lukitse malliversiosi, kirjaa tuotoksen tokenit tehtävää kohti, ja pidä muutama oma jäädytetty kysymys. Jos agenttisi yhtäkkiä kirjoittaa lyhyemmin, tarkista lokisi ennen kuin tarkistat Redditin. Ja tässä on rehellinen osa.

Sokea piste: Opus 5 -vaihto ja 8 väärää vastausavainta

2:54 Vanhemman Opus 5:n hiljainen vaihtaminen oli liian pieni muutos, jotta järjestelmä voisi havaita sen, ja readme sanoo niin heti alussa. Tarkastus löysi myös kahdeksan vastausavainta, jotka näyttävät vääriltä, joten heikennystunnistin löysi virheitä vertailuarvosta ennen kuin se löysi heikennystä.

Anthropic: emme koskaan heikennä mallin laatua

3:08 Kysymys kolme, mitä Anthropic sanoo? Viime vuonna, valitusten aallon jälkeen, Anthropic julkaisi jälkianalyysin. Siinä sanotaan, lainaus, emme koskaan heikennä mallin laatua kysynnän vuoksi, vuorokaudenajan tai palvelimen kuormituksen vuoksi. Sama julkaisu myöntää, että kolme virhettä oli heikentänyt Claudea, ja lähes kolmasosa Claude Coden käyttäjistä osui vääriin palvelimiin ainakin kerran. Joten valitukset olivat todellisia ja syynä olivat virheet, minkä vuoksi repositorio varoittaa, että julkaisuviikko voi olla pahin viikko.

3:35 Kuusi kolmestakymmenestä päivästä on kulunut. Ensimmäinen mahdollinen kutsu saapuu noin lokakuun 24. päivänä, joten rehellinen vastaus on, ettei kukaan tiedä, mukaan lukien kaikki, jotka olivat varmoja. Puhuttaessa numeroista, joita kukaan ei julkaise.

Datakeskukset pitävät numeronsa salassa; Backblaze julkaisee

3:46 Lighthouse Reports ja hollantilainen lehti Trouw havaitsivat, että suurin osa Euroopan datakeskuksista pitää virran- ja vedenkulutuksensa salassa, vaikka EU-sääntö on vaatinut raportointia kolmen vuoden ajan. Alankomaissa alle neljännes julkaisee. Yksi Microsoftin datakeskus yksin käyttää noin yhden prosentin Hollannin sähköstä. Samaan aikaan Backblaze teki jälleen tylsän asian. Sen vuosineljänneksen levyasemien tilastot kattavat noin 350 000 kiintolevyä, ja vikaantumisaste nousi 1,73 prosenttiin,

4:16 korkeimmalle pitkään aikaan. Kolmella Seagate-mallilla ei ollut lainkaan vikoja. Tältä julkinen perustaso näyttää, vuosineljänneksestä toiseen, kolmetoista vuotta.

Krediittirivi: Claude auttoi rakentamaan mittarin

4:25 Nyt tuo krediittirivi. Readme myöntää, että suuri osa repositoriosta kirjoitettiin Clauden avulla, joka on mitattava malli. Joten Claude auttoi rakentamaan mittarin, joka tarkistaa, onko Claude tyhmistynyt. Siksi arvioijat ovat yksinkertaisia funktioita. Kirjoittajan sanoin, sinun ei pitäisi joutua luottamaan kirjoittajaan, ihmiseen tai muuhun. Jos haluat mieluummin lukea tämän kuin kuulla minun sanovan sen, ero saapuu postilaatikkoosi

4:46 joka aamu, ilmaiseksi osoitteessa thedailydiff.dev, linkki alla. Joten, tämän päivän tuomio livenerfistä.

Tuomio: SHIP IT, äläkä siteeraa sitä ennen lokakuun 24. päivää

4:51 SHIP IT. Lähettäisin sen, koska se on ensimmäinen näkemäni heikennysargumentti, jossa on aikaleima, julkinen sääntökirja ja ilmoitettu sokea piste. Älä vain siteeraa sitä ennen lokakuun 24. päivää. Ja siinä on tämän päivän ero. Olen Niko Axrisista. Yhdistä vastuullisesti.

Lähteet

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Aiheeseen liittyvät videot