+− THE DAILY DIFFdev & AI news
SHIP IT

Kako zaznati 'nerf' pri modelu Claude (z resničnimi podatki)

Ljudje pravijo, da Claude postaja manj inteligenten nekaj tednov po vsaki lansiranju.

Ljudje pravijo, da Claude postaja manj inteligenten nekaj tednov po vsaki lansiranju. En razvijalec je model Claude Opus 5.5 postavil na 30-dnevno časovnico od tedna lansiranja, z zamrznjenimi vprašanji, pripeto kodo Claude Code in javnimi pravili, in to kaže, zakaj nihče ni mogel vedeti prej in zakaj je število žetonov tisto, kar je treba spremljati. Sodba: SHIP IT.

Preberi pisno izdajo (angleščina) ↗

Kaj zajema ta videoposnetek

  • Claude postaja manj inteligenten po lansiranju: teorija se sreča z uro 'dan nič'
  • livenerf: 30-dnevna ura na Opus 5.5 od tedna lansiranja
  • Kako ujeti 'nerf': 78 včasih pravilnih vprašanj
  • Kaj lahko vidi: 7,5 točk, in število žetonov se premakne najprej
  • Slepa pega: zamenjava Opus 5 in 8 napačnih ključev za odgovore

Preveden prepis

Prevedeno iz izvirnega angleškega pripovedovanja. Razpoložljivi zvok in podnapisi so nadzorovani s strani YouTuba.

Claude postane manj inteligenten po lansiranju: teorija se sreča z uro 'dan nič'

0:00 Vsi vedo, da Claude postane manj inteligenten nekaj tednov po lansiranju. Tako je en razvijalec Opus pet točka pet postavil na časovno razporeditev od tedna lansiranja, in časovna razporeditev pravi, da nihče še ni mogel vedeti. V tem videu so tri vprašanja. Kako ujamete 'nerf'? Kaj lahko ta merilnik vidi? In kaj pravi Anthropic? In ena vrstica v zaslugah repozitorija me je spravila v glasen smeh.

0:20 Do tega bom prišel na koncu. Je sreda, trideseti september, in to je The Daily Diff. Danes tri zgodbe, in velika je GitHub repozitorij, imenovan live nerf.

livenerf: 30-dnevna ura na Opus 5.5 od tedna lansiranja

0:30 Mesece so ljudje govorili, da Anthropic po lansiranju tiho zmanjšuje zmogljivost svojih modelov. Običajne teorije so stisnjen model, manjši model pod istim imenom ali preprosto manj razmišljanja. Repozitorij imenuje vsak dosedanji argument 'vibe' proti 'vibe'. Opus pet točka pet je bil izdan dvaindvajsetega septembra, in pred tednom dni sem vam povedal, da je bil na vrhu neodvisne lestvice, medtem ko je napisal tri krat več besed kot povprečen model. Po dveh in pol dneh je razvijalec, imenovan ninja hawk, začel merjenje časa,

0:59 enkrat na dan trideset dni, z dnevniki, ki jih nihče ne sme urejati. Nit Hacker News je dosegla skoraj osemsto točk in se razdelila kot timski klepet. En komentator pravi, da zmanjševanje zmogljivosti modelov ni resnično v veliki večini prijavljenih primerov. Drugi pravi, da se ljudje preprosto navajajo na novo raven inteligence. In en močnejši uporabnik kode Claude Code zdaj vsakič zavrne pojavno okno 'oceni to sejo', ker se mu je zdelo, da ocenjevanje Clauda poslabša stvari. Vzajemno ocenjevanje. Torej, vprašanje ena, kako ujamete 'nerf'?

Kako ujeti 'nerf': 78 včasih pravilnih vprašanj

1:27 Začnete s približno triindvajsetsto težkimi izpitnimi vprašanji, in Opus dobi triindevetdeset odstotkov pravih v prvem poskusu, kar je neuporabno za detektor, saj vprašanje, ki ga vedno dobi pravilno, ne more pasti. Sedemindevetdeset odstotkov je bilo vedno pravilnih ali vedno napačnih, in oseminsedemdeset, ki jih včasih dobi pravilno, je postalo panel. Enak poziv, brez orodij, in natančno ujemanje ocenjevanja brez sodnika AI, ker bi sodnik tudi odstopal. Deluje na naročnini Max preko brezglavega Claude Code,

1:55 saj je bila različica API-ja ocenjena na približno šestnajststo dolarjev na mesec. In različica kode Claude Code je pripeta, ker, po besedah repozitorija, spremenjen jarem izgleda popolnoma enako kot spremenjen model. Statistika prihaja iz članka z naslovom 'Adding Error Bars to Evals', ki ga je napisal Evan Miller pri Anthropicu. Torej Anthropicova lastna matematika zdaj revidira Anthropic, kar je akademska različica citiranja pogojev storitve nazaj uporabniški podpori.

Kaj lahko vidi: 7,5 točk, in število žetonov se premakne najprej

2:19 Vprašanje dve, kaj lahko vidi? Na desetdnevno obdobje, padec za približno sedem in pol točk. Da bi dokazal, da naprava deluje, je avtor namenoma zmanjšal Claudeovo prizadevanje. Srednje prizadevanje je zmanjšalo izhod za približno četrtino, in oceno za samo štiri točke. Nizko prizadevanje je zmanjšalo izhod za skoraj dve tretjini, za osem točk. To je del, ki ga je treba ukrasti. Manj razmišljanja se pokaže v štetju žetonov, preden se pokaže v odgovorih.

2:43 Torej pripnite svojo različico modela, zabeležite izhodne žetone na nalogo, in imejte nekaj svojih zamrznjenih vprašanj. Če vaš agent nenadoma piše krajše, preverite svoje dnevnike, preden preverite Reddit. In tukaj je pošten del.

Slepa pega: zamenjava Opus 5 in 8 napačnih ključev za odgovore

2:54 Tiha zamenjava s starejšim Opusom pet je bila premajhna sprememba, da bi jo naprava pokazala, in readme to pove že na začetku. Revizija je našla tudi osem ključev za odgovore, ki se zdijo napačni, tako da je detektor 'nerf' našel napake v merilu, preden je našel 'nerf'.

Anthropic: nikoli ne zmanjšamo kakovosti modela

3:08 Vprašanje tri, kaj pravi Anthropic? Lani, po valu pritožb, je Anthropic objavil poročilo o dogodkih. Piše, citiram, nikoli ne zmanjšamo kakovosti modela zaradi povpraševanja, časa dneva ali obremenitve strežnika. Isti prispevek priznava, da so tri napake poslabšale Claudea, in skoraj tretjina uporabnikov kode Claude Code je vsaj enkrat naletela na napačne strežnike. Torej so bile pritožbe resnične in vzrok so bile napake, zato repozitorij opozarja, da je teden lansiranja lahko najslabši teden.

3:35 Šest od tridesetih dni je za nami. Prvi možni klic pristane okoli štiriindvajsetega oktobra, tako da je pošten odgovor, da nihče ne ve, vključno z vsemi, ki so bili prepričani. Ko smo že pri številkah, ki jih nihče ne objavlja.

Podatkovni centri hranijo svoje številke skrivaj; Backblaze objavlja

3:46 Lighthouse Reports in nizozemski časopis Trouw so ugotovili, da velika večina evropskih podatkovnih centrov hrani svojo porabo energije in vode v tajnosti, čeprav evropska pravila zahtevajo poročanje že tri leta. Na Nizozemskem objavlja manj kot četrtina. Samo en Microsoftov podatkovni center porabi približno en odstotek nizozemske električne energije. Medtem je Backblaze spet storil dolgočasno stvar. Njegovi četrtletni podatki o pogonih zajemajo približno tristo petdeset tisoč trdih diskov, in stopnja napak se je povzpela na eno točka sedem tri odstotka,

4:16 najvišje v zadnjem času. Trije modeli Seagate niso imeli napak. Tako izgleda javna izhodiščna vrednost, četrtletje za četrtletjem, trinajst let.

Vrstica z zaslugami: Claude je pomagal zgraditi merilnik

4:25 Zdaj pa ta vrstica z zaslugami. Readme priznava, da je bil velik del repozitorija napisan s pomočjo Claudea, ki je model, ki se meri. Torej je Claude pomagal zgraditi merilnik, ki preverja, ali je Claude postal manj inteligenten. Zato so ocenjevalci preproste funkcije. Po avtorjevih besedah, avtorju ne bi smeli zaupati, človeškemu ali drugemu. Če bi to raje prebrali, kot pa slišali, da to povem, razlika pristane v vaši e-pošti

4:46 vsako jutro, brezplačno na the daily diff dot dev, povezava spodaj. Torej, današnja sodba o live nerf.

Sodba: SHIP IT, in ne citirajte pred 24. oktobrom

4:51 SHIP IT. Jaz bi ga izdal, ker je to prvi argument o 'nerfu', ki sem ga videl z časovnim žigom, javno knjigo pravil in določeno slepo pego. Samo ne citirajte ga pred štiriindvajsetim oktobrom. In to je današnja razlika. Sem Niko iz Axrisi. Združite odgovorno.

Viri

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Povezani videoposnetki