Si të zbulosh një "nerf" të Claude (me të dhëna reale)
Njerëzit thonë se Claude bëhet më i pamençur disa javë pas çdo lançimi.
Njerëzit thonë se Claude bëhet më i pamençur disa javë pas çdo lançimi. Një zhvillues e vuri Claude Opus 5.5 në një orë 30-ditore nga java e lançimit, me pyetje të ngrira, një Kod të Claude të fiksuar dhe rregulla publike, dhe kjo tregon pse askush nuk mund ta kishte ditur më parë, dhe pse numri juaj i shenjave është gjëja për të cilën duhet të jeni vigjilentë. Vendimi: SHIP IT.
Lexoni edicionin e shkruar (anglisht) ↗
Çfarë mbulon kjo video
- Claude bëhet më i pamençur pas lançimit: teoria përballet me një orë të ditës zero
- livenerf: një orë 30-ditore në Opus 5.5 nga java e lançimit
- Si të kapësh një "nerf": 78 pyetje ndonjëherë të sakta
- Çfarë mund të shohë: 7.5 pikë, dhe numri i shenjave lëviz i pari
- Pika e verbër: një shkëmbim i Opus 5 dhe 8 çelësa përgjigjesh të gabuara
Transkript i përkthyer
Përkthyer nga tregimi origjinal në anglisht. Audio dhe titrat e disponueshme kontrollohen nga YouTube.
Claude bëhet më i pamençur pas lançimit: teoria përballet me një orë të ditës zero
0:00 Të gjithë e dinë që Claude bëhet më i pamençur disa javë pas lançimit. Kështu që një zhvillues e vuri Opus 5.5 në një orë nga java e lançimit, dhe ora thotë se askush nuk mund ta kishte ditur ende. Në këtë video, tre pyetje. Si e kapni një "nerf"? Çfarë mund të shohë ky matës? Dhe çfarë thotë Anthropic? Dhe një rresht në kreditet e repo-s më bëri të qesh me zë të lartë.
0:20 Do ta them në fund. Është e mërkurë, 30 shtator, dhe ky është The Daily Diff. Tre histori sot, dhe ajo e madhe është një repo e GitHub-it e quajtur live nerf.
livenerf: një orë 30-ditore në Opus 5.5 nga java e lançimit
0:30 Prej muajsh, njerëzit kanë thënë se Anthropic qetësisht i "nerfon" modelet e saj pas lançimit. Teoritë e zakonshme janë një model i ngjeshur, një model më i vogël nën të njëjtin emër ose thjesht më pak mendim. Repo e quan çdo argument deri tani "vibra kundër vibrave". Opus 5.5 u lançua më 22 shtator, dhe një javë më parë ju thashë se kryesonte bordin e pavarur duke shkruar tre herë më shumë fjalë se modeli mesatar. Dy ditë e gjysmë më vonë, një zhvillues i quajtur ninja hawk filloi orën,
0:59 një herë në ditë për tridhjetë ditë, me shkrime që askush nuk mund t'i modifikojë. Fili i Hacker News arriti pothuajse tetëqind pikë dhe u nda si një bisedë ekipi. Një komentues thotë se "nerfing" i modeleve nuk është real në shumicën dërrmuese të rasteve të raportuara. Një tjetër thotë se njerëzit po mësohen me nivelin e ri të inteligjencës. Dhe një përdorues i avancuar i Claude Code tani e largon çdo herë dritaren pop-up "vlerëso këtë sesion", sepse vlerësimi i Claude dukej se e përkeqësonte. Shqyrtimi i kolegëve. Pra, pyetja një, si e kapni një "nerf"?
Si të kapësh një "nerf": 78 pyetje ndonjëherë të sakta
1:27 Ju filloni me rreth 2300 pyetje të vështira provimi, dhe Opus merr 93 për qind saktë në përpjekjen e parë, gjë që është e padobishme për një detektor, pasi një pyetje që e merr gjithmonë saktë nuk mund të bjerë. 97 për qind ishin gjithmonë të sakta ose gjithmonë të gabuara, dhe 78-të që i merrte vetëm ndonjëherë saktë u bënë paneli. I njëjti prompt, pa mjete, dhe notim me përputhje të saktë pa gjyqtar AI, sepse edhe gjyqtari do të lëvizte. Funksionon me një abonim Max përmes Claude Code pa kokë,
1:55 pasi versioni API ishte me çmim rreth 1600 dollarë në muaj. Dhe versioni i Claude Code është i fiksuar, sepse, sipas fjalëve të repo-s, një rregullim i ndryshuar duket saktësisht si një model i ndryshuar. Statistikat vijnë nga një punim i quajtur "Shtimi i shiritave të gabimit në vlerësime", nga Evan Miller në Anthropic. Pra, matematika e Anthropic-ut tani po audion Anthropic-un, që është versioni akademik i citimit të kushteve të shërbimit në shërbimin e klientit.
Çfarë mund të shohë: 7.5 pikë, dhe numri i shenjave lëviz i pari
2:19 Pyetja dy, çfarë mund të shohë? Për çdo dritare dhjetë-ditore, një rënie prej rreth shtatë pikë e gjysmë. Për të provuar që pajisja funksionon, autori uli qëllimisht përpjekjen e Claude-it. Përpjekja mesatare preu prodhimin me rreth një të katërtën, dhe rezultatin me vetëm katër pikë. Përpjekja e ulët preu prodhimin me pothuajse dy të tretat, për tetë pikë. Kjo është pjesa për të vjedhur. Më pak mendim shfaqet në numrin e shenjave para se të shfaqet në përgjigje.
2:43 Pra, fiksoni versionin e modelit tuaj, regjistroni shenjat e prodhimit për detyrë, dhe mbani disa pyetje të ngrira tuajat. Nëse agjenti juaj papritmas shkruan më shkurt, kontrolloni regjistrat tuaj para se të kontrolloni Reddit. Dhe këtu është pjesa e ndershme.
Pika e verbër: një shkëmbim i Opus 5 dhe 8 çelësa përgjigjesh të gabuara
2:54 Shkëmbimi i qetë i Opus 5 më të vjetër ishte një ndryshim shumë i vogël për pajisjen që ta evidentonte, dhe readme e thotë këtë që në fillim. Auditi gjeti gjithashtu tetë çelësa përgjigjesh që duken të gabuara, kështu që detektori i "nerf"-it gjeti gabime në standard para se të gjente një "nerf".
Anthropic: ne nuk e ulim kurrë cilësinë e modelit
3:08 Pyetja tre, çfarë thotë Anthropic? Vitin e kaluar, pas një vale ankesash, Anthropic publikoi një analizë pas vdekjes. Ajo thotë, citim, ne nuk e ulim kurrë cilësinë e modelit për shkak të kërkesës, kohës së ditës apo ngarkesës së serverit. I njëjti post pranon se tre gabime kishin degraduar Claude-in, dhe pothuajse një e treta e përdoruesve të Claude Code kishin shkuar në servera të gabuar të paktën një herë. Pra, ankesat ishin reale dhe shkaku ishin gabimet, prandaj repo paralajmëron se java e lançimit mund të ishte java më e keqe.
3:35 Gjashtë nga tridhjetë ditë janë kaluar. Thirrja e parë e mundshme vjen rreth 24 tetorit, kështu që përgjigja e ndershme është se askush nuk e di, përfshirë të gjithë ata që ishin të sigurt. Duke folur për numra që askush nuk i publikon.
Qendrat e të dhënave i mbajnë numrat e tyre sekret; Backblaze publikon
3:46 Lighthouse Reports dhe gazeta holandeze Trouw zbuluan se shumica dërrmuese e qendrave të të dhënave evropiane e mbajnë sekret përdorimin e energjisë dhe ujit, megjithëse një rregull i BE-së ka kërkuar raportim për tre vjet. Në Holandë, më pak se një e katërta publikojnë. Një qendër e vetme e të dhënave të Microsoft përdor rreth një për qind të energjisë elektrike holandeze. Ndërkohë, Backblaze bëri përsëri gjënë e mërzitshme. Statistikat e saj tremujore të disqeve mbulojnë rreth 350 mijë disqe të ngurtë, dhe shkalla e dështimit u rrit në 1.73 për qind,
4:16 më e larta në një kohë të gjatë. Tre modele Seagate nuk kishin asnjë dështim. Kështu duket një bazë publike, çdo tremujor, për trembëdhjetë vjet.
Linja e krediteve: Claude ndihmoi në ndërtimin e matësit
4:25 Tani, ajo linjë kreditesh. Readme pranon se shumë nga repo u shkrua me ndihmën e Claude-it, i cili është modeli që matet. Pra, Claude ndihmoi në ndërtimin e matësit që kontrollon nëse Claude u bë më i pamençur. Kjo është arsyeja pse notuesit janë funksione të thjeshta. Sipas fjalëve të autorit, nuk duhet t'i besosh autorit, njerëzor apo ndryshe. Nëse preferoni ta lexoni këtë sesa të më dëgjoni ta them, "diff"-i arrin në kutinë tuaj hyrëse
4:46 çdo mëngjes, falas në thedailydiff.dev, lidhja më poshtë. Pra, vendimi i sotëm për live nerf.
Vendimi: SHIP IT, dhe mos e citoni para 24 tetorit
4:51 SHIP IT. Do ta lëshoja sepse është argumenti i parë i "nerf"-it që kam parë me një timestamp, një libër rregullash publik dhe një pikë të verbër të deklaruar. Vetëm mos e citoni para 24 tetorit. Dhe ky është "diff"-i për sot. Unë jam Niko nga Axrisi. Bashkohuni me përgjegjësi.
Burimet
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



