# Paano makita ang paghina ng Claude (na may totoong datos)

Published: 2026-09-30

Sabi ng mga tao, bumababa ang galing ni Claude pagkaraan ng ilang linggo sa bawat paglunsad. Isang developer ang naglagay ng Claude Opus 5.5 sa isang 30-araw na orasan mula sa linggo ng paglunsad, na may mga nakapirming tanong, nakapirming Claude Code at pampublikong patakaran, at ipinapakita nito kung bakit walang nakakaalam dati, at kung bakit ang iyong token count ang dapat bantayan. Pasya: SHIP IT.

Canonical: https://thedailydiff.dev/fil/video/2026-09-30-opus-nerf-meter/

## Ang sakop ng video na ito

- Bumababa ang galing ni Claude pagkaraan ng paglunsad: ang teorya ay sumasalamin sa isang day-zero na orasan
- livenerf: isang 30-araw na orasan sa Opus 5.5 mula sa linggo ng paglunsad
- Paano makita ang paghina: 78 tanong na kung minsan ay tama
- Ano ang nakikita nito: 7.5 puntos, at ang bilang ng token ay unang gumagalaw
- Ang blind spot: isang Opus 5 swap at 8 maling susi sa sagot

## Mga Kabanata

- 0:00 Bumababa ang galing ni Claude pagkaraan ng paglunsad: ang teorya ay sumasalamin sa isang day-zero na orasan
- 0:26 livenerf: isang 30-araw na orasan sa Opus 5.5 mula sa linggo ng paglunsad
- 1:24 Paano makita ang paghina: 78 tanong na kung minsan ay tama
- 2:19 Ano ang nakikita nito: 7.5 puntos, at ang bilang ng token ay unang gumagalaw
- 2:53 Ang blind spot: isang Opus 5 swap at 8 maling susi sa sagot
- 3:08 Anthropic: hindi namin binabawasan ang kalidad ng modelo
- 3:45 Lihim ang mga bilang ng data center; naglalathala ang Backblaze
- 4:25 Ang linya ng mga kredito: Tumulong si Claude na buuin ang metro
- 4:50 Pasya: SHIP IT, at huwag itong sipiin bago ang Oktubre 24

## Isinaling transcript

Isinalin mula sa orihinal na salaysay sa English. Ang available na audio at mga caption ay kinokontrol ng YouTube.

### Bumababa ang galing ni Claude pagkaraan ng paglunsad: ang teorya ay sumasalamin sa isang day-zero na orasan

0:00 Alam ng lahat na bumababa ang galing ni Claude ilang linggo pagkatapos ng paglunsad. Kaya isang developer ang naglagay ng Opus 5.5 sa isang orasan mula sa linggo ng paglunsad, at sinasabi ng orasan na walang nakakaalam pa. Sa video na ito, tatlong tanong. Paano mo mahuhuli ang paghina? Ano ang nakikita ng metrong ito? At ano ang sinasabi ng Anthropic? At isang linya sa mga kredito ng repo ang nagpatawa sa akin.

0:20 Babanggitin ko iyon sa huli. Miyerkules ngayon, Setyembre 30, at ito ang The Daily Diff. Tatlong kwento ngayon, at ang malaki ay isang GitHub repo na tinatawag na live nerf.

### livenerf: isang 30-araw na orasan sa Opus 5.5 mula sa linggo ng paglunsad

0:30 Sa loob ng maraming buwan, sinasabi ng mga tao na tahimik na pinapahina ng Anthropic ang mga modelo nito pagkatapos ng paglunsad. Ang karaniwang mga teorya ay isang piniga na modelo, isang mas maliit na modelo sa ilalim ng parehong pangalan o simpleng mas kaunting pag-iisip. Tinatawag ng repo ang bawat argumento sa ngayon na vibes kumpara sa vibes. Ang Opus 5.5 ay inilabas noong Setyembre 22, at isang linggo na ang nakakaraan sinabi ko sa iyo na ito ang nanguna sa independent board habang nagsusulat ng tatlong beses na mas maraming salita kaysa sa median model. Dalawa at kalahating araw pa lang, isang developer na tinatawag na ninja hawk ang nagsimula ng orasan,

0:59 isang beses sa isang araw sa loob ng 30 araw, na may mga log na walang maaaring mag-edit. Ang Hacker News thread ay umabot sa halos 800 puntos at nahati tulad ng isang team chat. Isang komentarista ang nagsasabing ang pagpapahina ng mga modelo ay hindi totoo sa karamihan ng iniulat na mga kaso. Ang isa pa ay nagsasabing nasasanay lamang ang mga tao sa bagong antas ng intelligence. At isang power user ng Claude Code ngayon ay binabalewala ang pop-up na 'rate-this-session' sa bawat pagkakataon, dahil ang pag-rate kay Claude ay tila nagpapalala nito. Peer review. Kaya, tanong isa, paano mo mahuhuli ang paghina?

### Paano makita ang paghina: 78 tanong na kung minsan ay tama

1:27 Nagsisimula ka sa halos 2300 mahihirap na tanong sa pagsusulit, at 93 porsiyento ng Opus ang tama sa unang subok, na walang silbi para sa isang detector, dahil ang isang tanong na palaging tama ay hindi bumababa. 97 porsiyento ay palaging tama o palaging mali, at ang 78 na kung minsan lang tama ang naging panel. Parehong prompt, walang tools, at exact-match grading na walang AI judge, dahil ang judge ay liliko din. Tumatakbo ito sa isang Max na subscription sa pamamagitan ng headless Claude Code,

1:55 dahil ang API version ay nagkakahalaga ng humigit-kumulang 1600 dolyares sa isang buwan. At ang Claude Code version ay nakapako, dahil, sa mga salita ng repo, ang isang nabagong harness ay mukhang eksakto tulad ng isang nabagong modelo. Ang mga istatistika ay nagmula sa isang papel na tinatawag na 'Adding Error Bars to Evals', ni Evan Miller sa Anthropic. Kaya ang sariling matematika ng Anthropic ngayon ay nag-o-audit sa Anthropic, na siyang akademikong bersyon ng pagsipi ng mga tuntunin ng serbisyo pabalik sa customer support.

### Ano ang nakikita nito: 7.5 puntos, at ang bilang ng token ay unang gumagalaw

2:19 Tanong dalawa, ano ang nakikita nito? Bawat 10-araw na bintana, isang pagbaba ng humigit-kumulang 7.5 puntos. Upang patunayan na gumagana ang rig, sadyang binawasan ng may-akda ang pagsisikap ni Claude. Ang medium effort ay nagbawas ng output ng halos isang-kapat, at ang score ng apat na puntos lamang. Ang low effort ay nagbawas ng output ng halos dalawang-katlo, para sa walong puntos. Iyan ang parte na dapat kopyahin. Ang mas kaunting pag-iisip ay lumalabas sa bilang ng token bago ito lumabas sa mga sagot.

2:43 Kaya i-pin ang iyong bersyon ng modelo, i-log ang mga output token bawat gawain, at panatilihin ang ilang nakapirming tanong mo. Kung ang iyong ahente ay biglang nagsusulat ng mas maikli, tingnan ang iyong mga log bago mo tingnan ang Reddit. At heto ang matapat na bahagi.

### Ang blind spot: isang Opus 5 swap at 8 maling susi sa sagot

2:54 Ang tahimik na pagpapalit ng mas lumang Opus 5 ay napakaliit na pagbabago para tawagin ng rig, at sinasabi ito agad sa readme. Nakakita din ang audit ng walong susi sa sagot na mukhang mali, kaya ang nerf detector ay nakakita ng mga bug sa benchmark bago ito nakakita ng nerf.

### Anthropic: hindi namin binabawasan ang kalidad ng modelo

3:08 Tanong tatlo, ano ang sinasabi ng Anthropic? Noong nakaraang taon, pagkatapos ng sunod-sunod na reklamo, naglathala ang Anthropic ng isang postmortem. Sinasabi nito, quote, hindi namin binabawasan ang kalidad ng modelo dahil sa demand, oras ng araw o load ng server. Inamin ng parehong post na tatlong bug ang nagpababa kay Claude, at halos isang-katlo ng mga gumagamit ng Claude Code ang nakaranas ng maling server kahit minsan. Kaya ang mga reklamo ay totoo at ang sanhi ay mga bug, kaya ang repo ay nagbabala na ang linggo ng paglunsad ay maaaring ang pinakamalalang linggo.

3:35 Anim sa 30 araw ay tapos na. Ang unang posibleng tawag ay darating sa paligid ng Oktubre 24, kaya ang tapat na sagot ay walang nakakaalam, kasama ang lahat ng sigurado. Nabanggit ang mga numerong walang naglalathala.

### Lihim ang mga bilang ng data center; naglalathala ang Backblaze

3:46 Natuklasan ng Lighthouse Reports at ng pahayagang Olandes na Trouw na ang karamihan ng mga data center sa Europa ay itinatago ang kanilang paggamit ng kuryente at tubig, bagama't isang panuntunan ng EU ang nag-atas ng pag-uulat sa loob ng tatlong taon. Sa Netherlands, mas mababa sa isang-kapat ang naglalathala. Isang data center ng Microsoft lang ang gumagamit ng halos isang porsiyento ng kuryente ng Netherlands. Samantala, ginawa ulit ng Backblaze ang nakababagot na bagay. Sinasaklaw ng quarterly drive stats nito ang humigit-kumulang 350,000 hard drive, at ang rate ng pagkabigo ay tumaas sa 1.73 porsiyento,

4:16 ang pinakamataas sa ilang panahon. Tatlong modelo ng Seagate ang walang pagkabigo. Ganyan ang hitsura ng isang pampublikong baseline, quarter after quarter, sa loob ng 13 taon.

### Ang linya ng mga kredito: Tumulong si Claude na buuin ang metro

4:25 Ngayon, ang linya ng mga kredito na iyon. Inamin ng readme na marami sa repo ay isinulat sa tulong ni Claude, na siyang modelo na sinusukat. Kaya tumulong si Claude na buuin ang metro na nagsusuri kung bumaba ang galing ni Claude. Kaya ang mga grader ay simpleng function. Sa mga salita ng may-akda, hindi mo dapat pagkatiwalaan ang may-akda, tao man o iba pa. Kung mas gusto mong basahin ito kaysa pakinggan akong sabihin ito, ang diff ay dumarating sa iyong inbox

4:46 tuwing umaga, libre sa the daily diff dot dev, link sa ibaba. Kaya, ang pasya ngayon sa live nerf.

### Pasya: SHIP IT, at huwag itong sipiin bago ang Oktubre 24

4:51 SHIP IT. Ipapares ko ito dahil ito ang unang argumento ng nerf na nakita ko na may timestamp, isang pampublikong rulebook at isang nakasaad na blind spot. Huwag lang itong sipiin bago ang Oktubre 24. At iyan ang diff para ngayon. Ako si Niko mula sa Axrisi. Pagsamahin nang responsable.

## Mga Pinagmulan

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
