Як выявіць нерф Claude (з рэальнымі дадзенымі)
Людзі кажуць, што Claude тупее праз некалькі тыдняў пасля кожнага запуску.
Людзі кажуць, што Claude тупее праз некалькі тыдняў пасля кожнага запуску. Адзін распрацоўшчык запусціў Claude Opus 5.5 на 30-дзённы адлік з моманту запуску, з замарожанымі пытаннямі, замацаваным кодам Claude і публічнымі правіламі, і гэта паказвае, чаму ніхто не мог ведаць раней, і чаму колькасць вашых токенаў - гэта тое, за чым трэба сачыць. Вердыкт: SHIP IT.
Чытаць пісьмовае выданне (англійская) ↗
Што ахоплівае гэта відэа
- Claude тупее пасля запуску: тэорыя сустракаецца з адлікам з нулявога дня
- livenerf: 30-дзённы адлік Opus 5.5 з тыдня запуску
- Як злавіць нерф: 78 часам правільных пытанняў
- Што ён бачыць: 7.5 балаў, і колькасць токенаў рухаецца першай
- Сляпая пляма: замена Opus 5 і 8 няправільных ключоў адказаў
Перакладзеная стэнаграма
Перакладзена з арыгінальнай англійскай агучкі. Даступнае аўдыя і субтытры кантралююцца YouTube.
Claude тупее пасля запуску: тэорыя сустракаецца з адлікам з нулявога дня
0:00 Усе ведаюць, што Claude тупее праз некалькі тыдняў пасля запуску. Такім чынам, адзін распрацоўшчык запусціў Opus 5.5 на адлік з тыдня запуску, і адлік кажа, што ніхто не мог ведаць пра гэта. У гэтым відэа тры пытанні. Як злавіць нерф? Што можа бачыць гэты лічыльнік? І што кажа Anthropic? І адзін радок у крэдытах рэпазіторыя прымусіў мяне гучна засмяяцца.
0:20 Я дабяруся да гэтага ў канцы. Сёння серада, трыццатага верасня, і гэта The Daily Diff. Тры гісторыі сёння, і галоўная — гэта рэпазіторый GitHub пад назвай live nerf.
livenerf: 30-дзённы адлік Opus 5.5 з тыдня запуску
0:30 На працягу некалькіх месяцаў людзі казалі, што Anthropic ціха нерфуе свае мадэлі пасля запуску. Звычайныя тэорыі - гэта сціснутая мадэль, меншая мадэль пад той жа назвай ці проста менш разважанняў. Рэпазіторый называе кожны аргумент да гэтага часу «вайбы супраць вайбаў». Opus 5.5 быў выпушчаны 22 верасня, і тыдзень таму я казаў вам, што ён узначаліў незалежную дошку, напісаўшы ў тры разы больш слоў, чым сярэдняя мадэль. Праз два з паловай дні распрацоўшчык па імі ninja hawk запусціў адлік,
0:59 раз у дзень на працягу трыццаці дзён, з журналамі, якія ніхто не можа рэдагаваць. Тэма Hacker News набрала амаль восемсот балаў і падзялілася як каманда чат. Адзін каментатар кажа, што нерф мадэляў не рэальны ў пераважнай большасці выпадкаў, пра якія паведамляецца. Іншы кажа, што людзі проста прывыкаюць да новага ўзроўню інтэлекту. І адзін вопытны карыстальнік Claude Code цяпер адмаўляецца ад усплывальнага акна «ацаніць гэтую сесію» кожны раз, таму што ацэнка Claude, здавалася, пагаршала яго. Рэцэнзаванне. Такім чынам, пытанне першае: як злавіць нерф?
Як злавіць нерф: 78 часам правільных пытанняў
1:27 Вы пачынаеце з прыкладна дзвюх тысяч трохсот складаных экзаменацыйных пытанняў, і Opus атрымлівае дзевяноста тры працэнты правільных з першай спробы, што бескарысна для дэтэктара, бо пытанне, на якое ён заўсёды правільна адказвае, не можа знізіцца. Дзевяноста сем працэнтаў былі заўсёды правільнымі або заўсёды няправільнымі, і семдзесят восем, на якія ён толькі часам правільна адказвае, сталі панэллю. Той жа запыт, без інструментаў, і дакладная ацэнка супадзення без суддзі AI, таму што суддзя таксама б дрэйфаваў. Ён працуе па падпісцы Max праз headless Claude Code,
1:55 паколькі версія API каштавала каля шаснаццацісот долараў у месяц. І версія Claude Code замацавана, таму што, па словах рэпазіторыя, змененая абвязка выглядае сапраўды гэтак жа, як і змененая мадэль. Статыстыка ўзята з дакумента пад назвай «Даданне палос памылак да ацэнак», Эвана Мілера з Anthropic. Такім чынам, уласная матэматыка Anthropic цяпер праводзіць аўдыт Anthropic, што з'яўляецца акадэмічнай версіяй цытавання ўмоў абслугоўвання ў адказ на падтрымку кліентаў.
Што ён бачыць: 7.5 балаў, і колькасць токенаў рухаецца першай
2:19 Пытанне другое: што ён бачыць? На кожнае дзесяцідзённае акно прыпадае падзенне прыкладна на сем з паловай балаў. Каб даказаць працаздольнасць сістэмы, аўтар наўмысна знізіў намаганні Claude. Сярэднія намаганні скарацілі вынік прыкладна на чвэрць, а бал — толькі на чатыры пункты. Нізкія намаганні скарацілі вынік амаль на дзве траціны, на восем балаў. Гэта частка, якую трэба скрасці. Менш думання выяўляецца ў колькасці токенаў раней, чым у адказах.
2:43 Такім чынам, замацуйце версію мадэлі, запісвайце выходныя токены на заданне, і захавайце некалькі ўласных замарожаных пытанняў. Калі ваш агент раптам пачынае пісаць карацей, праверце свае журналы, перш чым праверыць Reddit. І вось сумленная частка.
Сляпая пляма: замена Opus 5 і 8 няправільных ключоў адказаў
2:54 Ціхая замена на старэйшы Opus 5 была занадта малой зменай для сістэмы, каб яе зафіксаваць, і ў readme пра гэта адразу сказана. Аўдыт таксама выявіў восем ключоў адказаў, якія выглядаюць няправільнымі, так што дэтэктар нерфа знайшоў памылкі ў бенчмарку, перш чым знайшоў нерф.
Anthropic: мы ніколі не зніжаем якасць мадэлі
3:08 Пытанне трэцяе: што кажа Anthropic? У мінулым годзе, пасля хвалі скаргаў, Anthropic апублікаваў паслясмертны аналіз. Там сказана, цытата, мы ніколі не зніжаем якасць мадэлі з-за попыту, часу сутак або нагрузкі на сервер. У тым жа паведамленні прызнаецца, што тры памылкі пагоршылі Claude, і амаль траціна карыстальнікаў Claude Code хаця б адзін раз трапляла на няправільныя серверы. Такім чынам, скаргі былі рэальнымі, а прычынай былі памылкі, таму ў рэпазіторыі папярэджваецца, што тыдзень запуску можа быць найгоршым тыднем.
3:35 Шэсць з трыццаці дзён прайшлі. Першы магчымы выклік прыпадае прыкладна на 24 кастрычніка, таму сумленны адказ заключаецца ў тым, што ніхто не ведае, уключаючы ўсіх, хто быў упэўнены. Дарэчы, пра лічбы, якія ніхто не публікуе.
Цэнтры апрацоўкі дадзеных трымаюць свае лічбы ў сакрэце; Backblaze публікуе
3:46 Lighthouse Reports і галандская газета Trouw выявілі, што пераважная большасць еўрапейскіх цэнтраў апрацоўкі дадзеных трымаюць у сакрэце спажыванне электраэнергіі і вады, хоць правіла ЕС патрабуе справаздачнасці на працягу трох гадоў. У Нідэрландах публікуе менш за чвэрць. Адзін цэнтр апрацоўкі дадзеных Microsoft сам па сабе выкарыстоўвае каля аднаго працэнта галандскай электраэнергіі. Тым часам Backblaze зноў зрабіў сумную справу. Яго квартальная статыстыка дыскаў ахоплівае каля трохсот пяцідзесяці тысяч жорсткіх дыскаў, і частата збояў вырасла да 1.73 працэнта,
4:16 самая высокая за апошні час. Тры мадэлі Seagate мелі нуль збояў. Вось як выглядае публічная базавая лінія, квартал за кварталам, на працягу трынаццаці гадоў.
Радок крэдытаў: Claude дапамог стварыць лічыльнік
4:25 Цяпер, гэты радок крэдытаў. У readme прызнаецца, што большая частка рэпазіторыя была напісана з дапамогай Claude, што з'яўляецца мадэллю, якая вымяраецца. Такім чынам, Claude дапамог пабудаваць лічыльнік, які правярае, ці стаў Claude тупейшым. Вось чаму ацэншчыкі з'яўляюцца простымі функцыямі. Па словах аўтара, вы не павінны давяраць аўтару, чалавеку ці іншаму. Калі вы аддаеце перавагу прачытаць гэта, чым пачуць мяне, адрозненні прыходзяць у вашу паштовую скрыню
4:46 кожную раніцу, бясплатна на the daily diff dot dev, спасылка ніжэй. Такім чынам, сённяшні вердыкт па live nerf.
Вердыкт: SHIP IT, і не цытуйце гэта да 24 кастрычніка
4:51 SHIP IT. Я б адправіў яго, таму што гэта першы аргумент нерфа, які я бачыў з часовай адзнакай, публічнай кнігай правілаў і заяўленай сляпой плямай. Проста не цытуйце гэта да 24 кастрычніка. І гэта адрозненне на сёння. Я Ніка з Axrisi. Аб'ядноўвайце адказна.
Крыніцы
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



