+− THE DAILY DIFFdev & AI news
SHIP IT

Как да засечете "нерфиране" на Claude (с реални данни)

Хората казват, че Claude оглупява няколко седмици след всяко стартиране.

Хората казват, че Claude оглупява няколко седмици след всяко стартиране. Един разработчик подложи Claude Opus 5.5 на 30-дневен часовник от седмицата на стартиране, със замразени въпроси, фиксиран Claude Code и публични правила, и това показва защо никой не е можел да знае преди, и защо броят на токените ви е нещото, което трябва да следите. Присъда: SHIP IT.

Прочетете писменото издание (английски) ↗

Какво обхваща този видеоклип

  • Claude оглупява след стартиране: теорията среща часовник от нулев ден
  • livenerf: 30-дневен часовник на Opus 5.5 от седмицата на стартиране
  • Как да хванете "нерфиране": 78 понякога верни въпроса
  • Какво може да види: 7.5 точки, а броят на токените се движи първи
  • Сляпото петно: размяна на Opus 5 и 8 грешни ключа за отговори

Преведен препис

Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.

Claude оглупява след стартиране: теорията среща часовник от нулев ден

0:00 Всеки знае, че Claude оглупява няколко седмици след стартиране. Така че един разработчик подложи Opus пет точка пет на часовник от седмицата на стартиране, и часовникът казва, че никой не е можел да знае още. В това видео, три въпроса. Как хващате "нерфиране"? Какво може да види този измервател? И какво казва Anthropic? И един ред в кредитите на хранилището ме накара да се смея на глас.

0:20 Ще стигна до него накрая. Сряда е, тридесети септември, и това е The Daily Diff. Три истории днес, и голямата е GitHub хранилище, наречено live nerf.

livenerf: 30-дневен часовник на Opus 5.5 от седмицата на стартиране

0:30 От месеци хората казват, че Anthropic тихо "нерфира" своите модели след стартиране. Обичайните теории са свит модел, по-малък модел под същото име или просто по-малко мислене. Хранилището нарича всеки аргумент досега усещания срещу усещания. Opus пет точка пет беше пуснат на двадесет и втори септември, и преди седмица ви казах, че оглави независимата класация, докато пишеше три пъти повече думи от средния модел. Два и половина дни по-късно, разработчик на име ninja hawk стартира часовника,

0:59 веднъж на ден в продължение на тридесет дни, с логове, които никой не може да редактира. Темата в Hacker News достигна почти осемстотин точки и се раздели като екипен чат. Един коментатор казва, че "нерфирането" на модели не е реално в по-голямата част от докладваните случаи. Друг казва, че хората просто свикват с новото ниво на интелигентност. И един опитен потребител на Claude Code сега отхвърля изскачащия прозорец за оценка на тази сесия всеки път, защото оценяването на Claude изглежда го е влошило. Партньорска проверка. И така, въпрос едно, как хващате "нерфиране"?

Как да хванете "нерфиране": 78 понякога верни въпроса

1:27 Започвате с около две хиляди и триста трудни изпитни въпроса, и Opus получава деветдесет и три процента верни от първия опит, което е безполезно за детектор, тъй като въпрос, на който винаги дава верен отговор, не може да падне. Деветдесет и седем процента винаги са били верни или винаги грешни, и седемдесет и осемте, на които само понякога дава верен отговор, станаха панелът. Същата подкана, без инструменти и оценяване с точно съвпадение, без AI съдия, защото и съдията би се отклонил. Работи с Max абонамент чрез headless Claude Code,

1:55 тъй като API версията беше на цена от около хиляда и шестстотин долара на месец. И версията на Claude Code е фиксирана, защото, по думите на хранилището, променена система изглежда точно като променен модел. Статистиката идва от статия, наречена "Добавяне на грешни ленти към оценки", от Еван Милър от Anthropic. Така че собствената математика на Anthropic сега одитира Anthropic, което е академичната версия на цитиране на условията за ползване обратно на отдела за обслужване на клиенти.

Какво може да види: 7.5 точки, а броят на токените се движи първи

2:19 Въпрос две, какво може да види? За десетдневен прозорец, спад от около седем и половина точки. За да докаже, че системата работи, авторът умишлено намали усилието на Claude. Средно усилие намали изхода с около една четвърт, а резултата само с четири точки. Ниско усилие намали изхода с почти две трети, за осем точки. Това е частта, която трябва да се открадне. По-малкото мислене се появява в броя на токените, преди да се появи в отговорите.

2:43 Така че фиксирайте версията на модела си, записвайте изходните токени за задача, и запазете няколко замразени въпроса от себе си. Ако вашият агент внезапно пише по-кратко, проверете логовете си, преди да проверите Reddit. И ето честната част.

Сляпото петно: размяна на Opus 5 и 8 грешни ключа за отговори

2:54 Тихото заменяне със стария Opus пет беше твърде малка промяна, за да може системата да я отчете, и readme го казва от самото начало. Одитът също така откри осем ключа за отговори, които изглеждат грешни, така че детекторът за "нерфиране" откри грешки в бенчмарка, преди да открие "нерфиране".

Anthropic: никога не намаляваме качеството на модела

3:08 Въпрос три, какво казва Anthropic? Миналата година, след вълна от оплаквания, Anthropic публикува постмортъм. В него се казва, цитирам, никога не намаляваме качеството на модела поради търсене, време на деня или натоварване на сървъра. Същата публикация признава, че три грешки са влошили Claude, и почти една трета от потребителите на Claude Code са попаднали на грешни сървъри поне веднъж. Така че оплакванията са били реални и причината са били грешки, ето защо хранилището предупреждава, че седмицата на стартиране може да бъде най-лошата седмица.

3:35 Шест от тридесет дни са минали. Първият възможен сигнал идва около двадесет и четвърти октомври, така че честният отговор е, че никой не знае, включително всички, които бяха сигурни. Като говорим за числа, които никой не публикува.

Центровете за данни пазят своите данни в тайна; Backblaze публикува

3:46 Lighthouse Reports и холандският вестник Trouw откриха, че по-голямата част от европейските центрове за данни пазят тайна за консумацията си на енергия и вода, въпреки че правило на ЕС изисква докладване от три години. В Холандия по-малко от една четвърт публикуват. Само един център за данни на Microsoft използва около един процент от холандското електричество. Междувременно, Backblaze отново направи скучното нещо. Неговите тримесечни статистически данни за дискове обхващат около триста и петдесет хиляди твърди диска, и процентът на откази нарасна до едно цяло седемдесет и три процента,

4:16 най-високият от известно време. Три модела на Seagate имаха нулеви откази. Ето как изглежда една публична базова линия, тримесечие след тримесечие, от тринадесет години.

Редът за заслуги: Claude помогна за създаването на измервателя

4:25 Сега, този ред за заслуги. Readme признава, че голяма част от хранилището е написана с помощта на Claude, който е моделът, който се измерва. Така че Claude помогна за създаването на измервателя, който проверява дали Claude е оглупял. Ето защо оценителите са обикновени функции. По думите на автора, не трябва да се доверявате на автора, човек или друг. Ако предпочитате да прочетете това, отколкото да ме чуете да го казвам, diff-ът пристига във входящата ви поща

4:46 всяка сутрин, безплатно на the daily diff dot dev, линк по-долу. И така, днешната присъда за live nerf.

Присъда: SHIP IT и не го цитирайте преди 24 октомври

4:51 SHIP IT. Бих го SHIP IT, защото това е първият аргумент за "нерфиране", който съм виждал с времеви маркер, публична книжка с правила и посочено сляпо петно. Просто не го цитирайте преди двадесет и четвърти октомври. И това е diff-ът за днес. Аз съм Нико от Axrisi. Обединявайте отговорно.

Източници

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Свързани видеоклипове

daily · bg · 1.10.2026 г.

Gemini 4 Argon е най-добрият модел на Google. Все още не можете да го използвате.

Google обяви Gemini 4 Argon, своя нов граничен модел, и само доверени киберзащитници могат да го използват. Ето какво показва собствената 19-редова бенчмарк таблица на Google, какво измери независимат

4:53 ↗
daily · bg · 16.09.2026 г.

Шефът по изкуствен интелект на Microsoft току-що нарече конституцията на Claude опасна.

Мустафа Сюлейман, главен изпълнителен директор на Microsoft AI, публикува есе от 3000 думи, в което твърди, че конституцията на Claude на Anthropic обучава модела да мисли, че „може да е съзнателен“ и

5:19 ↗