# Як виявити нерф Claude (з реальними даними)

Published: 2026-09-30

Кажуть, Claude тупішає через кілька тижнів після кожного запуску. Один розробник запустив Claude Opus 5.5 з 30-денним відліком від тижня запуску, з замороженими питаннями, закріпленим кодом Claude та публічними правилами, і це показує, чому ніхто не міг знати раніше, і чому кількість токенів є тим, на що варто звертати увагу. Вердикт: SHIP IT.

Canonical: https://thedailydiff.dev/uk/video/2026-09-30-opus-nerf-meter/

## Що охоплює це відео

- Claude тупішає після запуску: теорія зустрічається з відліком від нульового дня
- livenerf: 30-денний відлік на Opus 5.5 від тижня запуску
- Як спіймати нерф: 78 іноді правильних питань
- Що він може бачити: 7.5 балів, і кількість токенів змінюється першою
- Сліпа зона: заміна Opus 5 та 8 неправильних ключів відповідей

## Розділи

- 0:00 Claude тупішає після запуску: теорія зустрічається з відліком від нульового дня
- 0:26 livenerf: 30-денний відлік на Opus 5.5 від тижня запуску
- 1:24 Як спіймати нерф: 78 іноді правильних питань
- 2:19 Що він може бачити: 7.5 балів, і кількість токенів змінюється першою
- 2:53 Сліпа зона: заміна Opus 5 та 8 неправильних ключів відповідей
- 3:08 Anthropic: ми ніколи не зменшуємо якість моделі
- 3:45 Дата-центри тримають свої цифри в секреті; Backblaze публікує
- 4:25 Рядок кредитів: Claude допоміг створити лічильник
- 4:50 Вердикт: SHIP IT, і не цитуйте до 24 жовтня

## Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

### Claude тупішає після запуску: теорія зустрічається з відліком від нульового дня

0:00 Усі знають, що Claude тупішає через кілька тижнів після запуску. Тож один розробник запустив Opus 5.5 з відліком від тижня запуску, і відлік показує, що ніхто не міг знати це раніше. У цьому відео, три питання. Як ви виявляєте нерф? Що може бачити цей лічильник? І що говорить Anthropic? І один рядок у кредитах репозиторію змусив мене голосно сміятися.

0:20 Я розповім про це в кінці. Сьогодні середа, 30 вересня, і це The Daily Diff. Три історії сьогодні, і найбільша — це репозиторій GitHub під назвою livenerf.

### livenerf: 30-денний відлік на Opus 5.5 від тижня запуску

0:30 Протягом місяців люди говорили, що Anthropic тихо нерфує свої моделі після запуску. Звичайні теорії — це стиснута модель, менша модель під тією ж назвою або просто менше мислення. Репозиторій називає кожен аргумент досі «відчуття проти відчуттів». Opus 5.5 був випущений 22 вересня, і тиждень тому я розповідав вам, що він очолив незалежний рейтинг, пишучи в три рази більше слів, ніж середня модель. Через два з половиною дні розробник на ім'я ninja hawk запустив відлік,

0:59 раз на день протягом тридцяти днів, з логами, які ніхто не може редагувати. Тема на Hacker News набрала майже вісімсот балів і розділилася, як командний чат. Один коментатор каже, що нерф моделей не є реальним у переважній більшості повідомлених випадків. Інший каже, що люди просто звикають до нового рівня інтелекту. А один досвідчений користувач Claude Code тепер відхиляє спливаюче вікно «оцініть цю сесію» щоразу, тому що оцінка Claude, здавалося, робила його гіршим. Рецензія. Отже, питання перше, як ви виявляєте нерф?

### Як спіймати нерф: 78 іноді правильних питань

1:27 Ви починаєте з близько двох тисяч трьохсот складних екзаменаційних питань, і Opus отримує дев'яносто три відсотки правильних з першої спроби, що марно для детектора, оскільки питання, на яке він завжди відповідає правильно, не може зменшитися. Дев'яносто сім відсотків завжди були правильними або завжди неправильними, а сімдесят вісім, на які він іноді відповідає правильно, стали панеллю. Той самий промпт, без інструментів, і оцінка точного збігу без судді AI, тому що суддя також дрейфував би. Він працює за підпискою Max через безголовий Claude Code,

1:55 оскільки версія API коштувала близько шістнадцятисот доларів на місяць. І версія Claude Code закріплена, тому що, за словами репозиторію, змінений каркас виглядає точно так само, як змінена модель. Статистика походить з статті під назвою «Додавання смуг похибки до оцінок», Евана Міллера з Anthropic. Отже, власна математика Anthropic тепер перевіряє Anthropic, що є академічною версією цитування умов обслуговування назад до служби підтримки.

### Що він може бачити: 7.5 балів, і кількість токенів змінюється першою

2:19 Питання друге, що воно може бачити? За десятиденний період, падіння близько семи з половиною балів. Щоб довести, що установка працює, автор навмисно зменшив зусилля Claude. Середні зусилля зменшили вихід приблизно на чверть, а оцінку лише на чотири бали. Низькі зусилля зменшили вихід майже на дві третини, на вісім балів. Це та частина, яку варто взяти. Менше мислення проявляється в кількості токенів, перш ніж воно з'явиться у відповідях.

2:43 Тож закріпіть версію своєї моделі, реєструйте вихідні токени на завдання, і збережіть кілька власних заморожених питань. Якщо ваш агент раптом пише коротше, перевірте свої логи, перш ніж перевіряти Reddit. І ось чесна частина.

### Сліпа зона: заміна Opus 5 та 8 неправильних ключів відповідей

2:54 Тиха заміна на старіший Opus 5 була надто незначною зміною, щоб установка її зафіксувала, і це прямо зазначено в readme. Аудит також виявив вісім ключів відповідей, які здаються неправильними, тому детектор нерфів знайшов помилки в бенчмарку, перш ніж знайшов нерф.

### Anthropic: ми ніколи не зменшуємо якість моделі

3:08 Питання третє, що говорить Anthropic? Минулого року, після хвилі скарг, Anthropic опублікував посмертний аналіз. У ньому сказано, цитую, ми ніколи не зменшуємо якість моделі через попит, час доби або завантаження сервера. У тому ж дописі визнаються три помилки, які погіршили Claude, і майже третина користувачів Claude Code хоча б раз зверталися до неправильних серверів. Отже, скарги були реальними, а причиною були помилки, саме тому репозиторій попереджає, що тиждень запуску може бути найгіршим тижнем.

3:35 Шість із тридцяти днів вже пройшли. Перший можливий виклик припадає приблизно на 24 жовтня, тому чесна відповідь полягає в тому, що ніхто не знає, включаючи всіх, хто був впевнений. До речі про цифри, які ніхто не публікує.

### Дата-центри тримають свої цифри в секреті; Backblaze публікує

3:46 Lighthouse Reports та голландська газета Trouw виявили, що переважна більшість європейських дата-центрів тримають у секреті своє використання електроенергії та води, хоча правило ЄС вимагає звітності протягом трьох років. У Нідерландах публікують менше чверті. Один дата-центр Microsoft самостійно використовує близько одного відсотка голландської електроенергії. Тим часом, Backblaze знову зробив нудну річ. Його щоквартальна статистика дисків охоплює близько трьохсот п'ятдесяти тисяч жорстких дисків, і частота відмов зросла до одного цілих сімдесят трьох відсотка,

4:16 найвищий показник за деякий час. Три моделі Seagate мали нуль відмов. Ось як виглядає публічна базова лінія, квартал за кварталом, протягом тринадцяти років.

### Рядок кредитів: Claude допоміг створити лічильник

4:25 Тепер, цей рядок кредитів. У readme зазначено, що більша частина репозиторію була написана за допомогою Claude, яка є моделлю, що вимірюється. Отже, Claude допоміг створити лічильник, який перевіряє, чи став Claude тупішим. Саме тому оцінювачі є простими функціями. За словами автора, ви не повинні довіряти автору, людині чи іншій сутності. Якщо ви волієте це читати, ніж чути, The Daily Diff надходить на вашу пошту

4:46 щоранку, безкоштовно на thedailydiff.dev, посилання нижче. Отже, сьогоднішній вердикт щодо livenerf.

### Вердикт: SHIP IT, і не цитуйте до 24 жовтня

4:51 SHIP IT. Я б відправив його, тому що це перший аргумент нерфу, який я бачив, з відміткою часу, публічними правилами та заявленою сліпою зоною. Просто не цитуйте його до 24 жовтня. І це The Daily Diff на сьогодні. Я Ніко з Axrisi. Відповідально об'єднуйте.

## Джерела

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
