# 클로드 너프 감지 방법 (실제 데이터 포함)

Published: 2026-09-30

사람들은 클로드가 출시 후 몇 주 뒤에 바보가 된다고 말합니다. 한 개발자가 클로드 Opus 5.5를 출시 주부터 30일 시계에 맞춰 고정된 질문, 고정된 클로드 코드, 공개 규칙을 적용한 결과, 왜 아무도 이전에 알 수 없었는지, 그리고 토큰 수가 왜 주시해야 할 사항인지 보여줍니다. 평결: SHIP IT.

Canonical: https://thedailydiff.dev/ko/video/2026-09-30-opus-nerf-meter/

## 이 동영상에서 다루는 내용

- 클로드는 출시 후 바보가 된다: 이론이 0일 시계와 만나다
- livenerf: 출시 주부터 Opus 5.5에 대한 30일 시계
- 너프를 잡는 방법: 때때로 맞는 질문 78개
- 볼 수 있는 것: 7.5점, 그리고 토큰 수가 먼저 움직인다
- 맹점: Opus 5 교체 및 8개의 오답 키

## 챕터

- 0:00 클로드는 출시 후 바보가 된다: 이론이 0일 시계와 만나다
- 0:26 livenerf: 출시 주부터 Opus 5.5에 대한 30일 시계
- 1:24 너프를 잡는 방법: 때때로 맞는 질문 78개
- 2:19 볼 수 있는 것: 7.5점, 그리고 토큰 수가 먼저 움직인다
- 2:53 맹점: Opus 5 교체 및 8개의 오답 키
- 3:08 Anthropic: 우리는 모델 품질을 절대 낮추지 않습니다
- 3:45 데이터 센터는 숫자를 비밀로 유지합니다; Backblaze는 공개합니다
- 4:25 크레딧 라인: 클로드가 미터 구축을 도왔습니다
- 4:50 평결: SHIP IT, 그리고 10월 24일 이전에 인용하지 마세요

## 번역된 스크립트

원래 영어 내레이션에서 번역되었습니다. 사용 가능한 오디오 및 캡션은 YouTube에서 제어합니다.

### 클로드는 출시 후 바보가 된다: 이론이 0일 시계와 만나다

0:00 모두가 클로드가 출시 후 몇 주 뒤에 바보가 된다는 것을 알고 있습니다. 그래서 한 개발자가 Opus 5.5를 출시 주부터 시계에 맞췄고, 그 시계는 아무도 아직 알 수 없었음을 말합니다. 이 비디오에는 세 가지 질문이 있습니다. 너프를 어떻게 잡나요? 이 미터는 무엇을 볼 수 있나요? 그리고 Anthropic은 무엇이라고 말하나요? 그리고 저장소의 크레딧에 있는 한 줄은 저를 크게 웃게 만들었습니다.

0:20 마지막에 말씀드리겠습니다. 9월 30일 수요일, 이곳은 The Daily Diff입니다. 오늘 세 가지 이야기, 그리고 가장 큰 이야기는 라이브 너프(live nerf)라는 GitHub 저장소입니다.

### livenerf: 출시 주부터 Opus 5.5에 대한 30일 시계

0:30 몇 달 동안 사람들은 Anthropic이 출시 후 조용히 모델을 너프한다고 말해왔습니다. 일반적인 이론은 압축된 모델, 같은 이름의 더 작은 모델이거나 단순히 사고력이 줄어든 것입니다. 저장소는 지금까지의 모든 주장을 '분위기 대 분위기'라고 부릅니다. Opus 5.5는 9월 22일에 출시되었고, 일주일 전 저는 그것이 독립 순위표에서 1위를 차지하면서 중앙값 모델보다 세 배 더 많은 단어를 썼다고 말씀드렸습니다. 이틀 반 만에 ninja hawk이라는 개발자가 시계를 시작했고,

0:59 30일 동안 하루에 한 번, 아무도 편집할 수 없는 로그와 함께 진행했습니다. Hacker News 스레드는 거의 800점에 도달했고 팀 채팅처럼 갈라졌습니다. 한 댓글 작성자는 보고된 사례의 대부분에서 모델 너프는 실제로 존재하지 않는다고 말합니다. 다른 사람은 사람들이 단지 새로운 지능 수준에 익숙해지고 있다고 말합니다. 그리고 한 Claude Code 파워 유저는 이제 매번 '이 세션 평가하기' 팝업을 무시합니다. 왜냐하면 클로드를 평가하는 것이 클로드를 더 나쁘게 만드는 것 같았기 때문입니다. 동료 검토. 그래서 질문 1, 너프를 어떻게 잡나요?

### 너프를 잡는 방법: 때때로 맞는 질문 78개

1:27 약 2300개의 어려운 시험 문제로 시작하고, Opus는 첫 시도에 93%를 맞춥니다. 이는 탐지기에게는 쓸모가 없습니다. 왜냐하면 항상 맞는 질문은 점수가 떨어질 수 없기 때문입니다. 97%는 항상 맞거나 항상 틀렸고, 때때로만 맞는 78개가 패널이 되었습니다. 동일한 프롬프트, 도구 없음, AI 심판 없는 정확 일치 채점, 왜냐하면 심판도 흔들릴 것이기 때문입니다. API 버전이 한 달에 약 1600달러로 가격이 책정되었기 때문에

1:55 헤드리스 Claude Code를 통해 Max 구독에서 실행됩니다. 그리고 Claude Code 버전은 고정되어 있습니다. 왜냐하면 저장소의 말에 따르면, 변경된 하네스는 변경된 모델과 똑같이 보이기 때문입니다. 통계는 Anthropic의 Evan Miller가 쓴 '평가에 오차 막대 추가하기'라는 논문에서 나옵니다. 그래서 Anthropic의 자체 수학이 이제 Anthropic을 감사하고 있는데, 이것은 고객 지원에 서비스 약관을 다시 인용하는 학문적 버전입니다. 그래서 Anthropic의 자체 수학이 이제 Anthropic을 감사하고 있는데, 이것은 고객 지원에 서비스 약관을 다시 인용하는 학문적 버전입니다. 그래서 Anthropic의 자체 수학이 이제 Anthropic을 감사하고 있는데, 이것은 고객 지원에 서비스 약관을 다시 인용하는 학문적 버전입니다.

### 볼 수 있는 것: 7.5점, 그리고 토큰 수가 먼저 움직인다

2:19 질문 2, 무엇을 볼 수 있나요? 10일 창당 약 7.5점의 하락. 장치가 작동한다는 것을 증명하기 위해 저자는 클로드의 노력을 의도적으로 낮췄습니다. 중간 노력은 출력을 약 1/4 줄였고, 점수는 4점만 줄였습니다. 낮은 노력은 출력을 거의 2/3 줄였고, 8점을 줄였습니다. 이것이 훔쳐야 할 부분입니다. 생각이 덜하다는 것은 답변에 나타나기 전에 토큰 수에서 나타납니다.

2:43 따라서 모델 버전을 고정하고 작업당 출력 토큰을 기록하며, 자신만의 고정된 질문 몇 개를 유지하세요. 만약 에이전트가 갑자기 더 짧게 글을 쓴다면, 레딧을 확인하기 전에 로그를 확인하세요. 그리고 이것이 솔직한 부분입니다.

### 맹점: Opus 5 교체 및 8개의 오답 키

2:54 이전 Opus 5를 조용히 바꾸는 것은 장치가 감지하기에는 너무 작은 변화였고, readme에 그렇게 명시되어 있습니다. 감사 결과 잘못된 것으로 보이는 8개의 정답 키도 발견되었습니다. 따라서 너프 탐지기는 너프를 찾기 전에 벤치마크에서 버그를 찾았습니다.

### Anthropic: 우리는 모델 품질을 절대 낮추지 않습니다

3:08 질문 3, Anthropic은 무엇이라고 말하나요? 작년에 불만이 쏟아진 후 Anthropic은 사후 분석을 발표했습니다. 그것은 인용하자면, '우리는 수요, 시간 또는 서버 로드로 인해 모델 품질을 절대 낮추지 않습니다'라고 말합니다. 같은 게시물은 세 가지 버그가 클로드를 저하시켰고, 클로드 코드 사용자의 거의 3분의 1이 적어도 한 번은 잘못된 서버에 접속했다고 인정합니다. 같은 게시물은 세 가지 버그가 클로드를 저하시켰고, 클로드 코드 사용자의 거의 3분의 1이 적어도 한 번은 잘못된 서버에 접속했다고 인정합니다. 그래서 불만은 실제였고 원인은 버그였습니다. 이것이 저장소가 출시 주가 최악의 주가 될 수 있다고 경고하는 이유입니다.

3:35 30일 중 6일이 지났습니다. 첫 번째 가능한 호출은 10월 24일경에 나옵니다. 그래서 솔직한 답변은 확신했던 모든 사람을 포함하여 아무도 모른다는 것입니다. 아무도 공개하지 않는 숫자에 대해 이야기하자면.

### 데이터 센터는 숫자를 비밀로 유지합니다; Backblaze는 공개합니다

3:46 Lighthouse Reports와 네덜란드 신문 Trouw는 대다수의 유럽 데이터 센터가 전력 및 물 사용량을 비밀로 유지한다고 밝혔습니다. Lighthouse Reports와 네덜란드 신문 Trouw는 대다수의 유럽 데이터 센터가 전력 및 물 사용량을 비밀로 유지한다고 밝혔습니다. 비록 EU 규칙이 3년 동안 보고를 요구했지만 말입니다. 네덜란드에서는 1/4 미만이 공개합니다. 마이크로소프트 데이터 센터 하나만으로 네덜란드 전기의 약 1%를 사용합니다. 한편 Backblaze는 또다시 지루한 일을 했습니다. 분기별 드라이브 통계는 약 35만 개의 하드 드라이브를 다루며, 고장률은 1.73%로 상승하여

4:16 한동안 최고치를 기록했습니다. 세 개의 Seagate 모델은 고장이 없었습니다. 그것이 13년 동안 분기마다 공개 기준선이 보이는 모습입니다. 그것이 13년 동안 분기마다 공개 기준선이 보이는 모습입니다.

### 크레딧 라인: 클로드가 미터 구축을 도왔습니다

4:25 이제, 그 크레딧 라인. readme는 저장소의 많은 부분이 클로드의 도움을 받아 작성되었다고 인정합니다. 측정 대상 모델인 클로드 말입니다. 그래서 클로드는 클로드가 바보가 되었는지 확인하는 미터 구축을 도왔습니다. 그래서 채점자는 일반 함수입니다. 저자의 말에 따르면, 저자를 신뢰할 필요가 없습니다. 인간이든 아니든 말입니다. 제가 말하는 것을 듣는 대신 이것을 읽고 싶다면, 매일 아침 당신의 받은 편지함에 diff가 무료로 도착합니다. the daily diff dot dev에서, 아래 링크를 참조하세요.

4:46 제가 말하는 것을 듣는 대신 이것을 읽고 싶다면, 매일 아침 당신의 받은 편지함에 diff가 무료로 도착합니다. the daily diff dot dev에서, 아래 링크를 참조하세요. 자, 오늘의 라이브 너프 평결입니다.

### 평결: SHIP IT, 그리고 10월 24일 이전에 인용하지 마세요

4:51 SHIP IT. 타임스탬프, 공개 규칙서, 명시된 맹점을 가진 첫 너프 주장이라서 저는 SHIP IT을 보낼 것입니다. SHIP IT. 타임스탬프, 공개 규칙서, 명시된 맹점을 가진 첫 너프 주장이라서 저는 SHIP IT을 보낼 것입니다. 단, 10월 24일 이전에 인용하지 마세요. 그리고 이것이 오늘의 diff입니다. 저는 Axrisi의 Niko입니다. 책임감 있게 병합하세요.

## 출처

- [livenerf](https://github.com/ninjahawk/livenerf) — github.com
- [Validation](https://github.com/ninjahawk/livenerf/blob/main/docs/VALIDATION.md) — github.com
- [Hacker News](https://news.ycombinator.com/item?id=49901736) — news.ycombinator.com
- [Anthropic postmortem (Sep 2025)](https://www.anthropic.com/engineering/a-postmortem-of-three-recent-issues) — www.anthropic.com
- [Adding Error Bars to Evals (Evan Miller)](https://arxiv.org/abs/2411.00640) — arxiv.org
- [Inspect (UK AI Security Institute)](https://inspect.aisi.org.uk/) — inspect.aisi.org.uk
- [NL Times](https://nltimes.nl/2026/09/30/data-centers-refusing-say-much-water-electricity-use) — nltimes.nl
- [Hacker News](https://news.ycombinator.com/item?id=49907057) — news.ycombinator.com
- [Backblaze Drive Stats Q2 2026](https://www.backblaze.com/blog/backblaze-drive-stats-for-q2-2026/) — www.backblaze.com
- [Hacker News](https://news.ycombinator.com/item?id=49893002) — news.ycombinator.com
