+− THE DAILY DIFFdev & AI news
SHIP IT

Claude zayıflamasının nasıl tespit edileceği (gerçek verilerle)

İnsanlar, Claude'un her lansmandan birkaç hafta sonra daha aptal hale geldiğini söylüyor.

İnsanlar, Claude'un her lansmandan birkaç hafta sonra daha aptal hale geldiğini söylüyor. Bir geliştirici, Claude Opus 5.5'i lansman haftasından itibaren 30 günlük bir saate, dondurulmuş sorularla, sabitlenmiş bir Claude Kodu ve herkese açık kurallarla koydu ve bunun neden daha önce kimsenin bilemeyeceğini ve neden token sayınızın dikkat edilmesi gereken şey olduğunu gösteriyor. Karar: SHIP IT.

Yazılı sürümü oku (İngilizce) ↗

Bu video neleri kapsar

  • Claude lansmandan sonra aptallaşıyor: teori bir sıfır gün saatiyle buluşuyor
  • canlı zayıflama: lansman haftasından itibaren Opus 5.5'te 30 günlük bir saat
  • Bir zayıflamayı nasıl yakalarız: 78 bazen doğru soru
  • Ne görebilir: 7.5 puan ve token sayısı önce hareket ediyor
  • Kör nokta: bir Opus 5 değişimi ve 8 yanlış cevap anahtarı

Çevrilmiş deşifre

Orijinal İngilizce anlatımdan çevrilmiştir. Mevcut ses ve altyazılar YouTube tarafından kontrol edilir.

Claude lansmandan sonra aptallaşıyor: teori bir sıfır gün saatiyle buluşuyor

0:00 Herkes, Claude'un lansmandan birkaç hafta sonra daha aptal hale geldiğini biliyor. Bu yüzden bir geliştirici, Opus beş buçuğu lansman haftasından itibaren bir saate koydu, ve saat, kimsenin henüz bilemeyeceğini söylüyor. Bu videoda üç soru. Bir zayıflamayı nasıl yakalarsınız? Bu ölçer ne görebilir? Ve Anthropic ne diyor? Ve deponun künyesindeki bir satır beni yüksek sesle güldürdü.

0:20 Sonunda ona geleceğim. Bugün 30 Eylül Çarşamba ve bu The Daily Diff. Bugün üç hikaye var ve en büyüğü canlı zayıflama adlı bir GitHub deposu.

canlı zayıflama: lansman haftasından itibaren Opus 5.5'te 30 günlük bir saat

0:30 Aylardır insanlar Anthropic'in lansmandan sonra modellerini sessizce zayıflattığını söylüyor. Olağan teoriler sıkıştırılmış bir model, aynı isim altında daha küçük bir model veya sadece daha az düşünme. Depo, şimdiye kadarki her argümanı "havalar vs. havalar" olarak adlandırıyor. Opus beş buçuk 22 Eylül'de piyasaya sürüldü, ve bir hafta önce size üç kat daha fazla kelime yazarak bağımsız sıralamada birinci olduğunu söylemiştim ortanca modelden daha fazla kelime. İki buçuk gün içinde, ninja hawk adlı bir geliştirici saati başlattı,

0:59 otuz gün boyunca günde bir kez, kimsenin düzenleyemeyeceği günlüklerle. Hacker News başlığı neredeyse sekiz yüz puana ulaştı ve bir ekip gibi bölündü sohbet. Bir yorumcu, rapor edilen vakaların büyük çoğunluğunda modelleri zayıflatmanın gerçek olmadığını söylüyor. Başka bir yorumcu ise insanların sadece yeni zeka seviyesine alıştığını söylüyor. Ve bir Claude Code güç kullanıcısı şimdi bu oturumu derecelendir pop-up'ını her seferinde reddediyor, çünkü Claude'u derecelendirmenin onu daha da kötüleştirdiğini düşündü. Akran değerlendirmesi. Peki, birinci soru, bir zayıflamayı nasıl yakalarsınız?

Bir zayıflamayı nasıl yakalarız: 78 bazen doğru soru

1:27 Yaklaşık yirmi üç yüz zor sınav sorusuyla başlarsınız, ve Opus ilk denemede yüzde doksan üçünü doğru yapıyor, bu da bir dedektör için işe yaramaz, çünkü her zaman doğru yaptığı bir soru düşemez. Yüzde doksan yedisi her zaman doğru veya her zaman yanlıştı, ve sadece bazen doğru yaptığı yetmiş sekiz tanesi panel oldu. Aynı komut istemi, araç yok ve yapay zeka hakimi olmadan tam eşleşme derecelendirme, çünkü hakim de sapacaktı. API sürümü ayda yaklaşık bin altı yüz dolara mal olduğu için

1:55 başsız Claude Code aracılığıyla Max aboneliğiyle çalışır. Ve Claude Code sürümü sabitlenmiştir, çünkü deponun sözleriyle, değiştirilmiş bir donanım, değiştirilmiş bir modelle tamamen aynı görünür. İstatistikler, Anthropic'ten Evan Miller tarafından yazılan "Evals'a Hata Çubukları Ekleme" adlı bir makaleden alınmıştır. Yani Anthropic'in kendi matematiği şimdi Anthropic'i denetliyor, bu da akademik versiyonudur müşteri desteğine hizmet şartlarını geri alıntılamak. Müşteri desteğine hizmet şartlarını geri alıntılamak.

Ne görebilir: 7.5 puan ve token sayısı önce hareket ediyor

2:19 İkinci soru, ne görebilir? On günlük pencere başına yaklaşık yedi buçuk puanlık bir düşüş. Çalışmanın işe yaradığını kanıtlamak için yazar, Claude'un çabasını kasten düşürdü. Orta çaba çıktıyı yaklaşık dörtte bir, puanı ise sadece dört puan kesti. Düşük çaba çıktıyı neredeyse üçte iki kesti, sekiz puan için. Çalınacak kısım bu. Daha az düşünme, cevaplarda görünmeden önce token sayısında ortaya çıkıyor.

2:43 Bu yüzden model sürümünüzü sabitleyin, görev başına çıktı tokenlarını kaydedin, ve kendi dondurulmuş sorularınızdan birkaçını saklayın. Aracınız aniden daha kısa yazmaya başlarsa, Reddit'e bakmadan önce günlüklerinizi kontrol edin. Ve işte dürüst kısım.

Kör nokta: bir Opus 5 değişimi ve 8 yanlış cevap anahtarı

2:54 Eski Opus beşini sessizce değiştirmek, çalışmanın tespit edemeyeceği kadar küçük bir değişiklikti, ve readme de bunu baştan söylüyor. Denetim ayrıca yanlış görünen sekiz cevap anahtarı buldu, bu yüzden zayıflama dedektörü, bir zayıflama bulmadan önce karşılaştırma testinde hatalar buldu.

Anthropic: model kalitesini asla düşürmeyiz

3:08 Üçüncü soru, Anthropic ne diyor? Geçen yıl, bir şikayet dalgasından sonra Anthropic bir ölüm sonrası yayınladı. Alıntı yaparak diyor ki, "talepten dolayı model kalitesini asla düşürmeyiz, günün saatinden veya sunucu yükünden dolayı değil." Aynı gönderi, üç hatanın Claude'u bozduğunu ve Claude Code kullanıcılarının neredeyse üçte birinin en az bir kez yanlış sunuculara isabet ettiğini itiraf ediyor. Yani şikayetler gerçekti ve nedeni hatalardı, bu yüzden depo, lansman haftasının en kötü hafta olabileceği konusunda uyarıyor.

3:35 Otuz günden altısı tamamlandı. İlk olası çağrı 24 Ekim civarında gerçekleşecek, bu yüzden dürüst cevap, emin olan herkes dahil kimsenin bilmediğidir. Kimsenin yayınlamadığı sayılardan bahsetmişken.

Veri merkezleri sayılarını gizli tutuyor; Backblaze yayınlıyor

3:46 Lighthouse Reports ve Hollanda gazetesi Trouw, Avrupa'daki veri merkezlerinin büyük çoğunluğunun güç ve su kullanımlarını gizli tuttuklarını buldu, ancak bir AB kuralı üç yıldır raporlamayı zorunlu kılıyor. Hollanda'da dörtte birinden azı yayınlıyor. Sadece bir Microsoft veri merkezi, Hollanda elektriğinin yaklaşık yüzde birini kullanıyor. Bu arada, Backblaze yine sıkıcı şeyi yaptı. Üç aylık sürücü istatistikleri yaklaşık üç yüz elli bin sabit sürücüyü kapsıyor, ve arıza oranı yüzde bir nokta yetmiş üçe yükseldi,

4:16 bir süredir en yüksek seviye. Üç Seagate modelinde sıfır arıza vardı. İşte on üç yıldır çeyrekten çeyreğe kamuya açık bir temel çizgisi böyle görünüyor. on üç yıldır.

Künye satırı: Claude ölçerin yapımına yardımcı oldu

4:25 Şimdi, o künye satırı. Readme, deponun çoğunun, ölçülen model olan Claude'un yardımıyla yazıldığını kabul ediyor. ölçülen model olan Claude'un yardımıyla yazıldığını kabul ediyor. Yani Claude, Claude'un aptallaşıp aptallaşmadığını kontrol eden ölçerin yapımına yardımcı oldu. Bu yüzden derecelendiriciler basit fonksiyonlardır. Yazarın sözleriyle, yazara güvenmek zorunda değilsiniz, insan olsun ya da olmasın. Bunu benim söylememden ziyade okumayı tercih ederseniz, fark her sabah gelen kutunuza düşüyor,

4:46 thedailydiff.dev adresinde ücretsiz, bağlantı aşağıda. Peki, canlı zayıflama hakkındaki bugünün kararı.

Karar: SHIP IT ve 24 Ekim'den önce alıntı yapmayın

4:51 SHIP IT. Ben gönderirdim çünkü bir zaman damgası, halka açık bir kural kitabı ve belirtilmiş bir kör noktası olan ilk zayıflama argümanı bu. belirtilmiş bir kör nokta. Sadece 24 Ekim'den önce alıntı yapmayın. Ve bugünün farkı bu kadar. Ben Axrisi'den Niko. Sorumlulukla birleştirin.

Kaynaklar

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

İlgili videolar