+− THE DAILY DIFFdev & AI news
SHIP IT

Claude nerf कसा ओळखायचा (वास्तविक डेटासह)

प्रत्येक लॉन्च झाल्यावर काही आठवड्यांनी Claude अधिक मूर्ख बनतो असे लोक म्हणतात.

प्रत्येक लॉन्च झाल्यावर काही आठवड्यांनी Claude अधिक मूर्ख बनतो असे लोक म्हणतात. एका विकासकाने Claude Opus 5.5 ला लॉन्च आठवड्यापासून 30 दिवसांच्या घड्याळावर ठेवले, ज्यात प्रश्न गोठवले होते, Claude Code पिन केले होते आणि सार्वजनिक नियम होते, आणि यामुळे हे दिसून येते की यापूर्वी कोणालाही कसे कळले नसते, आणि तुमचा टोकन काउंट ही एक गोष्ट आहे ज्यावर लक्ष ठेवणे आवश्यक आहे. निकाल: SHIP IT.

लिखित आवृत्ती वाचा (इंग्रजी) ↗

या व्हिडिओमध्ये काय समाविष्ट आहे

  • लॉन्चनंतर Claude मूर्ख बनतो: सिद्धांत शून्य दिवसाच्या घड्याळाशी जुळतो
  • livenerf: लॉन्च आठवड्यापासून Opus 5.5 साठी 30-दिवसांचे घड्याळ
  • nerf कसे पकडावे: 78 कधीकधी-बरोबर प्रश्न
  • ते काय पाहू शकते: 7.5 गुण, आणि टोकन काउंट प्रथम हलते
  • अंध जागा: एक Opus 5 स्वॅप आणि 8 चुकीच्या उत्तर की

अनुवादित प्रतिलेख

मूळ इंग्रजी निवेदनातून अनुवादित. उपलब्ध ऑडिओ आणि मथळे YouTube द्वारे नियंत्रित आहेत.

लॉन्चनंतर Claude मूर्ख बनतो: सिद्धांत शून्य दिवसाच्या घड्याळाशी जुळतो

0:00 लॉन्चनंतर काही आठवड्यांनी Claude अधिक मूर्ख बनतो हे सर्वांना माहीत आहे. म्हणून एका विकासकाने Opus 5.5 ला लॉन्च आठवड्यापासून घड्याळावर ठेवले, आणि घड्याळ म्हणते की कोणालाही अद्याप कळले नसते. या व्हिडिओमध्ये, तीन प्रश्न. आपण nerf कसे पकडता? हे मीटर काय पाहू शकते? आणि Anthropic काय म्हणते? आणि repo च्या क्रेडिट्समधील एका ओळीने मला मोठ्याने हसू आले.

0:20 मी शेवटी त्यावर येईन. आज बुधवार, तीस सप्टेंबर, आणि हे The Daily Diff आहे. आज तीन कथा, आणि मोठी कथा म्हणजे live nerf नावाचे GitHub repo.

livenerf: लॉन्च आठवड्यापासून Opus 5.5 साठी 30-दिवसांचे घड्याळ

0:30 गेल्या अनेक महिन्यांपासून, लोक म्हणत आहेत की Anthropic लॉन्च झाल्यानंतर आपले मॉडेल्स शांतपणे nerf करते. सामान्य सिद्धांत म्हणजे एक संकुचित मॉडेल, त्याच नावाखाली एक लहान मॉडेल किंवा फक्त कमी विचार. repo आत्तापर्यंतच्या प्रत्येक युक्तिवादाला 'vibes vs vibes' असे म्हणते. Opus 5.5 बावीस सप्टेंबर रोजी शिप केले गेले, आणि एका आठवड्यापूर्वी मी तुम्हाला सांगितले होते की ते तीन पट अधिक शब्द लिहून स्वतंत्र बोर्डात अव्वल होते सरासरी मॉडेलपेक्षा. अडीच दिवसांत, ninja hawk नावाच्या विकासकाने घड्याळ सुरू केले,

0:59 रोज एकदा तीस दिवसांसाठी, लॉग्स कोणीही संपादित करू शकत नाही अशा प्रकारे. Hacker News थ्रेडने जवळपास आठशे गुण मिळवले आणि टीम चॅटप्रमाणे विभागले. एका टिप्पणीकर्त्याचे म्हणणे आहे की बहुतेक अहवाल दिलेल्या प्रकरणांमध्ये मॉडेल्सना nerf करणे वास्तविक नाही. दुसरा म्हणतो की लोक फक्त नवीन बुद्धिमत्ता पातळीची सवय करून घेत आहेत. आणि एक Claude Code पॉवर युझर आता 'rate-this-session' पॉप-अप प्रत्येक वेळी रद्द करतो, कारण Claude ला रेट केल्याने ते अधिक वाईट बनले असे वाटले. पीअर रिव्ह्यू. तर, प्रश्न पहिला, आपण nerf कसे पकडता?

nerf कसे पकडावे: 78 कधीकधी-बरोबर प्रश्न

1:27 तुम्ही सुमारे तेवीसशे कठीण परीक्षा प्रश्नांपासून सुरुवात करता, आणि Opus पहिल्या प्रयत्नात त्र्याण्णव टक्के बरोबर मिळवतो, जे डिटेक्टरसाठी निरुपयोगी आहे, कारण जो प्रश्न ते नेहमी बरोबर मिळवते तो घसरू शकत नाही. सत्त्याण्णव टक्के नेहमी बरोबर किंवा नेहमी चुकीचे होते, आणि ज्या 78 प्रश्नांना ते फक्त कधीकधी बरोबर मिळवत होते ते पॅनेल बनले. समान प्रॉम्प्ट, कोणतीही साधने नाहीत, आणि AI जजशिवाय अचूक-जुळणी ग्रेडिंग, कारण जजही भरकटेल. हे हेडलेस Claude Code द्वारे मॅक्स सबस्क्रिप्शनवर चालते,

1:55 कारण API आवृत्तीची किंमत प्रति महिना सुमारे सोळाशे डॉलर होती. आणि Claude Code आवृत्ती पिन केलेली आहे, कारण, repo च्या शब्दात, बदललेला हार्नेस बदललेल्या मॉडेलसारखाच दिसतो. आकडेवारी Adding Error Bars to Evals नावाच्या पेपरमधून येते, Anthropic मधील Evan Miller द्वारे. तर Anthropic चे स्वतःचे गणित आता Anthropic चे ऑडिट करत आहे, जी शैक्षणिक आवृत्ती आहे ग्राहक समर्थनाकडे सेवा अटींचा उल्लेख करण्यासारखे.

ते काय पाहू शकते: 7.5 गुण, आणि टोकन काउंट प्रथम हलते

2:19 प्रश्न दुसरा, ते काय पाहू शकते? प्रत्येक दहा-दिवसांच्या विंडोमध्ये, सुमारे साडेसात गुणांची घट. rig काम करते हे सिद्ध करण्यासाठी, लेखकाने Claude चा प्रयत्न मुद्दाम कमी केला. मध्यम प्रयत्नाने आउटपुट सुमारे एक चतुर्थांश कमी केले, आणि स्कोअर फक्त चार गुणांनी. कमी प्रयत्नाने आउटपुट जवळजवळ दोन तृतीयांश कमी केले, आठ गुणांसाठी. तो भाग चोरून घ्यायचा आहे. कमी विचार उत्तरांमध्ये दिसण्यापूर्वी टोकन काउंटमध्ये दिसतो.

2:43 तर आपली मॉडेल आवृत्ती पिन करा, प्रति कार्य आउटपुट टोकन लॉग करा, आणि तुमचे स्वतःचे काही गोठवलेले प्रश्न ठेवा. जर तुमचा एजंट अचानक कमी लिहित असेल, तर Reddit तपासण्यापूर्वी तुमचे लॉग तपासा. आणि इथे आहे प्रामाणिक भाग.

अंध जागा: एक Opus 5 स्वॅप आणि 8 चुकीच्या उत्तर की

2:54 जुना Opus 5 शांतपणे बदलणे हे rig साठी खूप लहान बदल होता आणि readme तसे सुरुवातीलाच सांगते. ऑडिटमध्ये आठ उत्तर की देखील चुकीच्या दिसल्या, म्हणून nerf डिटेक्टरला nerf सापडण्यापूर्वी बेंचमार्कमध्ये बग्स सापडले.

Anthropic: आम्ही मॉडेलची गुणवत्ता कधीही कमी करत नाही

3:08 प्रश्न तिसरा, Anthropic काय म्हणते? गेल्या वर्षी, तक्रारींच्या लाटेनंतर, Anthropic ने पोस्टमॉर्तेम प्रकाशित केले. ते म्हणते, “आम्ही मागणीमुळे, दिवसाच्या वेळेमुळे किंवा सर्व्हर लोडमुळे मॉडेलची गुणवत्ता कधीही कमी करत नाही.” त्याच पोस्टमध्ये तीन बग्समुळे Claude ची गुणवत्ता खराब झाली असल्याचे कबूल केले आहे, आणि जवळजवळ एक तृतीयांश Claude Code वापरकर्त्यांनी कमीत कमी एकदा चुकीच्या सर्व्हरला मारले. तर तक्रारी खऱ्या होत्या आणि कारण बग्स होते, त्यामुळेच repo चेतावणी देते की लॉन्च आठवडा सर्वात वाईट आठवडा असू शकतो. तीस पैकी सहा दिवस झाले आहेत.

3:35 पहिली संभाव्य कॉल चोवीस ऑक्टोबरच्या आसपास येईल, म्हणून प्रामाणिक उत्तर हे आहे की कोणालाही माहिती नाही, ज्यांना खात्री होती त्यांनाही नाही. कोणीही प्रकाशित करत नसलेल्या आकड्यांबद्दल बोलताना. Lighthouse Reports आणि डच पेपर Trouw यांना आढळले की युरोपीय डेटा सेंटर्सची बहुसंख्य संख्या

डेटा सेंटर्स त्यांचे आकडे गुप्त ठेवतात; Backblaze प्रकाशित करते

3:46 त्यांचे वीज आणि पाणी वापर गुप्त ठेवतात, जरी EU नियमानुसार तीन वर्षांपासून अहवाल देणे आवश्यक आहे. नेदरलँड्समध्ये, एक चतुर्थांशपेक्षा कमी डेटा सेंटर्स प्रकाशित करतात. एकट्या मायक्रोसॉफ्ट डेटा सेंटरचा वापर डच विजेच्या सुमारे एक टक्का आहे. दरम्यान, Backblaze ने पुन्हा तेच कंटाळवाणे काम केले. त्याचे तिमाही ड्राइव्ह आकडे सुमारे साडेतीन लाख हार्ड ड्राइव्ह्सचा समावेश करतात, आणि अपयशाचा दर 1.73 टक्के वाढला, बरेच दिवसांनी सर्वात जास्त.

4:16 तीन Seagate मॉडेल्सना शून्य अपयश आले. तेव्हा सार्वजनिक बेसलाइन अशी दिसते, तिमाहीनंतर तिमाही, तेरा वर्षांसाठी. आता, ती क्रेडिट्स लाइन.

क्रेडिट्स लाइन: Claude ने मीटर बनवायला मदत केली

4:25 readme कबूल करते की repo चा बराचसा भाग Claude च्या मदतीने लिहिला गेला आहे, जो मॉडेल मोजला जात आहे. तर Claude ने मीटर बनवायला मदत केली जी Claude अधिक मूर्ख बनला की नाही हे तपासते. म्हणूनच ग्रेडर साधी फंक्शन्स आहेत. लेखकाच्या शब्दात, तुम्हाला लेखकावर विश्वास ठेवण्याची गरज नाही, मानवी असो वा नसो. तुम्हाला हे ऐकण्याऐवजी वाचायला आवडत असेल, तर diff तुमच्या इनबॉक्समध्ये दररोज सकाळी येतो, the daily diff dot dev वर विनामूल्य, लिंक खाली.

4:46 तर, आजचा live nerf वरील निकाल. SHIP IT. मी ते शिप करेन कारण हे पहिले nerf युक्तिवाद आहे जे मी

निकाल: SHIP IT, आणि 24 ऑक्टोबरपूर्वी याचा उल्लेख करू नका

4:51 टाइमस्टॅम्प, सार्वजनिक नियमपुस्तिका आणि सांगितलेल्या अंध बिंदूसह पाहिले आहे. फक्त चोवीस ऑक्टोबरपूर्वी याचा उल्लेख करू नका. आणि आजचा diff एवढाच. मी Axrisi मधून Niko आहे. जबाबदारीने विलीन करा. जबाबदारीने विलीन करा.

स्रोत

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

संबंधित व्हिडिओ

daily · mr · २३ सप्टें, २०२६

Claude Opus 5.5 ने किमती कमी केल्या. OpenAI ने आणखी कमी केल्या.

Anthropic ने Claude Opus 5.5 लाँच केले: बहुतेक कामांवर फेबल-स्तरीय, स्टिकर किमतीवर पंचमांश सूट आणि कॅशे केलेल्या वाचनांवर 60% सूट. सुमारे नव्वद मिनिटांनंतर OpenAI ने GPT-6 Sol आणि Luna लाँच केले, जे त

5:12 ↗
daily · mr · १ ऑक्टो, २०२६

जेमिनी 4 आर्गॉन हे Google चे सर्वोत्तम मॉडेल आहे. तुम्ही ते अजून वापरू शकत नाही.

Google ने जेमिनी 4 आर्गॉन, त्याचे नवीन फ्रंटियर मॉडेल घोषित केले, आणि केवळ विश्वसनीय सायबर डिफेंडर्सच ते वापरू शकतात. Google च्या स्वतःच्या 19-पंक्तींच्या बेंचमार्क टेबलमध्ये काय दाखवले आहे, स्वतंत्र

4:53 ↗
daily · mr · २७ सप्टें, २०२६

ओपनएआयने आपली चोरी केलेली पुस्तके का हटवली?

२०१९ मध्ये ओपनएआयच्या एका संशोधकाने उघड केलेल्या कागदपत्रांमध्ये म्हटले आहे: पायरेटेड पुस्तकांच्या साइटवर प्रशिक्षण देण्याबद्दल त्याची चिंता हॅकर न्यूजवरील "ऑप्टिक्स" बद्दल होती. ओपनएआयला काय माहीत हो

5:01 ↗
daily · mr · १६ सप्टें, २०२६

मायक्रोसॉफ्टच्या एआय प्रमुखाने क्लाउडच्या संविधानाला धोकादायक म्हटले आहे.

मायक्रोसॉफ्ट एआयचे सीईओ, मुस्तफा सुलेमान यांनी 3,000 शब्दांचा एक निबंध प्रकाशित केला, ज्यामध्ये त्यांनी असा युक्तिवाद केला आहे की एन्थ्रोपिकचे क्लाउड संविधान मॉडेलला "मी कदाचित जागरूक आहे" आणि "मॉडेल

5:19 ↗