Claude को 'नर्फ' कसरी पत्ता लगाउने (वास्तविक डेटाका साथ)
मानिसहरू भन्छन् कि Claude प्रत्येक लन्चको केही हप्तापछि सुस्त हुन्छ।
मानिसहरू भन्छन् कि Claude प्रत्येक लन्चको केही हप्तापछि सुस्त हुन्छ। एक विकासकर्ताले Claude Opus 5.5 लाई लन्च हप्ताबाट 30-दिने घडीमा राखे, जसमा स्थिर प्रश्नहरू, पिन गरिएको Claude कोड र सार्वजनिक नियमहरू थिए, र यसले देखाउँछ कि कसैले पनि पहिले कसरी थाहा पाउन सकेनन्, र किन तपाईंको टोकन गणना हेर्नु पर्ने कुरा हो। फैसला: SHIP IT.
लिखित संस्करण पढ्नुहोस् (अंग्रेजी) ↗
यो भिडियोले के समेट्छ
- Claude लन्च पछि सुस्त हुन्छ: सिद्धान्तले शून्य-दिनको घडी भेट्छ
- livenerf: Opus 5.5 को लन्च हप्ताबाट 30-दिने घडी
- नर्फ कसरी समात्ने: 78 कहिलेकाहीँ-सही प्रश्नहरू
- यसले के देख्न सक्छ: 7.5 अंक, र टोकन गणना पहिले सर्छ
- अन्धा ठाउँ: Opus 5 स्वैप र 8 गलत उत्तर कुञ्जीहरू
अनुवादित ट्रान्सक्रिप्ट
मूल अंग्रेजी कथाबाट अनुवादित। उपलब्ध अडियो र क्याप्सनहरू YouTube द्वारा नियन्त्रित हुन्छन्।
Claude लन्च पछि सुस्त हुन्छ: सिद्धान्तले शून्य-दिनको घडी भेट्छ
0:00 सबैलाई थाहा छ कि Claude लन्चको केही हप्तापछि सुस्त हुन्छ। त्यसैले एक विकासकर्ताले Opus 5.5 लाई लन्च हप्ताबाट घडीमा राखे, र घडीले भन्छ कि कसैले पनि अहिलेसम्म थाहा पाउन सकेको थिएन। यस भिडियोमा, तीन प्रश्नहरू। तपाईं कसरी 'नर्फ' समात्नुहुन्छ? यो मिटरले के देख्न सक्छ? र Anthropic ले के भन्छ? र रेपोको क्रेडिटमा एउटा लाइनले मलाई ठूलो स्वरमा हँसायो।
0:20 म अन्त्यमा त्यसको बारेमा बताउनेछु। आज सेप्टेम्बर तीस, बुधबार हो, र यो The Daily Diff हो। आज तीन कथाहरू, र सबैभन्दा ठूलो एउटा GitHub रेपो हो जसलाई live nerf भनिन्छ।
livenerf: Opus 5.5 को लन्च हप्ताबाट 30-दिने घडी
0:30 महिनादेखि, मानिसहरूले भनिरहेका छन् कि Anthropic ले लन्च पछि चुपचाप आफ्ना मोडेलहरूलाई 'नर्फ' गर्छ। सामान्य सिद्धान्तहरू एउटा निचोडिएको मोडेल, उही नाममा एउटा सानो मोडेल वा केवल कम सोच्ने कुरा हुन्। रेपोले अहिलेसम्मका प्रत्येक तर्कलाई 'vibe versus vibe' भन्छ। Opus 5.5 सेप्टेम्बर 22 मा शिप गरिएको थियो, र एक हप्ता अघि मैले तपाईंलाई भनेको थिएँ कि यसले स्वतन्त्र बोर्डमा शीर्ष स्थान हासिल गर्यो जबकि औसत मोडेलभन्दा तीन गुणा बढी शब्दहरू लेखेको थियो। दुई र आधा दिनपछि, ninja hawk नामक एक विकासकर्ताले घडी सुरु गरे, तीस दिनको लागि दिनको एक पटक, लगहरू कसैले पनि सम्पादन गर्न नसक्ने गरी।
0:59 ह्याकर न्यूज थ्रेड लगभग आठ सय अंकमा पुग्यो र एउटा टीम च्याट जस्तै विभाजित भयो। एक टिप्पणीकर्ता भन्छन् कि रिपोर्ट गरिएका धेरैजसो केसहरूमा मोडेलहरूलाई 'नर्फ' गर्नु वास्तविक होइन। अर्को भन्छन् कि मानिसहरू भर्खरै बुद्धिमत्ताको नयाँ स्तरमा अभ्यस्त भइरहेका छन्। र एक Claude Code पावर प्रयोगकर्ताले अब 'rate-this-session' पप-अपलाई हरेक पटक खारेज गर्छन्, किनभने Claude लाई मूल्याङ्कन गर्दा यसले अझ खराब बनाएको जस्तो लाग्यो। Hacker News को थ्रेड लगभग आठ सय अंकमा पुग्यो र एउटा टिम च्याट जस्तै विभाजित भयो। एक टिप्पणीकर्ता भन्छन् कि धेरैजसो रिपोर्ट गरिएका केसहरूमा मोडेलहरूलाई 'नर्फ' गर्नु वास्तविक होइन। अर्को भन्छन् कि मानिसहरू भर्खरै बुद्धिमत्ताको नयाँ स्तरमा अभ्यस्त भइरहेका छन्। र एक Claude Code पावर प्रयोगकर्ताले अब 'rate-this-session' पप-अपलाई हरेक पटक खारेज गर्छन्, किनभने Claude लाई मूल्याङ्कन गर्दा यसले अझ खराब बनाएको जस्तो लाग्यो। Hacker News को थ्रेड लगभग आठ सय अंकमा पुग्यो र एउटा टिम च्याट जस्तै विभाजित भयो। एक टिप्पणीकर्ता भन्छन् कि धेरैजसो रिपोर्ट गरिएका केसहरूमा मोडेलहरूलाई 'नर्फ' गर्नु वास्तविक होइन। अर्को भन्छन् कि मानिसहरू भर्खरै बुद्धिमत्ताको नयाँ स्तरमा अभ्यस्त भइरहेका छन्। र एक Claude Code पावर प्रयोगकर्ताले अब 'rate-this-session' पप-अपलाई हरेक पटक खारेज गर्छन्, किनभने Claude लाई मूल्याङ्कन गर्दा यसले अझ खराब बनाएको जस्तो लाग्यो। Hacker News को थ्रेड लगभग आठ सय अंकमा पुग्यो र एउटा टिम च्याट जस्तै विभाजित भयो। एक टिप्पणीकर्ता भन्छन् कि धेरैजसो रिपोर्ट गरिएका केसहरूमा मोडेलहरूलाई 'नर्फ' गर्नु वास्तविक होइन। अर्को भन्छन् कि मानिसहरू भर्खरै बुद्धिमत्ताको नयाँ स्तरमा अभ्यस्त भइरहेका छन्। र एक Claude Code पावर प्रयोगकर्ताले अब 'rate-this-session' पप-अपलाई हरेक पटक खारेज गर्छन्, किनभने Claude लाई मूल्याङ्कन गर्दा यसले अझ खराब बनाएको जस्तो लाग्यो। Hacker News को थ्रेड लगभग आठ सय अंकमा पुग्यो र एउटा टिम च्याट जस्तै विभाजित भयो। एक टिप्पणीकर्ता भन्छन् कि धेरैजसो रिपोर्ट गरिएका केसहरूमा मोडेलहरूलाई 'नर्फ' गर्नु वास्तविक होइन। अर्को भन्छन् कि मानिसहरू भर्खरै बुद्धिमत्ताको नयाँ स्तरमा अभ्यस्त भइरहेका छन्। र एक Claude Code पावर प्रयोगकर्ताले अब 'rate-this-session' पप-अपलाई हरेक पटक खारेज गर्छन्, किनभने Claude लाई मूल्याङ्कन गर्दा यसले अझ खराब बनाएको जस्तो लाग्यो। Hacker News को थ्रेड लगभग आठ सय अंकमा पुग्यो र एउटा टिम च्याट जस्तै विभाजित भयो। एक टिप्पणीकर्ता भन्छन् कि धेरैजसो रिपोर्ट गरिएका केसहरूमा मोडेलहरूलाई 'नर्फ' गर्नु वास्तविक होइन। अर्को भन्छन् कि मानिसहरू भर्खरै बुद्धिमत्ताको नयाँ स्तरमा अभ्यस्त भइरहेका छन्। र एक Claude Code पावर प्रयोगकर्ताले अब 'rate-this-session' पप-अपलाई हरेक पटक खारेज गर्छन्, किनभने Claude लाई मूल्याङ्कन गर्दा यसले अझ खराब बनाएको जस्तो लाग्यो। पियर समीक्षा। त्यसोभए, प्रश्न एक, तपाईं कसरी 'नर्फ' समात्नुहुन्छ?
नर्फ कसरी समात्ने: 78 कहिलेकाहीँ-सही प्रश्नहरू
1:27 तपाईं लगभग तेईस सय कठिन परीक्षा प्रश्नहरूबाट सुरु गर्नुहुन्छ, र Opus ले पहिलो प्रयासमा ९३ प्रतिशत सही गर्छ, जो एक डिटेक्टरको लागि बेकार छ, किनकि जुन प्रश्न सधैं सही हुन्छ त्यो घट्न सक्दैन। ९७ प्रतिशत सधैं सही वा सधैं गलत थिए, र ७८ जुन कहिलेकाहीँ मात्र सही हुन्छन्, तिनीहरू प्यानल बने। एउटै प्रम्प्ट, कुनै उपकरण छैन, र कुनै AI न्यायाधीश बिना सटीक-म्याच ग्रेडिङ, किनभने न्यायाधीश पनि परिवर्तन हुनेछ। यो हेडलेस Claude Code मार्फत Max सदस्यतामा चल्छ,
1:55 किनकि API संस्करणको मूल्य लगभग १६०० डलर प्रति महिना थियो। र Claude Code संस्करण पिन गरिएको छ, किनकि, रेपोको शब्दमा, परिवर्तित हार्नेस परिवर्तित मोडेल जस्तै देखिन्छ। आँकडाहरू Anthropic मा Evan Miller द्वारा लिखित Adding Error Bars to Evals नामक पेपरबाट आएका हुन्। Anthropic मा Evan Miller द्वारा लिखित Adding Error Bars to Evals नामक पेपरबाट तथ्याङ्कहरू आएका छन्। त्यसैले Anthropic को आफ्नै गणितले अब Anthropic को अडिट गरिरहेको छ, जुन ग्राहक सेवामा सेवाका सर्तहरू उद्धृत गर्ने शैक्षिक संस्करण हो। त्यसैले Anthropic को आफ्नै गणितले अब Anthropic को अडिट गरिरहेको छ, जुन ग्राहक सेवामा सेवाका सर्तहरू उद्धृत गर्ने शैक्षिक संस्करण हो।
यसले के देख्न सक्छ: 7.5 अंक, र टोकन गणना पहिले सर्छ
2:19 प्रश्न दुई, यसले के देख्न सक्छ? दश-दिने विन्डो अनुसार, लगभग साढे सात अंकको गिरावट। rig ले काम गर्छ भनेर प्रमाणित गर्न, लेखकले Claude को प्रयास जानाजानी घटाए। मध्यम प्रयासले उत्पादन लगभग एक चौथाईले घटायो, र स्कोर मात्र चार अंकले। कम प्रयासले उत्पादन लगभग दुई तिहाइले घटायो, आठ अंकको लागि। त्यो भाग चोर्नु पर्ने हो। कम सोचाइ उत्तरहरूमा देखा पर्नु अघि टोकन गणनामा देखा पर्छ।
2:43 त्यसैले तपाईंको मोडेल संस्करण पिन गर्नुहोस्, प्रति कार्य आउटपुट टोकनहरू लग गर्नुहोस्, र आफ्नै केही स्थिर प्रश्नहरू राख्नुहोस्। यदि तपाईंको एजेन्ट अचानक छोटो लेख्छ भने, Reddit जाँच गर्नु अघि आफ्ना लगहरू जाँच गर्नुहोस्। र यहाँ इमानदार भाग छ।
अन्धा ठाउँ: Opus 5 स्वैप र 8 गलत उत्तर कुञ्जीहरू
2:54 चुपचाप पुरानो Opus 5 स्वैप गर्नु rig ले पत्ता लगाउनको लागि धेरै सानो परिवर्तन थियो, र readme ले सुरुमा नै त्यसो भन्छ। अडिटले आठ उत्तर कुञ्जीहरू पनि पत्ता लगायो जुन गलत देखिन्छन्, त्यसैले 'नर्फ' डिटेक्टरले 'नर्फ' पत्ता लगाउनु अघि बेन्चमार्कमा बगहरू पत्ता लगायो।
Anthropic: हामी कहिल्यै मोडेलको गुणस्तर घटाउँदैनौं
3:08 प्रश्न तीन, Anthropic ले के भन्छ? गत वर्ष, गुनासोहरूको लहर पछि, Anthropic ले एउटा पोस्टमार्टम प्रकाशित गर्यो। यसले भन्छ, 'हामी माग, दिनको समय वा सर्भर लोडका कारण मोडेलको गुणस्तर कहिल्यै घटाउँदैनौं।' यसले भन्छ, 'हामी माग, दिनको समय वा सर्भर लोडका कारण मोडेलको गुणस्तर कहिल्यै घटाउँदैनौं।' उही पोस्टले तीनवटा बगले Claude लाई बिगारेको स्वीकार गर्छ, र Claude Code प्रयोगकर्ताहरूको लगभग एक तिहाइले कम्तिमा एक पटक गलत सर्भरहरूमा पुगे। त्यसैले गुनासोहरू वास्तविक थिए र कारण बगहरू थिए, जसका कारण रेपोले चेतावनी दिन्छ कि लन्च हप्ता सबैभन्दा खराब हप्ता हुन सक्छ। जसका कारण रेपोले चेतावनी दिन्छ कि लन्च हप्ता सबैभन्दा खराब हप्ता हुन सक्छ।
3:35 तीस दिन मध्ये छ दिन भइसक्यो। पहिलो सम्भावित घोषणा अक्टोबर २४ को आसपास हुन्छ, त्यसैले इमानदार जवाफ यो हो कि कसैलाई पनि थाहा छैन, निश्चित भएका सबैलाई समेत। कसैले पनि प्रकाशित नगर्ने संख्याहरूको कुरा गर्दा।
डाटा सेन्टरहरूले आफ्ना संख्याहरू गोप्य राख्छन्; Backblaze प्रकाशित गर्छ
3:46 Lighthouse Reports र डच पत्रिका Trouw ले पत्ता लगाए कि युरोपेली डाटा सेन्टरहरूको ठूलो बहुमतले आफ्नो ऊर्जा र पानीको प्रयोग गोप्य राख्छन्, यद्यपि EU नियमले तीन वर्षदेखि रिपोर्टिङ अनिवार्य गरेको छ। यद्यपि EU नियमले तीन वर्षदेखि रिपोर्टिङ अनिवार्य गरेको छ। नेदरल्याण्डमा, एक चौथाई भन्दा कमले मात्र प्रकाशित गर्छन्। एउटा माइक्रोसफ्ट डाटा सेन्टरले मात्र डच बिजुलीको लगभग एक प्रतिशत प्रयोग गर्छ। यसैबीच, Backblaze ले फेरि उही सामान्य कुरा गर्यो। यसको त्रैमासिक ड्राइभ तथ्याङ्कले लगभग तीन लाख पचास हजार हार्ड ड्राइभहरू समेट्छ, र विफलता दर १.७३ प्रतिशतमा पुग्यो,
4:16 केही समय यताको सबैभन्दा उच्च। तीन Seagate मोडेलमा शून्य विफलता थियो। सार्वजनिक आधाररेखा यस्तो देखिन्छ, त्रैमासिक पछि त्रैमासिक, तेह्र वर्षको लागि।
क्रेडिट लाइन: Claude ले मिटर बनाउन मद्दत गर्यो
4:25 अब, त्यो क्रेडिट लाइन। readme ले स्वीकार गर्छ कि रेपोको धेरै भाग Claude को मद्दतले लेखिएको थियो, जो मापन भइरहेको मोडेल हो। त्यसैले Claude ले Claude सुस्त भयो कि भएन भनेर जाँच गर्ने मिटर बनाउन मद्दत गर्यो। त्यसैले ग्रेडरहरू साधारण कार्यहरू हुन्। लेखकको शब्दमा, तपाईंले लेखकलाई विश्वास गर्नु पर्दैन, मानव वा अन्य। यदि तपाईं यो सुन्नु भन्दा पढ्न रुचाउनुहुन्छ भने, diff हरेक बिहान तपाईंको इनबक्समा आउँछ,
4:46 thedailydiff.dev मा निःशुल्क, लिङ्क तल। त्यसोभए, आज live nerf मा फैसला।
फैसला: SHIP IT, र अक्टोबर 24 अघि यसलाई उद्धृत नगर्नुहोस्
4:51 SHIP IT. म यसलाई शिप गर्छु किनभने यो मैले देखेको पहिलो nerf तर्क हो जसमा टाइमस्ट्याम्प, सार्वजनिक नियमपुस्तिका र तोकिएको अन्धा ठाउँ छ। SHIP IT. म यसलाई शिप गर्छु किनभने यो मैले देखेको पहिलो nerf तर्क हो जसमा टाइमस्ट्याम्प, सार्वजनिक नियमपुस्तिका र तोकिएको अन्धा ठाउँ छ। अक्टोबर २४ अघि यसलाई उद्धृत नगर्नुहोस्। र आजको लागि यति नै diff। म Axrisi बाट Niko हुँ। जिम्मेवारीपूर्वक मर्ज गर्नुहोस्।
स्रोतहरू
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



