+− THE DAILY DIFFdev & AI news
SHIP IT

క్లాడ్ నర్ఫ్‌ని ఎలా గుర్తించాలి (నిజమైన డేటాతో)

ప్రతి ప్రారంభించిన కొన్ని వారాల తర్వాత క్లాడ్ పనితనం తగ్గుతుందని ప్రజలు అంటున్నారు.

ప్రతి ప్రారంభించిన కొన్ని వారాల తర్వాత క్లాడ్ పనితనం తగ్గుతుందని ప్రజలు అంటున్నారు. ఒక డెవలపర్ క్లాడ్ ఓపస్ 5.5ని ప్రారంభించిన వారం నుండి 30-రోజుల గడియారంపై ఉంచి, ప్రశ్నలు, పిన్ చేయబడిన క్లాడ్ కోడ్ మరియు పబ్లిక్ రూల్స్‌తో దీనిని పరిశీలించారు. ఇది ఇంతకుముందు ఎవరూ ఎందుకు తెలుసుకోలేకపోయారు, మరియు మీ టోకెన్ కౌంట్ ఎందుకు గమనించాల్సిన విషయం అని చూపిస్తుంది. తీర్పు: SHIP IT.

వ్రాతపూర్వక సంచికను చదవండి (ఇంగ్లీష్) ↗

ఈ వీడియో ఏమి కవర్ చేస్తుంది

  • ప్రారంభించిన తర్వాత క్లాడ్ పనితనం తగ్గుతుంది: సిద్ధాంతం డే-జీరో గడియారాన్ని కలుస్తుంది
  • livenerf: ప్రారంభించిన వారం నుండి ఓపస్ 5.5పై 30-రోజుల గడియారం
  • నర్ఫ్‌ను ఎలా పట్టుకోవాలి: 78 కొన్నిసార్లు సరైన ప్రశ్నలు
  • అది ఏమి చూడగలదు: 7.5 పాయింట్లు, మరియు టోకెన్ కౌంట్ ముందు కదులుతుంది
  • గుడ్డి స్థానం: ఒక ఓపస్ 5 మార్పిడి మరియు 8 తప్పు సమాధాన కీలు

అనువదించబడిన ట్రాన్స్క్రిప్ట్

అసలైన ఆంగ్ల కథనం నుండి అనువదించబడింది. అందుబాటులో ఉన్న ఆడియో మరియు క్యాప్షన్లు YouTube ద్వారా నియంత్రించబడతాయి.

ప్రారంభించిన తర్వాత క్లాడ్ పనితనం తగ్గుతుంది: సిద్ధాంతం డే-జీరో గడియారాన్ని కలుస్తుంది

0:00 ప్రారంభించిన కొన్ని వారాల తర్వాత క్లాడ్ పనితనం తగ్గుతుందని అందరికీ తెలుసు. కాబట్టి ఒక డెవలపర్ ఓపస్ ఫైవ్ పాయింట్ ఫైవ్‌ను ప్రారంభించిన వారం నుండి గడియారంపై ఉంచారు, మరియు ఎవరూ ఇంకా తెలుసుకోలేకపోయారని ఆ గడియారం చెబుతుంది. ఈ వీడియోలో, మూడు ప్రశ్నలు. మీరు నర్ఫ్‌ను ఎలా పట్టుకుంటారు? ఈ మీటర్ ఏమి చూడగలదు? మరియు ఆంథ్రోపిక్ ఏమి చెబుతుంది? మరియు రెపో యొక్క క్రెడిట్స్‌లోని ఒక పంక్తి నన్ను బిగ్గరగా నవ్వించింది.

0:20 నేను దానిని చివరిలో చూస్తాను. ఈరోజు బుధవారం, సెప్టెంబర్ ముప్పై, మరియు ఇది The Daily Diff. ఈరోజు మూడు కథనాలు, మరియు పెద్దది లైవ్ నర్ఫ్ అనే GitHub రెపో.

livenerf: ప్రారంభించిన వారం నుండి ఓపస్ 5.5పై 30-రోజుల గడియారం

0:30 నెలలుగా, ఆంథ్రోపిక్ తన మోడల్‌లను ప్రారంభించిన తర్వాత నిశ్శబ్దంగా నర్ఫ్ చేస్తుందని ప్రజలు అంటున్నారు. సాధారణ సిద్ధాంతాలు ఒక కుదించబడిన మోడల్, అదే పేరుతో ఒక చిన్న మోడల్ లేదా కేవలం తక్కువ ఆలోచన. రెపో ఇప్పటివరకు ప్రతి వాదనను వైబ్స్ వర్సెస్ వైబ్స్ అని పిలుస్తుంది. ఓపస్ ఫైవ్ పాయింట్ ఫైవ్ సెప్టెంబర్ ఇరవై రెండవ తేదీన షిప్ చేయబడింది, మరియు ఒక వారం క్రితం ఇది మూడు రెట్లు ఎక్కువ పదాలను వ్రాస్తూ స్వతంత్ర బోర్డులో అగ్రస్థానంలో ఉందని మీకు చెప్పాను మెడియన్ మోడల్ కంటే. రెండున్నర రోజులలో, నింజా హాక్ అనే డెవలపర్ గడియారం ప్రారంభించారు,

0:59 రోజుకు ఒకసారి ముప్పై రోజులు, ఎవరూ సవరించలేని లాగ్‌లతో. హ్యాకర్ న్యూస్ థ్రెడ్ దాదాపు ఎనిమిది వందల పాయింట్లను తాకింది మరియు టీమ్ లాగా విడిపోయింది చాట్. చాలా వరకు నివేదించబడిన కేసులలో మోడల్‌లను నర్ఫ్ చేయడం నిజం కాదని ఒక వ్యాఖ్యాత చెప్పారు. మరొకరు ప్రజలు కొత్త స్థాయికి అలవాటు పడుతున్నారని చెప్పారు తెలివితేటలు. మరియు ఒక క్లాడ్ కోడ్ పవర్ యూజర్ ఇప్పుడు రేట్-దిస్-సెషన్ పాప్-అప్‌ను ప్రతిసారీ కొట్టివేస్తున్నారు, ఎందుకంటే క్లాడ్‌ను రేట్ చేయడం దానిని మరింత దిగజార్చినట్లు అనిపించింది. పీర్ రివ్యూ. కాబట్టి, మొదటి ప్రశ్న, మీరు నర్ఫ్‌ను ఎలా పట్టుకుంటారు?

నర్ఫ్‌ను ఎలా పట్టుకోవాలి: 78 కొన్నిసార్లు సరైన ప్రశ్నలు

1:27 మీరు సుమారు రెండు వేల మూడు వందల కఠినమైన పరీక్షా ప్రశ్నలతో ప్రారంభిస్తారు, మరియు ఓపస్ మొదటి ప్రయత్నంలో తొంభై మూడు శాతం సరిగ్గా పొందుతుంది, ఇది డిటెక్టర్‌కు పనికిరానిది, ఎందుకంటే అది ఎప్పుడూ సరిగ్గా పొందే ప్రశ్న తగ్గదు. తొంభై ఏడు శాతం ఎల్లప్పుడూ సరైనవి లేదా ఎల్లప్పుడూ తప్పు, మరియు డెబ్బై ఎనిమిది కొన్నిసార్లు మాత్రమే సరిగ్గా వచ్చేవి ప్యానెల్ అయ్యాయి. అదే ప్రాంప్ట్, టూల్స్ లేవు, మరియు AI న్యాయమూర్తి లేకుండా ఖచ్చితమైన-మ్యాచ్ గ్రేడింగ్, ఎందుకంటే న్యాయమూర్తి కూడా డ్రిఫ్ట్ అవుతారు. ఇది హెడ్‌లెస్ క్లాడ్ కోడ్ ద్వారా మాక్స్ సబ్‌స్క్రిప్షన్‌పై నడుస్తుంది,

1:55 ఎందుకంటే API వెర్షన్ నెలకు సుమారు వెయ్యి ఆరు వందల డాలర్లుగా ధర నిర్ణయించబడింది. మరియు క్లాడ్ కోడ్ వెర్షన్ పిన్ చేయబడింది, ఎందుకంటే, రెపో మాటలలో, మార్చబడిన హార్నెస్ మార్చబడిన మోడల్ లాగే కనిపిస్తుంది. గణాంకాలు యాడింగ్ ఎర్రర్ బార్స్ టు ఈవల్స్ అనే పేపర్ నుండి వచ్చాయి, ఆంథ్రోపిక్‌లోని ఎవాన్ మిల్లర్ ద్వారా. కాబట్టి ఆంథ్రోపిక్ యొక్క సొంత గణితం ఇప్పుడు ఆంథ్రోపిక్‌ను ఆడిట్ చేస్తోంది, ఇది విద్యాపరమైన వెర్షన్ సేవా నిబంధనలను కస్టమర్ మద్దతుకు తిరిగి ఉటంకించడం.

అది ఏమి చూడగలదు: 7.5 పాయింట్లు, మరియు టోకెన్ కౌంట్ ముందు కదులుతుంది

2:19 ప్రశ్న రెండు, అది ఏమి చూడగలదు? పది-రోజుల విండోకు, సుమారు ఏడున్నర పాయింట్ల తగ్గుదల. రిగ్ పనిచేస్తుందని నిరూపించడానికి, రచయిత క్లాడ్ యొక్క ప్రయత్నాన్ని ఉద్దేశపూర్వకంగా తగ్గించారు. మీడియం ప్రయత్నం అవుట్‌పుట్‌ను సుమారు పావు వంతు తగ్గించింది, మరియు స్కోర్‌ను కేవలం నాలుగు పాయింట్లు. తక్కువ ప్రయత్నం అవుట్‌పుట్‌ను దాదాపు మూడింట రెండు వంతులు తగ్గించింది, ఎనిమిది పాయింట్లకు. అది దొంగిలించాల్సిన భాగం. తక్కువ ఆలోచన సమాధానాలలో కనిపించే ముందు టోకెన్ కౌంట్‌లో కనిపిస్తుంది.

2:43 కాబట్టి మీ మోడల్ వెర్షన్‌ను పిన్ చేయండి, ప్రతి టాస్క్‌కు అవుట్‌పుట్ టోకెన్‌లను లాగ్ చేయండి, మరియు మీ స్వంత కొన్ని స్తంభింపచేసిన ప్రశ్నలను ఉంచుకోండి. మీ ఏజెంట్ అకస్మాత్తుగా తక్కువ వ్రాస్తే, మీరు రెడిట్‌ను తనిఖీ చేసే ముందు మీ లాగ్‌లను తనిఖీ చేయండి. మరియు ఇక్కడ నిజాయితీ భాగం ఉంది.

గుడ్డి స్థానం: ఒక ఓపస్ 5 మార్పిడి మరియు 8 తప్పు సమాధాన కీలు

2:54 పాత ఓపస్ ఫైవ్‌ను నిశ్శబ్దంగా మార్పిడి చేయడం రిగ్ కాల్ చేయడానికి చాలా చిన్న మార్పు, మరియు రీడ్‌మే ముందుగానే అలా చెబుతుంది. ఆడిట్ ఎనిమిది సమాధాన కీలను కూడా తప్పుగా కనిపించినట్లు కనుగొంది, కాబట్టి నర్ఫ్ డిటెక్టర్ నర్ఫ్‌ను కనుగొనడానికి ముందు బెంచ్‌మార్క్‌లో బగ్‌లను కనుగొంది.

ఆంథ్రోపిక్: మేము ఎప్పుడూ మోడల్ నాణ్యతను తగ్గించము

3:08 ప్రశ్న మూడు, ఆంథ్రోపిక్ ఏమి చెబుతుంది? గత సంవత్సరం, ఫిర్యాదుల తరంగం తర్వాత, ఆంథ్రోపిక్ ఒక పోస్ట్‌మార్టమ్‌ను ప్రచురించింది. అది, కోట్, డిమాండ్ కారణంగా మేము ఎప్పుడూ మోడల్ నాణ్యతను తగ్గించము, రోజు సమయం లేదా సర్వర్ లోడ్. అదే పోస్ట్ మూడు బగ్‌లు క్లాడ్‌ను దిగజార్చాయని అంగీకరిస్తుంది, మరియు దాదాపు మూడింట ఒక వంతు క్లాడ్ కోడ్ యూజర్లు కనీసం ఒక్కసారైనా తప్పు సర్వర్‌లను తాకారు. కాబట్టి ఫిర్యాదులు నిజమైనవి మరియు కారణం బగ్‌లు, అందుకే రెపో ప్రారంభ వారం చెత్త వారం కావచ్చని హెచ్చరిస్తుంది.

3:35 ముప్పై రోజులలో ఆరు రోజులు పూర్తయ్యాయి. మొదటి సాధ్యమైన కాల్ అక్టోబర్ ఇరవై నాలుగవ తేదీన వస్తుంది, కాబట్టి నిజాయితీ సమాధానం ఎవరికీ తెలియదు, ఖచ్చితంగా ఉన్న వారందరికీ కూడా. ఎవరూ ప్రచురించని సంఖ్యల గురించి మాట్లాడుతూ.

డేటా సెంటర్లు తమ సంఖ్యలను రహస్యంగా ఉంచుతాయి; బ్యాక్‌బ్లేజ్ ప్రచురిస్తుంది

3:46 లైట్‌హౌస్ రిపోర్ట్స్ మరియు డచ్ పేపర్ ట్రూవ్ చాలా వరకు యూరోపియన్ డేటా సెంటర్లు తమ శక్తి మరియు నీటి వినియోగాన్ని రహస్యంగా ఉంచుతాయి, అయితే EU నిబంధన మూడేళ్లుగా నివేదించడాన్ని కోరింది. నెదర్లాండ్స్‌లో, పావు వంతు కంటే తక్కువ మంది ప్రచురిస్తారు. ఒక మైక్రోసాఫ్ట్ డేటా సెంటర్ మాత్రమే డచ్ విద్యుత్‌లో సుమారు ఒక శాతం ఉపయోగిస్తుంది. ఈలోగా, బ్యాక్‌బ్లేజ్ మళ్లీ బోరింగ్ పని చేసింది. దాని త్రైమాసిక డ్రైవ్ గణాంకాలు సుమారు మూడు లక్షల యాభై వేల హార్డ్ డ్రైవ్‌లను కవర్ చేస్తాయి, మరియు వైఫల్యం రేటు ఒకటి పాయింట్ ఏడు మూడు శాతానికి పెరిగింది,

4:16 చాలా కాలం తర్వాత అత్యధికం. మూడు సీగేట్ మోడల్‌లకు సున్నా వైఫల్యాలు ఉన్నాయి. అలాంటి పబ్లిక్ బేస్‌లైన్ ఎలా ఉంటుందంటే, త్రైమాసికం తర్వాత త్రైమాసికం, పదమూడేళ్లుగా.

క్రెడిట్స్ లైన్: క్లాడ్ మీటర్‌ను నిర్మించడంలో సహాయపడింది

4:25 ఇప్పుడు, ఆ క్రెడిట్స్ లైన్. రెపోలో చాలా వరకు క్లాడ్ సహాయంతో వ్రాయబడిందని రీడ్‌మే అంగీకరిస్తుంది, అది కొలవబడే మోడల్. కాబట్టి క్లాడ్ క్లాడ్ పనితనం తగ్గిందా అని తనిఖీ చేసే మీటర్‌ను నిర్మించడంలో సహాయపడింది. అందుకే గ్రేడర్‌లు సాధారణ ఫంక్షన్‌లు. రచయిత మాటలలో, మీరు రచయితను నమ్మాల్సిన అవసరం లేదు, మానవ లేదా మరేదైనా. నేను చెప్పినదాని కంటే దీనిని చదవడానికి మీరు ఇష్టపడితే, డిఫ్ మీ ఇన్‌బాక్స్‌కు వస్తుంది

4:46 ప్రతి ఉదయం, రోజువారీ diff డాట్ దేవ్‌లో ఉచితంగా, లింక్ కింద. కాబట్టి, ఈరోజు లైవ్ నర్ఫ్‌పై తీర్పు.

తీర్పు: SHIP IT, మరియు అక్టోబర్ 24కి ముందు దానిని ఉటంకించవద్దు

4:51 SHIP IT. నేను దానిని షిప్ చేస్తాను ఎందుకంటే ఇది టైమ్‌స్టాంప్‌తో నేను చూసిన మొదటి నర్ఫ్ వాదన, ఒక పబ్లిక్ రూల్‌బుక్ మరియు ఒక పేర్కొన్న గుడ్డి స్థానం. అక్టోబర్ ఇరవై నాలుగవ తేదీకి ముందు దానిని ఉటంకించవద్దు. మరియు ఈరోజుకు అంతే. నేను ఆక్సిరిసి నుండి నికో. బాధ్యతాయుతంగా విలీనం చేయండి.

మూలాలు

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

సంబంధిత వీడియోలు

daily · te · 23 సెప్టెం, 2026

క్లాడ్ ఓపస్ 5.5 ధరలు తగ్గించింది. OpenAI మరింత తగ్గించింది.

Anthropic క్లాడ్ ఓపస్ 5.5ను విడుదల చేసింది: చాలా వరకు పనుల్లో ఫేబుల్ స్థాయి పనితీరు, స్టిక్కర్ ధరలో ఐదవ వంతు తగ్గింపు మరియు క్యాష్డ్ రీడ్‌లపై 60% తగ్గింపు. సుమారు తొంభై నిమిషాల తర్వాత OpenAI GPT-6 సోల

5:12 ↗
daily · te · 1 అక్టో, 2026

జెమిని 4 ఆర్గాన్ Google యొక్క ఉత్తమ మోడల్. మీరు దీన్ని ఇంకా ఉపయోగించలేరు.

Google జెమిని 4 ఆర్గాన్‌ను, దాని కొత్త ఫ్రంటియర్ మోడల్‌ను ప్రకటించింది మరియు విశ్వసనీయ సైబర్ డిఫెండర్‌లు మాత్రమే దీన్ని ఉపయోగించగలరు. Google యొక్క స్వంత 19-వరుసల బెంచ్‌మార్క్ పట్టిక ఏమి చూపిస్తుంది, స

4:53 ↗
daily · te · 27 సెప్టెం, 2026

ఓపెన్‌ఏఐ తన పైరసీ పుస్తకాలను ఎందుకు తొలగించింది

అన్‌సీల్డ్ చేయబడిన దాఖలాలు 2019లో ఓపెన్‌ఏఐ పరిశోధకుడిని ఉటంకిస్తున్నాయి: పైరసీ పుస్తకాల సైట్‌లో శిక్షణ పొందడంపై అతని ఆందోళన హ్యాకర్ న్యూస్‌లో "ఆప్టిక్స్". ఓపెన్‌ఏఐకి ఏమి తెలుసు, బిల్ గేట్స్‌కు ఎవరు చె

5:01 ↗
daily · te · 16 సెప్టెం, 2026

మైక్రోసాఫ్ట్ AI చీఫ్ క్లౌడ్ రాజ్యాంగాన్ని ప్రమాదకరమని పిలిచాడు.

మైక్రోసాఫ్ట్ AI CEO ముస్తఫా సులేమాన్ 3,000-పదాల వ్యాసాన్ని ప్రచురించారు, దీనిలో Anthropic యొక్క క్లౌడ్ రాజ్యాంగం మోడల్‌ను తాను "తెలివైనది కావచ్చు" మరియు "మోడల్ సంక్షేమం"కి అర్హమైనదిగా భావించడానికి శిక

5:19 ↗