Ինչպես հայտնաբերել Claude-ի թուլացումը (իրական տվյալներով)
Մարդիկ ասում են, որ Claude-ը յուրաքանչյուր գործարկումից մի քանի շաբաթ անց հիմարանում է։ Մի մշակող Claude Opus 5.5-ը դրեց 30-օրյա ժամացույցի վրա՝ գործարկման շաբաթից սկսած, սառեցված հարցերով, կպցրած Claude Code-ով և հանրային կանոններով, և դա ցույց է տալիս, թե ինչու ոչ ոք չէր կարող իմանալ նախկինում, և թե ինչու ձեր թոքենների քանակը այն է, ինչին պետք է հետևել։ Դատավճիռ՝ SHIP IT։
Մարդիկ ասում են, որ Claude-ը յուրաքանչյուր գործարկումից մի քանի շաբաթ անց հիմարանում է։ Մի մշակող Claude Opus 5.5-ը դրեց 30-օրյա ժամացույցի վրա՝ գործարկման շաբաթից սկսած, սառեցված հարցերով, կպցրած Claude Code-ով և հանրային կանոններով, և դա ցույց է տալիս, թե ինչու ոչ ոք չէր կարող իմանալ նախկինում, և թե ինչու ձեր թոքենների քանակը այն է, ինչին պետք է հետևել։ Դատավճիռ՝ SHIP IT։
Կարդացեք գրավոր տարբերակը (անգլերեն) ↗
Ինչ է ընդգրկում այս տեսանյութը
- Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին
- livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած
- Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր
- Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում
- Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի
Թարգմանված արձանագրություն
Թարգմանվել է բնօրինակ անգլերեն պատմությունից։ Հասանելի աուդիո և ենթագրերը վերահսկվում են YouTube-ի կողմից։
Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին
0:00 Բոլորը գիտեն, որ Claude-ը գործարկումից մի քանի շաբաթ անց հիմարանում է: Այսպիսով, մի մշակող Opus 5.5-ը դրեց ժամացույցի վրա՝ գործարկման շաբաթից սկսած, և ժամացույցն ասում է, որ ոչ ոք դեռ չէր կարող իմանալ: Այս տեսանյութում՝ երեք հարց: Ինչպե՞ս եք բռնում թուլացումը: Ի՞նչ կարող է տեսնել այս չափիչը: Եվ ի՞նչ է ասում Anthropic-ը: Եվ պահեստի վարկային գծերից մեկը ինձ բարձրաձայն ծիծաղեցրեց:
0:20 Ես կանդրադառնամ դրան վերջում: Չորեքշաբթի է, սեպտեմբերի երեսունը, և սա The Daily Diff-ն է: Երեք պատմություն այսօր, և մեծը GitHub պահեստ է, որը կոչվում է live nerf:
livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած
0:30 Ամիսներ շարունակ մարդիկ ասում էին, որ Anthropic-ը գաղտնի թուլացնում է իր մոդելները գործարկումից հետո: Սովորական տեսություններն են սեղմված մոդելը, նույն անվան տակ ավելի փոքր մոդելը կամ պարզապես ավելի քիչ մտածելը: Պահեստը յուրաքանչյուր փաստարկ մինչ այժմ անվանում է տրամադրություններն ընդդեմ տրամադրությունների: Opus 5.5-ը գործարկվել է սեպտեմբերի 22-ին, և մեկ շաբաթ առաջ ես ձեզ ասացի, որ այն գլխավորել է անկախ աղյուսակը՝ գրելով երեք անգամ ավելի շատ բառեր, քան միջին մոդելը: Երկուսուկես օր անց Ninja Hawk անունով մշակողը սկսեց ժամացույցը,
0:59 օրական մեկ անգամ երեսուն օրվա ընթացքում, առանց որևէ մեկի կողմից խմբագրման հնարավորության: The Hacker News-ի թելը հասավ գրեթե ութ հարյուր միավորի և բաժանվեց թիմային չաթի պես։ Մեկ մեկնաբան ասում է, որ մոդելների թուլացումն իրական չէ զեկուցված դեպքերի ճնշող մեծամասնությունում: Մյուսն ասում է, որ մարդիկ պարզապես սովորում են ինտելեկտի նոր մակարդակին: Եվ մեկ Claude Code հզոր օգտատեր այժմ ամեն անգամ մերժում է «գնահատել այս նիստը» pop-up-ը, քանի որ Claude-ի գնահատումը կարծես թե ավելի էր վատթարացնում այն: Փորձագիտական վերանայում։ Այսպիսով, հարց մեկ՝ ինչպե՞ս բռնել թուլացումը:
Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր
1:27 Դուք սկսում եք մոտ երկու հազար երեք հարյուր դժվար քննական հարցերով, և Opus-ը 93 տոկոս ճիշտ է պատասխանում առաջին փորձից, որն անօգուտ է դետեկտորի համար, քանի որ հարցը, որին այն միշտ ճիշտ է պատասխանում, չի կարող ընկնել: 97 տոկոսը միշտ ճիշտ էին կամ միշտ սխալ, և 78-ը, որոնց այն երբեմն միայն ճիշտ է պատասխանում, դարձան վահանակը: Նույն հուշումը, առանց գործիքների, և ճշգրիտ համընկնող գնահատում՝ առանց AI դատավորի, քանի որ դատավորը նույնպես կշեղվեր: Այն աշխատում է Max բաժանորդագրությամբ՝ headless Claude Code-ի միջոցով,
1:55 քանի որ API տարբերակի գինը կազմում էր մոտ տասնվեց հարյուր դոլար ամսական: Եվ Claude Code տարբերակն ամրացված է, քանի որ, պահեստի խոսքերով, փոփոխված հարմարանքը ճիշտ նույնն է թվում, ինչ փոփոխված մոդելը: Վիճակագրությունը ստացվել է «Adding Error Bars to Evals» վերնագրով հոդվածից, Էվան Միլլերի կողմից՝ Anthropic-ից: Այսպիսով, Anthropic-ի սեփական մաթեմատիկան այժմ աուդիտ է անցկացնում Anthropic-ին, որն ակադեմիական տարբերակն է ծառայության պայմանները հաճախորդների աջակցությանը հետ մեջբերելու:
Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում
2:19 Հարց երկու՝ ի՞նչ կարող է տեսնել: Տասնօրյա պատուհանի համար՝ մոտ յոթուկես միավորի անկում: Ապացուցելու համար, որ սարքն աշխատում է, հեղինակը միտումնավոր իջեցրեց Claude-ի ջանքերը: Միջին ջանքերը կրճատեցին ելքը մոտ մեկ քառորդով, իսկ միավորը ընդամենը չորս միավորով: Ցածր ջանքերը կրճատեցին ելքը գրեթե երկու երրորդով, ութ միավորով։ Դա այն մասն է, որ պետք է գողանալ: Քիչ մտածելը երևում է թոքենների քանակում, նախքան պատասխաններում երևալը:
2:43 Այսպիսով, ամրացրեք ձեր մոդելի տարբերակը, գրանցեք ելքային թոքենները ըստ առաջադրանքի, և պահեք ձեր սեփական մի քանի սառեցված հարցեր: Եթե ձեր գործակալը հանկարծ ավելի կարճ է գրում, ստուգեք ձեր տվյալները նախքան Reddit-ը ստուգելը: Եվ ահա անկեղծ մասը:
Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի
2:54 Հին Opus 5-ի գաղտնի փոխանակումը չափազանց փոքր փոփոխություն էր, որպեսզի սարքը կարողանար նկատել, և readme-ն դա հենց սկզբից ասում է: Աուդիտը նաև հայտնաբերել է ութ պատասխանների բանալի, որոնք սխալ են թվում, ուստի թուլացման դետեկտորը սխալներ է հայտնաբերել չափորոշիչում՝ նախքան թուլացում հայտնաբերելը:
Anthropic. մենք երբեք չենք նվազեցնում մոդելի որակը
3:08 Հարց երեք՝ ի՞նչ է ասում Anthropic-ը: Անցյալ տարի, բողոքների ալիքից հետո, Anthropic-ը հրապարակեց հետմահու վերլուծություն: Այն ասում է, մեջբերում եմ. «մենք երբեք չենք նվազեցնում մոդելի որակը պահանջարկի պատճառով, օրվա ժամի կամ սերվերի ծանրաբեռնվածության պատճառով»։ Նույն գրառումը ընդունում է, որ երեք սխալ վատթարացրել էին Claude-ին, և Claude Code-ի օգտատերերի գրեթե մեկ երրորդը առնվազն մեկ անգամ հայտնվել է սխալ սերվերներում։ Այսպիսով, բողոքներն իրական էին, և պատճառը սխալներն էին, որի պատճառով պահեստը զգուշացնում է, որ գործարկման շաբաթը կարող է լինել ամենավատ շաբաթը:
3:35 Երեսուն օրից վեցն անցել են: Առաջին հնարավոր կանչը տեղի է ունենում հոկտեմբերի 24-ի շուրջը, ուստի անկեղծ պատասխանն այն է, որ ոչ ոք չգիտի, ներառյալ բոլոր նրանք, ովքեր համոզված էին: Խոսելով թվերի մասին, որոնք ոչ ոք չի հրապարակում:
Տվյալների կենտրոնները իրենց թվերը գաղտնի են պահում. Backblaze-ը հրապարակում է
3:46 Lighthouse Reports-ը և հոլանդական Trouw թերթը պարզել են, որ եվրոպական տվյալների կենտրոնների ճնշող մեծամասնությունը գաղտնի է պահում իր էներգիայի և ջրի օգտագործումը, չնայած ԵՄ կանոնը երեք տարի է պահանջում է հաշվետվություն: Նիդեռլանդներում քառորդից պակասն է հրապարակում: Միայն մեկ Microsoft-ի տվյալների կենտրոնը օգտագործում է հոլանդական էլեկտրաէներգիայի մոտ մեկ տոկոսը: Միևնույն ժամանակ, Backblaze-ը նորից արեց ձանձրալի բանը: Նրա եռամսյակային սկավառակի վիճակագրությունը ներառում է մոտ երեք հարյուր հիսուն հազար կոշտ սկավառակ, և խափանումների մակարդակը բարձրացել է մինչև 1.73 տոկոս,
4:16 ամենաբարձրը վերջին շրջանում: Երեք Seagate մոդելներում զրո խափանումներ էին: Ահա թե ինչպես է հանրային բազային գիծը, եռամսյակ առ եռամսյակ, տասներեք տարի շարունակ։
Վարկային գիծը. Claude-ը օգնեց կառուցել չափիչը
4:25 Հիմա այդ վարկային գիծը։ Readme-ն ընդունում է, որ պահեստի մեծ մասը գրվել է Claude-ի օգնությամբ, որը չափվող մոդելն է։ Այսպիսով, Claude-ը օգնեց կառուցել չափիչը, որը ստուգում է, թե արդյոք Claude-ը հիմարացել է: Դրա համար էլ գնահատողները պարզ ֆունկցիաներ են: Հեղինակի խոսքերով՝ դուք չպետք է վստահեք հեղինակին, մարդկային կամ այլ կերպ։ Եթե նախընտրում եք սա կարդալ, քան լսել իմ ասածը, ապա տարբերությունը հայտնվում է ձեր մուտքի արկղում
4:46 ամեն առավոտ, անվճար the daily diff dot dev կայքում, հղումը ստորև։ Այսպիսով, այսօրվա դատավճիռը live nerf-ի վերաբերյալ։
Դատավճիռ՝ SHIP IT, և մի մեջբերեք այն մինչև հոկտեմբերի 24-ը
4:51 SHIP IT։ Ես կառաքեմ այն, քանի որ դա առաջին թուլացման փաստարկն է, որը ես տեսել եմ՝ ժամանակային նշումով, հանրային կանոնակարգով և հայտարարված կույր կետով։ Պարզապես մի մեջբերեք այն մինչև հոկտեմբերի 24-ը։ Եվ սա այսօրվա տարբերությունն է: Ես Նիկոն եմ՝ Axrisi-ից: Միավորել պատասխանատվությամբ:
Աղբյուրներ
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



