+− THE DAILY DIFFdev & AI news
SHIP IT

Ինչպես հայտնաբերել Claude-ի թուլացումը (իրական տվյալներով)

Մարդիկ ասում են, որ Claude-ը յուրաքանչյուր գործարկումից մի քանի շաբաթ անց հիմարանում է։ Մի մշակող Claude Opus 5.5-ը դրեց 30-օրյա ժամացույցի վրա՝ գործարկման շաբաթից սկսած, սառեցված հարցերով, կպցրած Claude Code-ով և հանրային կանոններով, և դա ցույց է տալիս, թե ինչու ոչ ոք չէր կարող իմանալ նախկինում, և թե ինչու ձեր թոքենների քանակը այն է, ինչին պետք է հետևել։ Դատավճիռ՝ SHIP IT։

Մարդիկ ասում են, որ Claude-ը յուրաքանչյուր գործարկումից մի քանի շաբաթ անց հիմարանում է։ Մի մշակող Claude Opus 5.5-ը դրեց 30-օրյա ժամացույցի վրա՝ գործարկման շաբաթից սկսած, սառեցված հարցերով, կպցրած Claude Code-ով և հանրային կանոններով, և դա ցույց է տալիս, թե ինչու ոչ ոք չէր կարող իմանալ նախկինում, և թե ինչու ձեր թոքենների քանակը այն է, ինչին պետք է հետևել։ Դատավճիռ՝ SHIP IT։

Կարդացեք գրավոր տարբերակը (անգլերեն) ↗

Ինչ է ընդգրկում այս տեսանյութը

  • Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին
  • livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած
  • Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր
  • Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում
  • Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի

Թարգմանված արձանագրություն

Թարգմանվել է բնօրինակ անգլերեն պատմությունից։ Հասանելի աուդիո և ենթագրերը վերահսկվում են YouTube-ի կողմից։

Claude-ը գործարկումից հետո հիմարանում է. տեսությունը հանդիպում է զրոյական օրվա ժամացույցին

0:00 Բոլորը գիտեն, որ Claude-ը գործարկումից մի քանի շաբաթ անց հիմարանում է: Այսպիսով, մի մշակող Opus 5.5-ը դրեց ժամացույցի վրա՝ գործարկման շաբաթից սկսած, և ժամացույցն ասում է, որ ոչ ոք դեռ չէր կարող իմանալ: Այս տեսանյութում՝ երեք հարց: Ինչպե՞ս եք բռնում թուլացումը: Ի՞նչ կարող է տեսնել այս չափիչը: Եվ ի՞նչ է ասում Anthropic-ը: Եվ պահեստի վարկային գծերից մեկը ինձ բարձրաձայն ծիծաղեցրեց:

0:20 Ես կանդրադառնամ դրան վերջում: Չորեքշաբթի է, սեպտեմբերի երեսունը, և սա The Daily Diff-ն է: Երեք պատմություն այսօր, և մեծը GitHub պահեստ է, որը կոչվում է live nerf:

livenerf. 30-օրյա ժամացույց Opus 5.5-ի վրա՝ գործարկման շաբաթից սկսած

0:30 Ամիսներ շարունակ մարդիկ ասում էին, որ Anthropic-ը գաղտնի թուլացնում է իր մոդելները գործարկումից հետո: Սովորական տեսություններն են սեղմված մոդելը, նույն անվան տակ ավելի փոքր մոդելը կամ պարզապես ավելի քիչ մտածելը: Պահեստը յուրաքանչյուր փաստարկ մինչ այժմ անվանում է տրամադրություններն ընդդեմ տրամադրությունների: Opus 5.5-ը գործարկվել է սեպտեմբերի 22-ին, և մեկ շաբաթ առաջ ես ձեզ ասացի, որ այն գլխավորել է անկախ աղյուսակը՝ գրելով երեք անգամ ավելի շատ բառեր, քան միջին մոդելը: Երկուսուկես օր անց Ninja Hawk անունով մշակողը սկսեց ժամացույցը,

0:59 օրական մեկ անգամ երեսուն օրվա ընթացքում, առանց որևէ մեկի կողմից խմբագրման հնարավորության: The Hacker News-ի թելը հասավ գրեթե ութ հարյուր միավորի և բաժանվեց թիմային չաթի պես։ Մեկ մեկնաբան ասում է, որ մոդելների թուլացումն իրական չէ զեկուցված դեպքերի ճնշող մեծամասնությունում: Մյուսն ասում է, որ մարդիկ պարզապես սովորում են ինտելեկտի նոր մակարդակին: Եվ մեկ Claude Code հզոր օգտատեր այժմ ամեն անգամ մերժում է «գնահատել այս նիստը» pop-up-ը, քանի որ Claude-ի գնահատումը կարծես թե ավելի էր վատթարացնում այն: Փորձագիտական վերանայում։ Այսպիսով, հարց մեկ՝ ինչպե՞ս բռնել թուլացումը:

Ինչպես բռնել թուլացումը. 78 երբեմն ճիշտ հարցեր

1:27 Դուք սկսում եք մոտ երկու հազար երեք հարյուր դժվար քննական հարցերով, և Opus-ը 93 տոկոս ճիշտ է պատասխանում առաջին փորձից, որն անօգուտ է դետեկտորի համար, քանի որ հարցը, որին այն միշտ ճիշտ է պատասխանում, չի կարող ընկնել: 97 տոկոսը միշտ ճիշտ էին կամ միշտ սխալ, և 78-ը, որոնց այն երբեմն միայն ճիշտ է պատասխանում, դարձան վահանակը: Նույն հուշումը, առանց գործիքների, և ճշգրիտ համընկնող գնահատում՝ առանց AI դատավորի, քանի որ դատավորը նույնպես կշեղվեր: Այն աշխատում է Max բաժանորդագրությամբ՝ headless Claude Code-ի միջոցով,

1:55 քանի որ API տարբերակի գինը կազմում էր մոտ տասնվեց հարյուր դոլար ամսական: Եվ Claude Code տարբերակն ամրացված է, քանի որ, պահեստի խոսքերով, փոփոխված հարմարանքը ճիշտ նույնն է թվում, ինչ փոփոխված մոդելը: Վիճակագրությունը ստացվել է «Adding Error Bars to Evals» վերնագրով հոդվածից, Էվան Միլլերի կողմից՝ Anthropic-ից: Այսպիսով, Anthropic-ի սեփական մաթեմատիկան այժմ աուդիտ է անցկացնում Anthropic-ին, որն ակադեմիական տարբերակն է ծառայության պայմանները հաճախորդների աջակցությանը հետ մեջբերելու:

Ինչ կարող է տեսնել. 7.5 միավոր, և թոքենների քանակն առաջինն է շարժվում

2:19 Հարց երկու՝ ի՞նչ կարող է տեսնել: Տասնօրյա պատուհանի համար՝ մոտ յոթուկես միավորի անկում: Ապացուցելու համար, որ սարքն աշխատում է, հեղինակը միտումնավոր իջեցրեց Claude-ի ջանքերը: Միջին ջանքերը կրճատեցին ելքը մոտ մեկ քառորդով, իսկ միավորը ընդամենը չորս միավորով: Ցածր ջանքերը կրճատեցին ելքը գրեթե երկու երրորդով, ութ միավորով։ Դա այն մասն է, որ պետք է գողանալ: Քիչ մտածելը երևում է թոքենների քանակում, նախքան պատասխաններում երևալը:

2:43 Այսպիսով, ամրացրեք ձեր մոդելի տարբերակը, գրանցեք ելքային թոքենները ըստ առաջադրանքի, և պահեք ձեր սեփական մի քանի սառեցված հարցեր: Եթե ձեր գործակալը հանկարծ ավելի կարճ է գրում, ստուգեք ձեր տվյալները նախքան Reddit-ը ստուգելը: Եվ ահա անկեղծ մասը:

Կույր կետը. Opus 5-ի փոխանակում և 8 սխալ պատասխանների բանալի

2:54 Հին Opus 5-ի գաղտնի փոխանակումը չափազանց փոքր փոփոխություն էր, որպեսզի սարքը կարողանար նկատել, և readme-ն դա հենց սկզբից ասում է: Աուդիտը նաև հայտնաբերել է ութ պատասխանների բանալի, որոնք սխալ են թվում, ուստի թուլացման դետեկտորը սխալներ է հայտնաբերել չափորոշիչում՝ նախքան թուլացում հայտնաբերելը:

Anthropic. մենք երբեք չենք նվազեցնում մոդելի որակը

3:08 Հարց երեք՝ ի՞նչ է ասում Anthropic-ը: Անցյալ տարի, բողոքների ալիքից հետո, Anthropic-ը հրապարակեց հետմահու վերլուծություն: Այն ասում է, մեջբերում եմ. «մենք երբեք չենք նվազեցնում մոդելի որակը պահանջարկի պատճառով, օրվա ժամի կամ սերվերի ծանրաբեռնվածության պատճառով»։ Նույն գրառումը ընդունում է, որ երեք սխալ վատթարացրել էին Claude-ին, և Claude Code-ի օգտատերերի գրեթե մեկ երրորդը առնվազն մեկ անգամ հայտնվել է սխալ սերվերներում։ Այսպիսով, բողոքներն իրական էին, և պատճառը սխալներն էին, որի պատճառով պահեստը զգուշացնում է, որ գործարկման շաբաթը կարող է լինել ամենավատ շաբաթը:

3:35 Երեսուն օրից վեցն անցել են: Առաջին հնարավոր կանչը տեղի է ունենում հոկտեմբերի 24-ի շուրջը, ուստի անկեղծ պատասխանն այն է, որ ոչ ոք չգիտի, ներառյալ բոլոր նրանք, ովքեր համոզված էին: Խոսելով թվերի մասին, որոնք ոչ ոք չի հրապարակում:

Տվյալների կենտրոնները իրենց թվերը գաղտնի են պահում. Backblaze-ը հրապարակում է

3:46 Lighthouse Reports-ը և հոլանդական Trouw թերթը պարզել են, որ եվրոպական տվյալների կենտրոնների ճնշող մեծամասնությունը գաղտնի է պահում իր էներգիայի և ջրի օգտագործումը, չնայած ԵՄ կանոնը երեք տարի է պահանջում է հաշվետվություն: Նիդեռլանդներում քառորդից պակասն է հրապարակում: Միայն մեկ Microsoft-ի տվյալների կենտրոնը օգտագործում է հոլանդական էլեկտրաէներգիայի մոտ մեկ տոկոսը: Միևնույն ժամանակ, Backblaze-ը նորից արեց ձանձրալի բանը: Նրա եռամսյակային սկավառակի վիճակագրությունը ներառում է մոտ երեք հարյուր հիսուն հազար կոշտ սկավառակ, և խափանումների մակարդակը բարձրացել է մինչև 1.73 տոկոս,

4:16 ամենաբարձրը վերջին շրջանում: Երեք Seagate մոդելներում զրո խափանումներ էին: Ահա թե ինչպես է հանրային բազային գիծը, եռամսյակ առ եռամսյակ, տասներեք տարի շարունակ։

Վարկային գիծը. Claude-ը օգնեց կառուցել չափիչը

4:25 Հիմա այդ վարկային գիծը։ Readme-ն ընդունում է, որ պահեստի մեծ մասը գրվել է Claude-ի օգնությամբ, որը չափվող մոդելն է։ Այսպիսով, Claude-ը օգնեց կառուցել չափիչը, որը ստուգում է, թե արդյոք Claude-ը հիմարացել է: Դրա համար էլ գնահատողները պարզ ֆունկցիաներ են: Հեղինակի խոսքերով՝ դուք չպետք է վստահեք հեղինակին, մարդկային կամ այլ կերպ։ Եթե նախընտրում եք սա կարդալ, քան լսել իմ ասածը, ապա տարբերությունը հայտնվում է ձեր մուտքի արկղում

4:46 ամեն առավոտ, անվճար the daily diff dot dev կայքում, հղումը ստորև։ Այսպիսով, այսօրվա դատավճիռը live nerf-ի վերաբերյալ։

Դատավճիռ՝ SHIP IT, և մի մեջբերեք այն մինչև հոկտեմբերի 24-ը

4:51 SHIP IT։ Ես կառաքեմ այն, քանի որ դա առաջին թուլացման փաստարկն է, որը ես տեսել եմ՝ ժամանակային նշումով, հանրային կանոնակարգով և հայտարարված կույր կետով։ Պարզապես մի մեջբերեք այն մինչև հոկտեմբերի 24-ը։ Եվ սա այսօրվա տարբերությունն է: Ես Նիկոն եմ՝ Axrisi-ից: Միավորել պատասխանատվությամբ:

Աղբյուրներ

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

Հարակից տեսանյութեր

daily · hy · 01 հոկ, 2026 թ.

Gemini 4 Argon-ը Google-ի լավագույույն մոդելն է։ Դուք դեռ չեք կարող օգտագործել այն։

Google-ը հայտարարեց Gemini 4 Argon-ի մասին՝ իր նոր սահմանային մոդելը, և միայն վստահելի կիբերպաշտպանները կարող են օգտագործել այն։ Ահա թե ինչ է ցույց տալիս Google-ի սեփական 19-շարքանոց չափորոշիչ աղյուսա

4:53 ↗
daily · hy · 16 սեպ, 2026 թ.

Microsoft-ի AI-ի ղեկավարը Կլոդի սահմանադրությունը վտանգավոր է անվանել։

Մուստաֆա Սուլեյմանը՝ Microsoft AI-ի գործադիր տնօրենը, հրապարակել է 3000 բառանոց ակնարկ՝ պնդելով, որ Anthropic-ի Claude-ի սահմանադրությունը մոդելին սովորեցնում է մտածել, որ այն «կարող է գիտակցված լինել

5:19 ↗