چگونه ضعیف شدن Claude را تشخیص دهیم (با دادههای واقعی)
مردم میگویند Claude چند هفته پس از هر راهاندازی کندتر میشود.
مردم میگویند Claude چند هفته پس از هر راهاندازی کندتر میشود. یک توسعهدهنده Claude Opus 5.5 را از هفتهی راهاندازی روی یک ساعت 30 روزه قرار داد، با سؤالات ثابت، یک Claude Code پینشده و قوانین عمومی، و این نشان میدهد که چرا هیچکس قبلاً نمیتوانست بداند، و چرا تعداد توکنهای شما چیزی است که باید به آن توجه کنید. نتیجه: SHIP IT.
نسخه نوشتاری را بخوانید (انگلیسی) ↗
این ویدیو چه مواردی را پوشش میدهد
- Claude پس از راهاندازی کندتر میشود: نظریه با یک ساعت روز صفر مواجه میشود
- livenerf: یک ساعت 30 روزه روی Opus 5.5 از هفتهی راهاندازی
- چگونه ضعیف شدن را تشخیص دهیم: 78 سؤال گاهی اوقات درست
- چه چیزی میتواند ببیند: 7.5 امتیاز، و تعداد توکنها اول حرکت میکند
- نقطه کور: یک تعویض Opus 5 و 8 کلید پاسخ اشتباه
رونوشت ترجمه شده
ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویسهای موجود توسط YouTube کنترل میشوند.
Claude پس از راهاندازی کندتر میشود: نظریه با یک ساعت روز صفر مواجه میشود
0:00 همه میدانند که Claude چند هفته پس از راهاندازی کندتر میشود. بنابراین یک توسعهدهنده Opus 5.5 را از هفتهی راهاندازی روی یک ساعت قرار داد، و ساعت میگوید که هیچکس هنوز نمیتوانسته بداند. در این ویدئو، سه سؤال. چگونه یک ضعیف شدن را تشخیص میدهید؟ این سنجشگر چه چیزی را میتواند ببیند؟ و Anthropic چه میگوید؟ و یک خط در اعتبارات مخزن مرا به خنده انداخت.
0:20 در آخر به آن خواهم پرداخت. چهارشنبه 30 سپتامبر است و این The Daily Diff است. امروز سه داستان، و داستان بزرگ یک مخزن GitHub به نام livenerf است.
livenerf: یک ساعت 30 روزه روی Opus 5.5 از هفتهی راهاندازی
0:30 ماههاست که مردم میگویند Anthropic مدلهای خود را پس از راهاندازی بیسروصدا ضعیف میکند. نظریههای معمول یک مدل فشردهشده، یک مدل کوچکتر با همان نام یا به سادگی تفکر کمتر است. این مخزن هر استدلال تاکنون را «فضاسازی در برابر فضاسازی» مینامد. Opus 5.5 در 22 سپتامبر منتشر شد، و یک هفته پیش به شما گفتم که در حالی که سه برابر بیشتر از مدل متوسط کلمه مینوشت، در صدر جدول مستقل قرار گرفت. دو و نیم روز بعد، توسعهدهندهای به نام ninja hawk ساعت را آغاز کرد،
0:59 روزی یک بار به مدت سی روز، با گزارشهایی که هیچکس نمیتواند ویرایش کند. رشته Hacker News تقریباً به 800 امتیاز رسید و مانند یک چت تیمی تقسیم شد. یک نظردهنده میگوید ضعیف کردن مدلها در اکثریت قریب به اتفاق موارد گزارششده واقعی نیست. دیگری میگوید مردم فقط به سطح جدیدی از هوش عادت میکنند. و یک کاربر حرفهای Claude Code اکنون هر بار پاپآپ «امتیاز به این جلسه» را رد میکند، زیرا امتیاز دادن به Claude به نظر میرسید آن را بدتر میکند. بازبینی همتا. پس، سؤال اول، چگونه یک ضعیف شدن را تشخیص میدهید؟
چگونه ضعیف شدن را تشخیص دهیم: 78 سؤال گاهی اوقات درست
1:27 با حدود 2300 سؤال امتحانی دشوار شروع میکنید، و Opus 93 درصد را در اولین تلاش درست جواب میدهد، که برای یک آشکارساز بیفایده است، زیرا سؤالی که همیشه درست جواب میدهد نمیتواند کاهش یابد. 97 درصد همیشه درست یا همیشه غلط بودند، و 78 سؤالی که فقط گاهی اوقات درست جواب میدهد، پنل را تشکیل داد. همان پرامپت، بدون ابزار، و درجهبندی تطابق دقیق بدون داور هوش مصنوعی، زیرا داور هم تغییر میکرد. روی اشتراک Max از طریق headless Claude Code اجرا میشود،
1:55 زیرا نسخهی API با قیمت حدود 1600 دلار در ماه بود. و نسخهی Claude Code پین شده است، زیرا، به گفتهی مخزن، یک مهار تغییر یافته دقیقاً شبیه یک مدل تغییر یافته به نظر میرسد. آمار از مقالهای به نام «اضافه کردن میلههای خطا به ارزیابیها» میآید، توسط ایوان میلر در Anthropic. بنابراین ریاضیات خود Anthropic اکنون Anthropic را ممیزی میکند، که نسخهی آکادمیک استناد به شرایط خدمات به پشتیبانی مشتری است.
چه چیزی میتواند ببیند: 7.5 امتیاز، و تعداد توکنها اول حرکت میکند
2:19 سؤال دوم، چه چیزی را میتواند ببیند؟ در هر پنجره 10 روزه، کاهشی حدود هفت و نیم امتیاز. برای اثبات کارکرد دستگاه، نویسنده عمداً تلاش Claude را کاهش داد. تلاش متوسط خروجی را حدود یک چهارم و امتیاز را فقط چهار امتیاز کاهش داد. تلاش کم خروجی را تقریباً دو سوم کاهش داد، برای هشت امتیاز. این قسمتی است که باید دزدید. تفکر کمتر در تعداد توکنها قبل از ظاهر شدن در پاسخها نمایان میشود.
2:43 پس نسخهی مدل خود را پین کنید، توکنهای خروجی را برای هر کار ثبت کنید، و چند سؤال ثابت خود را نگه دارید. اگر عامل شما ناگهان کوتاهتر مینویسد، قبل از بررسی Reddit، گزارشهای خود را بررسی کنید. و این قسمت صادقانه است.
نقطه کور: یک تعویض Opus 5 و 8 کلید پاسخ اشتباه
2:54 تعویض بیسروصدا با Opus 5 قدیمیتر تغییر کوچکی بود که دستگاه آن را تشخیص دهد، و فایل readme این را از ابتدا میگوید. ممیزی همچنین هشت کلید پاسخ را پیدا کرد که اشتباه به نظر میرسند، بنابراین آشکارساز ضعیف شدن، باگهایی را در بنچمارک قبل از یافتن یک ضعیف شدن پیدا کرد.
Anthropic: ما هرگز کیفیت مدل را کاهش نمیدهیم
3:08 سؤال سوم، Anthropic چه میگوید؟ سال گذشته، پس از موجی از شکایات، Anthropic یک پس از مرگ منتشر کرد. آن میگوید، نقل قول: «ما هرگز کیفیت مدل را به دلیل تقاضا، زمان روز یا بار سرور کاهش نمیدهیم.» همان پست اعتراف میکند که سه باگ Claude را تخریب کرده بودند، و تقریباً یک سوم از کاربران Claude Code حداقل یک بار به سرورهای اشتباه متصل شدند. بنابراین شکایات واقعی بودند و علت آن باگها بود، به همین دلیل مخزن هشدار میدهد که هفتهی راهاندازی میتواند بدترین هفته باشد.
3:35 شش از سی روز گذشته است. اولین تماس ممکن حدود 24 اکتبر اتفاق میافتد، بنابراین پاسخ صادقانه این است که هیچکس نمیداند، از جمله همهی کسانی که مطمئن بودند. صحبت از اعدادی که هیچکس منتشر نمیکند.
مراکز داده اعداد خود را مخفی نگه میدارند؛ Backblaze منتشر میکند
3:46 Lighthouse Reports و روزنامه هلندی Trouw دریافتند که اکثریت قریب به اتفاق مراکز داده اروپایی مصرف برق و آب خود را مخفی نگه میدارند، اگرچه یک قانون اتحادیه اروپا گزارشدهی را به مدت سه سال الزامی کرده است. در هلند، کمتر از یک چهارم منتشر میکنند. فقط یک مرکز داده مایکروسافت حدود یک درصد از برق هلند را مصرف میکند. در همین حال، Backblaze دوباره کار خستهکننده را انجام داد. آمار فصلی درایو آن حدود 350,000 هارد دیسک را پوشش میدهد، و نرخ خرابی به 1.73 درصد افزایش یافت،
4:16 بالاترین نرخ در مدتی طولانی. سه مدل Seagate خرابی صفر داشتند. این چیزی است که یک خط پایه عمومی، سهماهه به سهماهه، به مدت سیزده سال به نظر میرسد.
خط اعتبارات: Claude به ساخت سنجشگر کمک کرد
4:25 حالا، آن خط اعتبارات. فایل readme اعتراف میکند که بخش زیادی از مخزن با کمک Claude نوشته شده است، که همان مدلی است که اندازهگیری میشود. بنابراین Claude به ساخت سنجشگری که بررسی میکند آیا Claude کندتر شده است کمک کرد. به همین دلیل است که درجهبندها توابع سادهای هستند. به گفتهی نویسنده، «نباید به نویسنده اعتماد کنید، انسانی یا غیرانسانی.» اگر ترجیح میدهید این را بخوانید تا از من بشنوید، The Daily Diff هر روز صبح
4:46 به صورت رایگان در صندوق ورودی شما قرار میگیرد، در thedailydiff.dev، لینک زیر. پس، نتیجهی امروز در مورد livenerf.
نتیجه: SHIP IT، و قبل از 24 اکتبر آن را نقل قول نکنید
4:51 SHIP IT. من آن را SHIP IT میکنم زیرا این اولین استدلال ضعیف شدن است که من با یک برچسب زمانی، یک کتاب قوانین عمومی و یک نقطه کور مشخص دیدهام. فقط قبل از 24 اکتبر آن را نقل قول نکنید. و این The Diff برای امروز است. من نیکو از Axrisi هستم. مسئولانه ادغام کنید.
منابع
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



