วิธีตรวจจับ Claude ที่ถูกลดประสิทธิภาพ (พร้อมข้อมูลจริง)
ผู้คนกล่าวว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัวแต่ละครั้ง นักพัฒนาคนหนึ่งได้ใช้ Claude Opus 5.5 เป็นเวลา 30 วันนับจากสัปดาห์ที่เปิดตัว โดยมีคำถามที่คงที่, Claude Code ที่ตรึงไว้ และกฎสาธารณะ และมันแสดงให้เห็นว่าทำไมไม่มีใครสามารถรู้มาก่อนได้ และทำไมจำนวนโทเค็นของคุณคือสิ่งที่จะต้องจับตาดู คำตัดสิน: SHIP IT.
ผู้คนกล่าวว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัวแต่ละครั้ง นักพัฒนาคนหนึ่งได้ใช้ Claude Opus 5.5 เป็นเวลา 30 วันนับจากสัปดาห์ที่เปิดตัว โดยมีคำถามที่คงที่, Claude Code ที่ตรึงไว้ และกฎสาธารณะ และมันแสดงให้เห็นว่าทำไมไม่มีใครสามารถรู้มาก่อนได้ และทำไมจำนวนโทเค็นของคุณคือสิ่งที่จะต้องจับตาดู คำตัดสิน: SHIP IT.
อ่านฉบับลายลักษณ์อักษร (ภาษาอังกฤษ) ↗
วิดีโอนี้ครอบคลุมอะไรบ้าง
- Claude ฉลาดน้อยลงหลังเปิดตัว: ทฤษฎีพบกับการนับถอยหลังตั้งแต่วันแรก
- livenerf: การนับถอยหลัง 30 วันสำหรับ Opus 5.5 นับจากสัปดาห์เปิดตัว
- วิธีจับการลดประสิทธิภาพ: 78 คำถามที่บางครั้งก็ถูก
- สิ่งที่สามารถเห็นได้: 7.5 คะแนน และจำนวนโทเค็นจะเคลื่อนที่ก่อน
- จุดบอด: การสลับ Opus 5 และ 8 คีย์คำตอบที่ผิด
บทถอดเสียงที่แปลแล้ว
แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube
Claude ฉลาดน้อยลงหลังเปิดตัว: ทฤษฎีพบกับการนับถอยหลังตั้งแต่วันแรก
0:00 ทุกคนรู้ว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัว ดังนั้น นักพัฒนาคนหนึ่งจึงเริ่มนับเวลาสำหรับ Opus five point five ตั้งแต่สัปดาห์เปิดตัว และเวลาบอกว่ายังไม่มีใครสามารถรู้ได้ ในวิดีโอนี้ มีสามคำถาม คุณจะตรวจจับการลดประสิทธิภาพได้อย่างไร มิเตอร์นี้เห็นอะไรได้บ้าง และ Anthropic พูดว่าอย่างไร และบรรทัดหนึ่งในเครดิตของ repo ทำให้ฉันหัวเราะออกมาดังๆ
0:20 ฉันจะพูดถึงมันในตอนท้าย วันนี้คือวันพุธที่สามสิบกันยายน และนี่คือ The Daily Diff วันนี้มีสามเรื่อง และเรื่องใหญ่คือ GitHub repo ที่ชื่อว่า live nerf
livenerf: การนับถอยหลัง 30 วันสำหรับ Opus 5.5 นับจากสัปดาห์เปิดตัว
0:30 เป็นเวลาหลายเดือนแล้วที่ผู้คนกล่าวว่า Anthropic ลดประสิทธิภาพของโมเดลอย่างเงียบๆ หลังจากการเปิดตัว ทฤษฎีทั่วไปคือโมเดลถูกบีบอัด, โมเดลที่เล็กลงภายใต้ชื่อเดียวกัน หรือเพียงแค่คิดน้อยลง repo เรียกทุกข้อโต้แย้งที่ผ่านมาว่าความรู้สึกปะทะความรู้สึก Opus five point five เปิดตัวเมื่อวันที่ยี่สิบสองกันยายน และเมื่อหนึ่งสัปดาห์ที่แล้ว ฉันบอกคุณว่ามันติดอันดับกระดานอิสระขณะเขียน คำศัพท์มากกว่าโมเดลเฉลี่ยถึงสามเท่า หลังจากสองวันครึ่ง นักพัฒนาที่ชื่อ ninja hawk เริ่มนับเวลา
0:59 วันละครั้งเป็นเวลาสามสิบวัน พร้อมบันทึกที่ไม่สามารถแก้ไขได้ กระทู้ Hacker News ได้รับเกือบแปดร้อยคะแนนและแยกออกเหมือนทีม แชท ผู้แสดงความคิดเห็นคนหนึ่งกล่าวว่าการลดประสิทธิภาพของโมเดลไม่เป็นความจริงในกรณีส่วนใหญ่ ของกรณีที่รายงาน อีกคนกล่าวว่าผู้คนกำลังทำความคุ้นเคยกับระดับใหม่ของ ความฉลาด และผู้ใช้พลังงาน Claude Code คนหนึ่งตอนนี้ยกเลิกการให้คะแนนเซสชันนี้ ป๊อปอัปทุกครั้ง เพราะการให้คะแนน Claude ดูเหมือนจะทำให้มันแย่ลง การทบทวนโดยเพื่อนร่วมงาน ดังนั้น คำถามแรกคือ คุณจะตรวจจับการลดประสิทธิภาพได้อย่างไร
วิธีจับการลดประสิทธิภาพ: 78 คำถามที่บางครั้งก็ถูก
1:27 คุณเริ่มต้นด้วยคำถามสอบยากประมาณสองพันสามร้อยข้อ และ Opus ได้คะแนนถูก 93 เปอร์เซ็นต์ในการลองครั้งแรก ซึ่งไม่มีประโยชน์สำหรับตัวตรวจจับ เนื่องจากคำถามที่มันตอบถูกเสมอไม่สามารถ ลดลงได้ เก้าสิบเจ็ดเปอร์เซ็นต์ถูกเสมอหรือผิดเสมอ และเจ็ดสิบแปดข้อที่บางครั้งเท่านั้นที่ตอบถูกกลายเป็นคณะกรรมการ พร้อมท์เดียวกัน ไม่มีเครื่องมือ และการให้คะแนนแบบจับคู่ที่ตรงกันโดยไม่มี AI เป็นผู้ตัดสิน เพราะผู้ตัดสินก็จะเปลี่ยนไปเช่นกัน มันทำงานบนการสมัครสมาชิก Max ผ่าน headless Claude Code
1:55 เนื่องจากเวอร์ชัน API มีราคาประมาณหนึ่งพันหกร้อยดอลลาร์ต่อเดือน และเวอร์ชัน Claude Code ถูกตรึงไว้ เพราะ ตามคำพูดของ repo สายรัดที่เปลี่ยนไปดูเหมือนโมเดลที่เปลี่ยนไปทุกประการ สถิติมาจากเอกสารที่ชื่อว่า Adding Error Bars to Evals โดย Evan Miller จาก Anthropic ดังนั้น คณิตศาสตร์ของ Anthropic เองตอนนี้กำลังตรวจสอบ Anthropic ซึ่งเป็นเวอร์ชันทางวิชาการ ของการอ้างอิงข้อกำหนดการบริการกลับไปยังฝ่ายสนับสนุนลูกค้า
สิ่งที่สามารถเห็นได้: 7.5 คะแนน และจำนวนโทเค็นจะเคลื่อนที่ก่อน
2:19 คำถามที่สอง มันเห็นอะไรได้บ้าง ต่อหน้าต่างสิบวัน ลดลงประมาณเจ็ดจุดครึ่ง เพื่อพิสูจน์ว่าเครื่องมือนี้ใช้งานได้ ผู้เขียนจึงลดความพยายามของ Claude โดยเจตนา ความพยายามปานกลางลดผลลัพธ์ลงประมาณหนึ่งในสี่ และคะแนนลงเพียงสี่ จุด ความพยายามต่ำลดผลลัพธ์ลงเกือบสองในสาม สำหรับแปดคะแนน นั่นคือส่วนที่จะขโมย การคิดที่น้อยลงปรากฏในจำนวนโทเค็นก่อนที่จะปรากฏในคำตอบ
2:43 ดังนั้น ให้ตรึงเวอร์ชันโมเดลของคุณ บันทึกโทเค็นเอาต์พุตต่อภารกิจ และเก็บคำถามที่คงที่ของคุณเองไว้สองสามข้อ หากตัวแทนของคุณเขียนสั้นลงกะทันหัน ให้ตรวจสอบบันทึกของคุณก่อนที่จะตรวจสอบ Reddit และนี่คือส่วนที่ซื่อสัตย์
จุดบอด: การสลับ Opus 5 และ 8 คีย์คำตอบที่ผิด
2:54 การสลับ Opus five รุ่นเก่าอย่างเงียบๆ เป็นการเปลี่ยนแปลงที่เล็กเกินไปสำหรับเครื่องมือนี้ที่จะ เรียก และ readme ก็ระบุไว้ล่วงหน้า การตรวจสอบยังพบคีย์คำตอบแปดข้อที่ดูเหมือนผิด ดังนั้น ตัวตรวจจับการลดประสิทธิภาพจึงพบข้อบกพร่องในการเปรียบเทียบก่อนที่จะพบการลดประสิทธิภาพ
Anthropic: เราไม่เคยลดคุณภาพของโมเดล
3:08 คำถามที่สาม Anthropic พูดว่าอย่างไร ปีที่แล้ว หลังจากมีข้อร้องเรียนจำนวนมาก Anthropic ได้เผยแพร่รายงานการชันสูตรพลิกศพ มันกล่าวว่า, อ้างอิง, เราไม่เคยลดคุณภาพของโมเดลเนื่องจากความต้องการ ช่วงเวลาของวัน หรือภาระเซิร์ฟเวอร์ โพสต์เดียวกันยอมรับว่ามีข้อบกพร่องสามประการที่ทำให้ Claude เสื่อมสภาพ และเกือบหนึ่งในสามของ ผู้ใช้ Claude Code เข้าถึงเซิร์ฟเวอร์ผิดอย่างน้อยหนึ่งครั้ง ดังนั้น ข้อร้องเรียนเป็นเรื่องจริงและสาเหตุคือข้อบกพร่อง ซึ่งเป็นเหตุผลที่ repo เตือนว่าสัปดาห์เปิดตัวอาจเป็นสัปดาห์ที่แย่ที่สุด
3:35 หกในสามสิบวันผ่านไปแล้ว การเรียกที่เป็นไปได้ครั้งแรกจะเกิดขึ้นประมาณวันที่ยี่สิบสี่ตุลาคม ดังนั้น คำตอบที่ซื่อสัตย์คือไม่มีใครรู้ รวมถึงทุกคนที่แน่ใจ พูดถึงตัวเลขที่ไม่มีใครเผยแพร่
ศูนย์ข้อมูลเก็บตัวเลขเป็นความลับ; Backblaze เผยแพร่
3:46 Lighthouse Reports และหนังสือพิมพ์ดัตช์ Trouw พบว่าส่วนใหญ่ของ ศูนย์ข้อมูลยุโรปเก็บการใช้พลังงานและน้ำเป็นความลับ แม้ว่ากฎของสหภาพยุโรปจะกำหนดให้มีการรายงานเป็นเวลาสามปีแล้ว ในเนเธอร์แลนด์ มีน้อยกว่าหนึ่งในสี่ที่เผยแพร่ ศูนย์ข้อมูล Microsoft แห่งเดียวใช้อะตอมประมาณหนึ่งเปอร์เซ็นต์ของไฟฟ้าของเนเธอร์แลนด์ ในขณะเดียวกัน Backblaze ก็ทำสิ่งที่น่าเบื่ออีกครั้ง สถิติไดรฟ์รายไตรมาสครอบคลุมฮาร์ดไดรฟ์ประมาณสามแสนห้าหมื่นตัว และอัตราความล้มเหลวเพิ่มขึ้นเป็นหนึ่งจุดเจ็ดสามเปอร์เซ็นต์
4:16 สูงสุดในรอบระยะเวลาหนึ่ง ฮาร์ดไดรฟ์ Seagate สามรุ่นไม่มีความล้มเหลว นี่คือสิ่งที่ baseline สาธารณะดูเหมือน ไตรมาสต่อไตรมาส เป็นเวลาสิบสามปี
บรรทัดเครดิต: Claude ช่วยสร้างมิเตอร์
4:25 ทีนี้ บรรทัดเครดิตนั้น readme ยอมรับว่า repo ส่วนใหญ่เขียนขึ้นโดยความช่วยเหลือของ Claude ซึ่งเป็นโมเดลที่กำลังถูกวัด ดังนั้น Claude จึงช่วยสร้างมิเตอร์ที่ตรวจสอบว่า Claude ฉลาดน้อยลงหรือไม่ นั่นคือเหตุผลที่ผู้ให้คะแนนเป็นฟังก์ชันธรรมดา ตามคำพูดของผู้เขียน คุณไม่ควรต้องเชื่อผู้เขียน ไม่ว่าจะเป็นมนุษย์หรืออย่างอื่น หากคุณต้องการอ่านสิ่งนี้มากกว่าที่จะฟังฉันพูด ความแตกต่างจะอยู่ในกล่องจดหมายของคุณ
4:46 ทุกเช้า ฟรีที่ the daily diff dot dev ลิงก์ด้านล่าง ดังนั้น คำตัดสินของวันนี้เกี่ยวกับ live nerf
คำตัดสิน: SHIP IT และอย่าอ้างอิงก่อนวันที่ 24 ตุลาคม
4:51 SHIP IT ฉันจะ SHIP IT เพราะมันเป็นข้อโต้แย้งเรื่องการลดประสิทธิภาพครั้งแรกที่ฉันเห็นพร้อมกับ การประทับเวลา, คู่มือกฎสาธารณะ และจุดบอดที่ระบุไว้ เพียงแค่อย่าอ้างอิงก่อนวันที่ยี่สิบสี่ตุลาคม และนั่นคือความแตกต่างสำหรับวันนี้ ฉันชื่อ Niko จาก Axrisi ผสานอย่างรับผิดชอบ
แหล่งที่มา
- livenerfgithub.com
- Validationgithub.com
- Hacker Newsnews.ycombinator.com
- Anthropic postmortem (Sep 2025)www.anthropic.com
- Adding Error Bars to Evals (Evan Miller)arxiv.org
- Inspect (UK AI Security Institute)inspect.aisi.org.uk
- NL Timesnltimes.nl
- Hacker Newsnews.ycombinator.com
- Backblaze Drive Stats Q2 2026www.backblaze.com
- Hacker Newsnews.ycombinator.com



