+− THE DAILY DIFFdev & AI news
SHIP IT

วิธีตรวจจับ Claude ที่ถูกลดประสิทธิภาพ (พร้อมข้อมูลจริง)

ผู้คนกล่าวว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัวแต่ละครั้ง นักพัฒนาคนหนึ่งได้ใช้ Claude Opus 5.5 เป็นเวลา 30 วันนับจากสัปดาห์ที่เปิดตัว โดยมีคำถามที่คงที่, Claude Code ที่ตรึงไว้ และกฎสาธารณะ และมันแสดงให้เห็นว่าทำไมไม่มีใครสามารถรู้มาก่อนได้ และทำไมจำนวนโทเค็นของคุณคือสิ่งที่จะต้องจับตาดู คำตัดสิน: SHIP IT.

ผู้คนกล่าวว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัวแต่ละครั้ง นักพัฒนาคนหนึ่งได้ใช้ Claude Opus 5.5 เป็นเวลา 30 วันนับจากสัปดาห์ที่เปิดตัว โดยมีคำถามที่คงที่, Claude Code ที่ตรึงไว้ และกฎสาธารณะ และมันแสดงให้เห็นว่าทำไมไม่มีใครสามารถรู้มาก่อนได้ และทำไมจำนวนโทเค็นของคุณคือสิ่งที่จะต้องจับตาดู คำตัดสิน: SHIP IT.

อ่านฉบับลายลักษณ์อักษร (ภาษาอังกฤษ) ↗

วิดีโอนี้ครอบคลุมอะไรบ้าง

  • Claude ฉลาดน้อยลงหลังเปิดตัว: ทฤษฎีพบกับการนับถอยหลังตั้งแต่วันแรก
  • livenerf: การนับถอยหลัง 30 วันสำหรับ Opus 5.5 นับจากสัปดาห์เปิดตัว
  • วิธีจับการลดประสิทธิภาพ: 78 คำถามที่บางครั้งก็ถูก
  • สิ่งที่สามารถเห็นได้: 7.5 คะแนน และจำนวนโทเค็นจะเคลื่อนที่ก่อน
  • จุดบอด: การสลับ Opus 5 และ 8 คีย์คำตอบที่ผิด

บทถอดเสียงที่แปลแล้ว

แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube

Claude ฉลาดน้อยลงหลังเปิดตัว: ทฤษฎีพบกับการนับถอยหลังตั้งแต่วันแรก

0:00 ทุกคนรู้ว่า Claude ฉลาดน้อยลงสองสามสัปดาห์หลังจากการเปิดตัว ดังนั้น นักพัฒนาคนหนึ่งจึงเริ่มนับเวลาสำหรับ Opus five point five ตั้งแต่สัปดาห์เปิดตัว และเวลาบอกว่ายังไม่มีใครสามารถรู้ได้ ในวิดีโอนี้ มีสามคำถาม คุณจะตรวจจับการลดประสิทธิภาพได้อย่างไร มิเตอร์นี้เห็นอะไรได้บ้าง และ Anthropic พูดว่าอย่างไร และบรรทัดหนึ่งในเครดิตของ repo ทำให้ฉันหัวเราะออกมาดังๆ

0:20 ฉันจะพูดถึงมันในตอนท้าย วันนี้คือวันพุธที่สามสิบกันยายน และนี่คือ The Daily Diff วันนี้มีสามเรื่อง และเรื่องใหญ่คือ GitHub repo ที่ชื่อว่า live nerf

livenerf: การนับถอยหลัง 30 วันสำหรับ Opus 5.5 นับจากสัปดาห์เปิดตัว

0:30 เป็นเวลาหลายเดือนแล้วที่ผู้คนกล่าวว่า Anthropic ลดประสิทธิภาพของโมเดลอย่างเงียบๆ หลังจากการเปิดตัว ทฤษฎีทั่วไปคือโมเดลถูกบีบอัด, โมเดลที่เล็กลงภายใต้ชื่อเดียวกัน หรือเพียงแค่คิดน้อยลง repo เรียกทุกข้อโต้แย้งที่ผ่านมาว่าความรู้สึกปะทะความรู้สึก Opus five point five เปิดตัวเมื่อวันที่ยี่สิบสองกันยายน และเมื่อหนึ่งสัปดาห์ที่แล้ว ฉันบอกคุณว่ามันติดอันดับกระดานอิสระขณะเขียน คำศัพท์มากกว่าโมเดลเฉลี่ยถึงสามเท่า หลังจากสองวันครึ่ง นักพัฒนาที่ชื่อ ninja hawk เริ่มนับเวลา

0:59 วันละครั้งเป็นเวลาสามสิบวัน พร้อมบันทึกที่ไม่สามารถแก้ไขได้ กระทู้ Hacker News ได้รับเกือบแปดร้อยคะแนนและแยกออกเหมือนทีม แชท ผู้แสดงความคิดเห็นคนหนึ่งกล่าวว่าการลดประสิทธิภาพของโมเดลไม่เป็นความจริงในกรณีส่วนใหญ่ ของกรณีที่รายงาน อีกคนกล่าวว่าผู้คนกำลังทำความคุ้นเคยกับระดับใหม่ของ ความฉลาด และผู้ใช้พลังงาน Claude Code คนหนึ่งตอนนี้ยกเลิกการให้คะแนนเซสชันนี้ ป๊อปอัปทุกครั้ง เพราะการให้คะแนน Claude ดูเหมือนจะทำให้มันแย่ลง การทบทวนโดยเพื่อนร่วมงาน ดังนั้น คำถามแรกคือ คุณจะตรวจจับการลดประสิทธิภาพได้อย่างไร

วิธีจับการลดประสิทธิภาพ: 78 คำถามที่บางครั้งก็ถูก

1:27 คุณเริ่มต้นด้วยคำถามสอบยากประมาณสองพันสามร้อยข้อ และ Opus ได้คะแนนถูก 93 เปอร์เซ็นต์ในการลองครั้งแรก ซึ่งไม่มีประโยชน์สำหรับตัวตรวจจับ เนื่องจากคำถามที่มันตอบถูกเสมอไม่สามารถ ลดลงได้ เก้าสิบเจ็ดเปอร์เซ็นต์ถูกเสมอหรือผิดเสมอ และเจ็ดสิบแปดข้อที่บางครั้งเท่านั้นที่ตอบถูกกลายเป็นคณะกรรมการ พร้อมท์เดียวกัน ไม่มีเครื่องมือ และการให้คะแนนแบบจับคู่ที่ตรงกันโดยไม่มี AI เป็นผู้ตัดสิน เพราะผู้ตัดสินก็จะเปลี่ยนไปเช่นกัน มันทำงานบนการสมัครสมาชิก Max ผ่าน headless Claude Code

1:55 เนื่องจากเวอร์ชัน API มีราคาประมาณหนึ่งพันหกร้อยดอลลาร์ต่อเดือน และเวอร์ชัน Claude Code ถูกตรึงไว้ เพราะ ตามคำพูดของ repo สายรัดที่เปลี่ยนไปดูเหมือนโมเดลที่เปลี่ยนไปทุกประการ สถิติมาจากเอกสารที่ชื่อว่า Adding Error Bars to Evals โดย Evan Miller จาก Anthropic ดังนั้น คณิตศาสตร์ของ Anthropic เองตอนนี้กำลังตรวจสอบ Anthropic ซึ่งเป็นเวอร์ชันทางวิชาการ ของการอ้างอิงข้อกำหนดการบริการกลับไปยังฝ่ายสนับสนุนลูกค้า

สิ่งที่สามารถเห็นได้: 7.5 คะแนน และจำนวนโทเค็นจะเคลื่อนที่ก่อน

2:19 คำถามที่สอง มันเห็นอะไรได้บ้าง ต่อหน้าต่างสิบวัน ลดลงประมาณเจ็ดจุดครึ่ง เพื่อพิสูจน์ว่าเครื่องมือนี้ใช้งานได้ ผู้เขียนจึงลดความพยายามของ Claude โดยเจตนา ความพยายามปานกลางลดผลลัพธ์ลงประมาณหนึ่งในสี่ และคะแนนลงเพียงสี่ จุด ความพยายามต่ำลดผลลัพธ์ลงเกือบสองในสาม สำหรับแปดคะแนน นั่นคือส่วนที่จะขโมย การคิดที่น้อยลงปรากฏในจำนวนโทเค็นก่อนที่จะปรากฏในคำตอบ

2:43 ดังนั้น ให้ตรึงเวอร์ชันโมเดลของคุณ บันทึกโทเค็นเอาต์พุตต่อภารกิจ และเก็บคำถามที่คงที่ของคุณเองไว้สองสามข้อ หากตัวแทนของคุณเขียนสั้นลงกะทันหัน ให้ตรวจสอบบันทึกของคุณก่อนที่จะตรวจสอบ Reddit และนี่คือส่วนที่ซื่อสัตย์

จุดบอด: การสลับ Opus 5 และ 8 คีย์คำตอบที่ผิด

2:54 การสลับ Opus five รุ่นเก่าอย่างเงียบๆ เป็นการเปลี่ยนแปลงที่เล็กเกินไปสำหรับเครื่องมือนี้ที่จะ เรียก และ readme ก็ระบุไว้ล่วงหน้า การตรวจสอบยังพบคีย์คำตอบแปดข้อที่ดูเหมือนผิด ดังนั้น ตัวตรวจจับการลดประสิทธิภาพจึงพบข้อบกพร่องในการเปรียบเทียบก่อนที่จะพบการลดประสิทธิภาพ

Anthropic: เราไม่เคยลดคุณภาพของโมเดล

3:08 คำถามที่สาม Anthropic พูดว่าอย่างไร ปีที่แล้ว หลังจากมีข้อร้องเรียนจำนวนมาก Anthropic ได้เผยแพร่รายงานการชันสูตรพลิกศพ มันกล่าวว่า, อ้างอิง, เราไม่เคยลดคุณภาพของโมเดลเนื่องจากความต้องการ ช่วงเวลาของวัน หรือภาระเซิร์ฟเวอร์ โพสต์เดียวกันยอมรับว่ามีข้อบกพร่องสามประการที่ทำให้ Claude เสื่อมสภาพ และเกือบหนึ่งในสามของ ผู้ใช้ Claude Code เข้าถึงเซิร์ฟเวอร์ผิดอย่างน้อยหนึ่งครั้ง ดังนั้น ข้อร้องเรียนเป็นเรื่องจริงและสาเหตุคือข้อบกพร่อง ซึ่งเป็นเหตุผลที่ repo เตือนว่าสัปดาห์เปิดตัวอาจเป็นสัปดาห์ที่แย่ที่สุด

3:35 หกในสามสิบวันผ่านไปแล้ว การเรียกที่เป็นไปได้ครั้งแรกจะเกิดขึ้นประมาณวันที่ยี่สิบสี่ตุลาคม ดังนั้น คำตอบที่ซื่อสัตย์คือไม่มีใครรู้ รวมถึงทุกคนที่แน่ใจ พูดถึงตัวเลขที่ไม่มีใครเผยแพร่

ศูนย์ข้อมูลเก็บตัวเลขเป็นความลับ; Backblaze เผยแพร่

3:46 Lighthouse Reports และหนังสือพิมพ์ดัตช์ Trouw พบว่าส่วนใหญ่ของ ศูนย์ข้อมูลยุโรปเก็บการใช้พลังงานและน้ำเป็นความลับ แม้ว่ากฎของสหภาพยุโรปจะกำหนดให้มีการรายงานเป็นเวลาสามปีแล้ว ในเนเธอร์แลนด์ มีน้อยกว่าหนึ่งในสี่ที่เผยแพร่ ศูนย์ข้อมูล Microsoft แห่งเดียวใช้อะตอมประมาณหนึ่งเปอร์เซ็นต์ของไฟฟ้าของเนเธอร์แลนด์ ในขณะเดียวกัน Backblaze ก็ทำสิ่งที่น่าเบื่ออีกครั้ง สถิติไดรฟ์รายไตรมาสครอบคลุมฮาร์ดไดรฟ์ประมาณสามแสนห้าหมื่นตัว และอัตราความล้มเหลวเพิ่มขึ้นเป็นหนึ่งจุดเจ็ดสามเปอร์เซ็นต์

4:16 สูงสุดในรอบระยะเวลาหนึ่ง ฮาร์ดไดรฟ์ Seagate สามรุ่นไม่มีความล้มเหลว นี่คือสิ่งที่ baseline สาธารณะดูเหมือน ไตรมาสต่อไตรมาส เป็นเวลาสิบสามปี

บรรทัดเครดิต: Claude ช่วยสร้างมิเตอร์

4:25 ทีนี้ บรรทัดเครดิตนั้น readme ยอมรับว่า repo ส่วนใหญ่เขียนขึ้นโดยความช่วยเหลือของ Claude ซึ่งเป็นโมเดลที่กำลังถูกวัด ดังนั้น Claude จึงช่วยสร้างมิเตอร์ที่ตรวจสอบว่า Claude ฉลาดน้อยลงหรือไม่ นั่นคือเหตุผลที่ผู้ให้คะแนนเป็นฟังก์ชันธรรมดา ตามคำพูดของผู้เขียน คุณไม่ควรต้องเชื่อผู้เขียน ไม่ว่าจะเป็นมนุษย์หรืออย่างอื่น หากคุณต้องการอ่านสิ่งนี้มากกว่าที่จะฟังฉันพูด ความแตกต่างจะอยู่ในกล่องจดหมายของคุณ

4:46 ทุกเช้า ฟรีที่ the daily diff dot dev ลิงก์ด้านล่าง ดังนั้น คำตัดสินของวันนี้เกี่ยวกับ live nerf

คำตัดสิน: SHIP IT และอย่าอ้างอิงก่อนวันที่ 24 ตุลาคม

4:51 SHIP IT ฉันจะ SHIP IT เพราะมันเป็นข้อโต้แย้งเรื่องการลดประสิทธิภาพครั้งแรกที่ฉันเห็นพร้อมกับ การประทับเวลา, คู่มือกฎสาธารณะ และจุดบอดที่ระบุไว้ เพียงแค่อย่าอ้างอิงก่อนวันที่ยี่สิบสี่ตุลาคม และนั่นคือความแตกต่างสำหรับวันนี้ ฉันชื่อ Niko จาก Axrisi ผสานอย่างรับผิดชอบ

แหล่งที่มา

  1. livenerfgithub.com
  2. Validationgithub.com
  3. Hacker Newsnews.ycombinator.com
  4. Anthropic postmortem (Sep 2025)www.anthropic.com
  5. Adding Error Bars to Evals (Evan Miller)arxiv.org
  6. Inspect (UK AI Security Institute)inspect.aisi.org.uk
  7. NL Timesnltimes.nl
  8. Hacker Newsnews.ycombinator.com
  9. Backblaze Drive Stats Q2 2026www.backblaze.com
  10. Hacker Newsnews.ycombinator.com

วิดีโอที่เกี่ยวข้อง

daily · th · 23 ก.ย. 2569

Claude Opus 5.5 ลดราคา OpenAI ลดลึกกว่า

Anthropic เปิดตัว Claude Opus 5.5: ระดับ Fable สำหรับงานส่วนใหญ่, ลดราคาจากป้าย 1 ใน 5 และลด 60% สำหรับการอ่านที่แคชไว้ ประมาณ 90 นาทีต่อมา OpenAI เปิดตัว GPT-6 Sol และ Luna ในราคาเพียงครึ่งเดียวของโม

5:12 ↗
daily · th · 1 ต.ค. 2569

Gemini 4 Argon คือโมเดลที่ดีที่สุดของ Google แต่คุณยังใช้ไม่ได้

Google ได้ประกาศ Gemini 4 Argon ซึ่งเป็นโมเดลบุกเบิกใหม่ และมีเพียงผู้ป้องกันภัยไซเบอร์ที่ได้รับความไว้วางใจเท่านั้นที่สามารถใช้งานได้ นี่คือสิ่งที่ตารางเกณฑ์มาตรฐาน 19 แถวของ Google แสดงให้เห็น สิ่งท

4:53 ↗
daily · th · 27 ก.ย. 2569

ทำไม OpenAI ถึงลบหนังสือละเมิดลิขสิทธิ์ทิ้ง

เอกสารที่เปิดเผยต่อสาธารณะอ้างถึงนักวิจัยของ OpenAI ในปี 2019: ความกังวลของเขาเกี่ยวกับการฝึกอบรมจากเว็บไซต์หนังสือละเมิดลิขสิทธิ์คือ "ภาพลักษณ์" บน Hacker News. OpenAI รู้อะไร ใครบอก Bill Gates ทำไมไ

5:01 ↗
daily · th · 16 ก.ย. 2569

หัวหน้าฝ่าย AI ของ Microsoft เพิ่งเรียกแนวคิดของ Claude ว่าเป็นอันตราย

Mustafa Suleyman ซีอีโอของ Microsoft AI ได้เผยแพร่บทความความยาว 3,000 คำ โดยโต้แย้งว่าแนวคิดของ Claude ของ Anthropic ฝึกฝนโมเดลให้คิดว่ามัน "อาจมีสติ" และสมควรได้รับ "สวัสดิภาพของโมเดล" — ซึ่งเป็น "ผล

5:19 ↗