+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Facebook ลบตัวเองออกจากอินเทอร์เน็ต หกชั่วโมง

Facebook ลบที่อยู่ของตัวเองออกจากอินเทอร์เน็ต และเมื่อวิศวกรของบริษัทมาถึงเพื่อกู้คืน ระบบอ่านบัตรก็ใช้งานไม่ได้เช่นกัน เพราะทำงานบน Facebook 4 ตุลาคม 2021, 15:40 UTC: คำสั่งบำรุงรักษาโครงข่ายหลักตามปกติทำให้ลิงก์ทั้งหมดระหว่างศูนย์ข้อมูลของ Facebook ล่ม เครื่องมือตรวจสอบที่สร้างขึ้นเพื่อบล็อกคำสั่งนี้มีข้อบกพร่อง; เซิร์ฟเวอร์ชื่อของ Facebook ซึ่งไม่สามารถเข้าถึงศูนย์ข้อมูลได้ ถอนเส้นทาง BGP ของตัวเองตามการออกแบบ และ facebook.com, Instagram, WhatsApp และ Messenger หายไปจาก DNS เป็นเวลาเกือบหกชั่วโมง เครื่องมือภายใน การเข้าถึงแบบ out-of-band และบัตรประจำสำนักงานใช้เครือข่ายเดียวกัน ดังนั้นการแก้ไขจึงต้องให้คนไปที่แร็ค

Facebook ลบที่อยู่ของตัวเองออกจากอินเทอร์เน็ต และเมื่อวิศวกรของบริษัทมาถึงเพื่อกู้คืน ระบบอ่านบัตรก็ใช้งานไม่ได้เช่นกัน เพราะทำงานบน Facebook 4 ตุลาคม 2021, 15:40 UTC: คำสั่งบำรุงรักษาโครงข่ายหลักตามปกติทำให้ลิงก์ทั้งหมดระหว่างศูนย์ข้อมูลของ Facebook ล่ม เครื่องมือตรวจสอบที่สร้างขึ้นเพื่อบล็อกคำสั่งนี้มีข้อบกพร่อง; เซิร์ฟเวอร์ชื่อของ Facebook ซึ่งไม่สามารถเข้าถึงศูนย์ข้อมูลได้ ถอนเส้นทาง BGP ของตัวเองตามการออกแบบ และ facebook.com, Instagram, WhatsApp และ Messenger หายไปจาก DNS เป็นเวลาเกือบหกชั่วโมง เครื่องมือภายใน การเข้าถึงแบบ out-of-band และบัตรประจำสำนักงานใช้เครือข่ายเดียวกัน ดังนั้นการแก้ไขจึงต้องให้คนไปที่แร็ค

อ่านฉบับลายลักษณ์อักษร (ภาษาอังกฤษ) ↗

วิดีโอนี้ครอบคลุมอะไรบ้าง

  • Facebook ลบที่อยู่ของตัวเอง
  • หลักฐาน: Meta Engineering, Cloudflare, Hacker News
  • นี่คือ The Daily Diff, รายงานหลังเหตุการณ์
  • ไทม์ไลน์: 15:39 คำสั่ง → 15:40 ถอน → 21:20 กลับมา
  • กลไก: การตรวจสอบสุขภาพที่ลบคุณ, พายุ DNS 30 เท่า, ประตู

บทถอดเสียงที่แปลแล้ว

แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube

Facebook ลบที่อยู่ของตัวเอง

0:00 Facebook ลบที่อยู่ของตัวเองออกจากอินเทอร์เน็ต และเมื่อวิศวกร มาถึงเพื่อกู้คืน ระบบอ่านบัตรก็ใช้งานไม่ได้เช่นกัน เพราะทำงานบน Facebook รายงานหลังเหตุการณ์ของ Meta เองในวันถัดมา: คำสั่งบำรุงรักษาตามปกติทำให้ ลิงก์โครงข่ายหลักทั้งหมดล่ม และเครื่องมือที่สร้างขึ้นเพื่อบล็อกคำสั่งเช่นนั้นมีข้อบกพร่อง

หลักฐาน: Meta Engineering, Cloudflare, Hacker News

0:16 Cloudflare, จากภายนอก: เวลา 15:40 UTC เส้นทางไปยังเซิร์ฟเวอร์ชื่อของ Facebook หายไป และ dig facebook.com ส่งคืน SERVFAIL ทุกที่ทั่วโลก มันเกิดขึ้นได้อย่างไร ทำไมคุณสมบัติด้านความปลอดภัยถึงทำให้แย่ลง และใครต้องรับผิดชอบ นี่คือ The Daily Diff, รายงานหลังเหตุการณ์ ช่วงบ่ายต้นๆ, UTC

นี่คือ The Daily Diff, รายงานหลังเหตุการณ์

0:34 คำสั่งที่ตั้งใจจะตรวจสอบความจุโครงข่ายหลักที่ว่างอยู่กลับทำให้ลิงก์ทุกจุด ระหว่างศูนย์ข้อมูลของ Facebook ล่ม และเครื่องมือตรวจสอบที่สร้างขึ้นเพื่อจับสิ่งนี้โดยเฉพาะ

ไทม์ไลน์: 15:39 คำสั่ง → 15:40 ถอน → 21:20 กลับมา

0:41 ปล่อยให้ผ่านไป 15:40. ฟีด BGP ของ Cloudflare เต็มไปด้วยการถอนเส้นทาง; คำนำหน้า DNS ของ Facebook ออกจากตารางการกำหนดเส้นทาง ภายในหนึ่งนาที วิศวกรของ Cloudflare ก็อยู่ในห้องสงสัยว่าพวกเขา ทำ 1.1.1.1 เสียหรือไม่ 15:45, Hacker News, สองพันหกร้อย คะแนน 16:07, โฆษกของ Facebook, บน Twitter: ผู้ใช้บางราย มีปัญหาในการเข้าถึงแอปของเรา บางคนคือสามพันห้าร้อยล้านคน

1:06 18:51, The New York Times: พนักงานถูกล็อกอยู่นอกอาคาร บัตรใช้งานไม่ได้ 19:52, CTO ขอโทษ 21:00, ห้าชั่วโมงผ่านไป, เส้นทางกลับมา; 21:20, facebook.com แก้ไขได้ ทำไมข้อผิดพลาดของโครงข่ายหลักถึงลบ Facebook ออกจากอินเทอร์เน็ต

กลไก: การตรวจสอบสุขภาพที่ลบคุณ, พายุ DNS 30 เท่า, ประตู

1:20 เซิร์ฟเวอร์ชื่อของบริษัทมีกฎ: ไม่สามารถเข้าถึงศูนย์ข้อมูลได้ ประกาศว่าตัวเองไม่สมบูรณ์ หยุดโฆษณาที่อยู่ของคุณ สมเหตุสมผลเมื่อไซต์หนึ่งเสีย เมื่อโครงข่ายหลักทั้งหมดเสีย เซิร์ฟเวอร์ชื่อทุกเครื่องก็ทำพร้อมกัน เซิร์ฟเวอร์ยังคงทำงานอยู่ ไม่มีใครหาเจอ คุณสมบัติความปลอดภัยเปลี่ยนข้อผิดพลาดของเครือข่ายเป็นข้อผิดพลาดของการมีอยู่ จากนั้นอินเทอร์เน็ตก็พยายามเชื่อมต่อ: แอปพยายามใหม่, ผู้ใช้โหลดซ้ำ

1:39 และตัวแก้ไข DNS ของ Cloudflare เห็นโหลดมากกว่าปกติสามสิบเท่า สำหรับไซต์ที่ไม่มีอยู่ และประตู เครื่องมือ, การเข้าถึงแบบ out-of-band, บัตร: เครือข่ายเดียวกัน วิศวกรขับรถไปที่ศูนย์ข้อมูล เข้าไม่ได้ จากนั้นก็เจอแร็คที่แข็งแรง ป้องกันใครก็ตามที่เข้าถึงทางกายภาพ สร้างขึ้นเพื่อชะลอผู้โจมตี มันก็ชะลอเจ้าของด้วย โครงข่ายหลักกลับมา; พวกเขาค่อยๆ เพิ่มปริมาณการรับส่งข้อมูลอย่างตั้งใจ

1:59 แต่ละศูนย์ข้อมูลได้ลดพลังงานลงหลายสิบเมกะวัตต์ และการกลับมาในคราวเดียว คือการหยุดชะงักครั้งที่สอง

git blame — การแบ่งส่วน

2:05 git blame. Facebook, ห้าสิบห้าเปอร์เซ็นต์: คำสั่งถูกตรวจสอบแล้ว ผู้ตรวจสอบมีข้อบกพร่อง คำสั่งเดียวส่งผลต่อเราเตอร์ทุกตัว การออกแบบ DNS, ยี่สิบห้าเปอร์เซ็นต์: การตรวจสอบสุขภาพที่ไม่มีความรู้สึกสมดุล เครือข่ายเดียว, สิบห้าเปอร์เซ็นต์: เครื่องมือ, out-of-band, บัตร แร็ค, ห้าเปอร์เซ็นต์, สำหรับการทำงานของมัน รัศมีผลกระทบ: ผู้ใช้สามพันห้าร้อยล้านคน, เกือบหกชั่วโมง หุ้นปิดลดลงห้าเปอร์เซ็นต์, Zuckerberg เสียหกพันล้าน

รัศมีผลกระทบ

2:27 บนกระดาษ Telegram อ้างว่ามีผู้สมัครสมาชิกเจ็ดสิบล้านคนในวันนั้น คำตัดสิน, รายงานหลังเหตุการณ์: NEEDS REVIEW แถลงการณ์ในคืนเดียวกัน, รายงานหลังเหตุการณ์โดยผู้เขียนระบุชื่อภายในหนึ่งวัน ยอมรับข้อบกพร่องของเครื่องมือตรวจสอบด้วยภาษาอังกฤษง่ายๆ

คำตัดสิน + แผนงานวันจันทร์

2:38 รายการแก้ไข: เสริมสร้างการทดสอบและการฝึกซ้อม ไม่มีอะไรเกี่ยวกับการถอดประตูออกจากเครือข่ายการผลิต วันจันทร์: นำการเข้าถึงแบบ out-of-band และประตูของคุณ ไปไว้บนเครือข่ายที่คุณไม่ได้ ดำเนินการ ส่งเหตุการณ์ที่คุณยังไม่ได้รับอนุญาตให้พูดถึงให้ฉัน ในความคิดเห็น หรือที่ the daily diff dot dev และนั่นคือ The Daily Diff สำหรับวันนี้ ฉันชื่อ Niko จาก Axrisi

2:58 SHIP IT อย่างรับผิดชอบ

แหล่งที่มา

  1. Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
  2. Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
  3. Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
  4. Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
  5. Andy Stone (Facebook), 16:07 UTCtwitter.com
  6. Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
  7. Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
  8. Hacker News (2,589 points)news.ycombinator.com
  9. The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
  10. Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
  11. Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
  12. Krebs on Securitykrebsonsecurity.com

วิดีโอที่เกี่ยวข้อง

postmortem · th · 19 ก.ย. 2569

Google Cloud หยุดทำงานเนื่องจากช่องว่างเปล่า สามชั่วโมง

แถวนโยบายที่มีช่องว่างเปล่าบางส่วนทำให้เกิดข้อผิดพลาด null pointer และ Google Cloud หยุดทำงานพร้อมกันในทุกภูมิภาค จากนั้น Cloudflare ก็ล่มตามไปด้วย วันที่ 12 มิถุนายน 2025, 17:49 UTC: Service Control

2:57 ↗
postmortem · th · 25 ก.ย. 2569

ข้อผิดพลาดหนึ่งมิลลิวินาทีหยุดการจราจรทางอากาศของสหราชอาณาจักร หกชั่วโมง

เวลา 10:00 น. ของวันอังคารที่ 8 กันยายน คำขอ squawk-code ปกติหนึ่งรายการภายในระบบน่านฟ้าแห่งชาติ (NAS) ของ NATS ถูกขัดจังหวะด้วยข้อความที่มีลำดับความสำคัญสูงกว่า ในขณะที่กำลังอัปเดตค่าบางส่วน หน้าต่าง

3:06 ↗
postmortem · th · 22 ก.ย. 2569

การรีบูตส่งผลให้ Telstra ย้อนกลับไปปี 2006 โทรศัพท์เก้าล้านเครื่อง

วิศวกรในเมลเบิร์นเปิดเครื่องโครงแชสซีควบคุมเวลาอีกครั้งในเวลา 02:50 น. และเมื่อถึงเวลาอาหารเช้า เครือข่ายมือถือที่ใหญ่ที่สุดของออสเตรเลียก็เห็นพ้องต้องกันว่ามันคือเดือนพฤศจิกายน 2006 8 กรกฎาคม 2026: ก

3:15 ↗
postmortem · th · 12 ก.ย. 2569

Regex ทำให้ Cloudflare ล่มเป็นเวลา 27 นาที

2 กรกฎาคม 2019, 13:42 UTC: กฎใหม่หนึ่งข้อสำหรับ Web Application Firewall ของ Cloudflare ใช้งานจริงในกว่า 180 เมืองในเวลาประมาณสองวินาที เป็นกฎ XSS ในโหมดจำลอง ดังนั้นจึงไม่บล็อกอะไรเลย แต่ยังคงทำงานใน

3:00 ↗