+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Facebook raderade sig själv från internet. Sex timmar.

Facebook tar bort sin egen adress från internet, och när dess ingenjörer anländer för att återställa den, är också passerkortläsarna nere, eftersom de körs på Facebook.

Facebook tar bort sin egen adress från internet, och när dess ingenjörer anländer för att återställa den, är också passerkortläsarna nere, eftersom de körs på Facebook. 4 oktober 2021, 15:40 UTC: ett rutinmässigt underhållskommando för nätverksinfrastrukturen tar ner varje länk mellan Facebooks datacenter; revisionsverktyget som byggdes för att blockera det har en bugg; Facebooks namnservrar, oförmögna att nå datacenterna, drar tillbaka sina egna BGP-rutter avsiktligt – och facebook.com, Instagram, WhatsApp och Messenger försvinner från DNS i nästan sex timmar. Interna verktyg, out-of-band-åtkomst och kontorskorten använder samma nätverk, så åtgärden kräver människor vid serverracken.

Läs den skrivna upplagan (engelska) ↗

Vad den här videon täcker

  • Facebook tar bort sin egen adress
  • Bevisen: Meta Engineering, Cloudflare, Hacker News
  • Detta är The Daily Diff, postmortem
  • Tidslinje: 15:39 kommando → 15:40 tillbakadragen → 21:20 tillbaka
  • Mekanism: hälsokontrollen som raderar dig, 30× DNS-stormen, dörrarna

Översatt transkription

Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.

Facebook tar bort sin egen adress

0:00 Facebook tar bort sin egen adress från internet, och när dess ingenjörer anländer för att återställa den, är också passerkortläsarna nere, eftersom de körs på Facebook. Metas egen postmortem, dagen efter: ett rutinmässigt underhållskommando tar ner varje huvudlänk, och verktyget som byggdes för att blockera sådana kommandon har en bugg.

Bevisen: Meta Engineering, Cloudflare, Hacker News

0:16 Cloudflare, utifrån: klockan 15:40 UTC försvinner rutterna till Facebooks namnservrar, och dig facebook.com returnerar SERVFAIL överallt på planeten. Hur det händer, varför en säkerhetsfunktion gör det värre, och vem som får skulden. Detta är The Daily Diff, postmortem. Tidig eftermiddag, UTC.

Detta är The Daily Diff, postmortem

0:34 Ett kommando som var menat att kontrollera ledig nätverkskapacitet tar istället ner varje länk mellan Facebooks datacenter, och revisionsverktyget som byggdes för att fånga exakt detta

Tidslinje: 15:39 kommando → 15:40 tillbakadragen → 21:20 tillbaka

0:41 släpper igenom det. 15:40. Cloudflares BGP-flöde fylls med tillbakadraganden; Facebooks DNS- prefix lämnar routingtabellen. Inom en minut sitter Cloudflares ingenjörer i ett rum och undrar om de bröt 1.1.1.1. 15:45, Hacker News, tjugoettusensexhundra poäng. 16:07, Facebooks talesman, på Twitter av alla ställen: vissa människor har problem med att komma åt våra appar. Vissa människor är tre och en halv miljard.

1:06 18:51, New York Times: anställda utestängda från sina byggnader, passerkorten döda. 19:52, CTO ber om ursäkt. 21:00, fem timmar in, rutter återvänder; 21:20, facebook.com löser. Varför raderar ett nätverksfel Facebook från internet?

Mekanism: hälsokontrollen som raderar dig, 30× DNS-stormen, dörrarna

1:20 Dess namnservrar har en regel: kan inte nå datacentren, förklara dig ohälsosam, sluta annonsera din adress. Förnuftigt när en webbplats går dåligt. När hela nätverksinfrastrukturen går ner, gör varje namnserver det samtidigt. Servrarna är uppe. Ingen kan hitta dem. En säkerhetsfunktion förvandlar ett nätverksfel till ett existensfel. Sedan lägger internet på: appar försöker igen, användare laddar om,

1:39 och Cloudflares resolver ser trettio gånger sin normala belastning, för en webbplats som inte finns där. Och dörrarna. Verktyg, out-of-band-åtkomst, passerkort: samma nätverk. Ingenjörer kör till datacentren, kan inte komma in, möter sedan härdade rack mot alla med fysisk åtkomst. Byggt för att bromsa en angripare, bromsar det även ägaren. Nätverksinfrastrukturen återvänder; de ökar trafiken långsamt, medvetet.

1:59 Varje datacenter har tappat tiotals megawatt, och att vända det i ett steg är ett andra avbrott.

git blame — splittringen

2:05 git blame. Facebook, femtiofem procent: kommandot granskades, granskaren hade buggen, ett kommando nådde varje router. DNS-designen, tjugofem: en hälsokontroll utan känsla för proportioner. Ett nätverk, femton: verktyg, out-of-band, passerkort. Rackarna, fem, för att de gjorde sitt jobb. Skadeomfång: tre och en halv miljard användare, nästan sex timmar. Aktien stänger ner fem procent, sex miljarder av Zuckerbergs förmögenhet,

Skadeomfång

2:27 på papper. Telegram hävdar sjuttio miljoner registreringar den dagen. Dom, postmortem: NEEDS REVIEW. Uttalande samma kväll, postmortem med namngiven författare inom en dag, revisionsverktygets bugg erkänd på enkel engelska.

Dom + måndagslinjen

2:38 Fixlistan: stärk tester och övningar. Inget om att ta bort dörrarna från produktionsnätverket. Måndag: placera din out-of-band-åtkomst, och din dörr, på ett nätverk du inte opererar. Skicka mig incidenten du fortfarande inte får prata om, i kommentarerna, eller på the daily diff dot dev. Och det var dagens diff. Jag är Niko från Axrisi.

2:58 Merge responsibly.

Källor

  1. Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
  2. Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
  3. Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
  4. Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
  5. Andy Stone (Facebook), 16:07 UTCtwitter.com
  6. Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
  7. Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
  8. Hacker News (2,589 points)news.ycombinator.com
  9. The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
  10. Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
  11. Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
  12. Krebs on Securitykrebsonsecurity.com

Relaterade videor