+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Facebookがインターネットから消滅。6時間。

Facebookはインターネットから自社のアドレスを削除し、エンジニアがそれを元に戻しに到着しても、バッジリーダーもダウンしていました。

Facebookはインターネットから自社のアドレスを削除し、エンジニアがそれを元に戻しに到着しても、バッジリーダーもダウンしていました。なぜなら、それらはFacebook上で動作していたからです。2021年10月4日、15:40 UTC:日常的なバックボーンメンテナンスコマンドが、Facebookのデータセンター間のすべてのリンクをダウンさせました。それをブロックするために構築された監査ツールにはバグがありました。データセンターに到達できないFacebookのネームサーバーは、設計上、独自のBGPルートを撤回しました。そして、facebook.com、Instagram、WhatsApp、Messengerは、ほぼ6時間にわたってDNSから消滅しました。内部ツール、帯域外アクセス、オフィスのバッジはすべて同じネットワーク上にあるため、修正にはラックに人がいる必要がありました。

書面版を読む(英語) ↗

この動画の要点

  • Facebookが自社のアドレスを削除
  • 情報源:Meta Engineering、Cloudflare、Hacker News
  • これはThe Daily Diff、事後分析です
  • タイムライン:15:39 コマンド → 15:40 撤回 → 21:20 復旧
  • メカニズム:自分を削除するヘルスチェック、30倍のDNSストーム、ドア

翻訳されたトランスクリプト

オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。

Facebookが自社のアドレスを削除

0:00 Facebookはインターネットから自社のアドレスを削除し、エンジニアが それを元に戻しに到着しても、バッジリーダーもダウンしていました。 なぜなら、それらはFacebook上で動作していたからです。 Meta自身の事後分析(翌日):日常的なメンテナンスコマンドがすべての バックボーンリンクをダウンさせ、そのようなコマンドをブロックするために構築されたツールにはバグがありました。

情報源:Meta Engineering、Cloudflare、Hacker News

0:16 Cloudflare(外部から):UTC 15:40にFacebookのネームサーバーへのルートが 消滅し、dig facebook.comは地球上のどこでもSERVFAILを返しました。 どのようにそれが起こるのか、なぜ安全機能が事態を悪化させるのか、そして誰が非難されるのか。 これはThe Daily Diff、事後分析です。 UTCの午後早い時間。

これはThe Daily Diff、事後分析です

0:34 空いているバックボーン容量を確認するためのコマンドが、誤ってFacebookのデータセンター間の すべてのリンクをダウンさせ、まさにこれを検出するために構築された監査ツールは、

タイムライン:15:39 コマンド → 15:40 撤回 → 21:20 復旧

0:41 それを通過させてしまいました。 15:40。CloudflareのBGPフィードは撤回でいっぱいになり、FacebookのDNS プレフィックスはルーティングテーブルから消えました。 1分以内にCloudflareのエンジニアたちは部屋に集まり、自分たちが 1.1.1.1を壊したのではないかと考えていました。15:45、Hacker News、2600 ポイント。16:07、Facebookの広報担当者が、よりにもよってTwitterで:「一部のユーザーは アプリへのアクセスに問題が発生しています」と発言しました。 「一部のユーザー」とは35億人です。

1:06 18:51、ニューヨークタイムズ:従業員が建物から締め出され、 バッジが機能しない。19:52、CTOが謝罪。 21:00、5時間後、ルートが戻る。21:20、facebook.comが 解決される。なぜバックボーン障害がFacebookをインターネットから削除したのか?

メカニズム:自分を削除するヘルスチェック、30倍のDNSストーム、ドア

1:20 そのネームサーバーにはルールがあります:「データセンターに到達できない場合、 自分は異常だと宣言し、自分のアドレスの広告を停止する」というものです。 一つのサイトが不調になった場合には理にかなっています。 しかし、バックボーン全体がダウンすると、すべてのネームサーバーが一度にそれを行います。 サーバーは稼働しています。 誰もそれらを見つけることができません。 安全機能がネットワーク障害を存在障害に変えてしまいます。 それからインターネットが殺到します。アプリは再試行し、ユーザーは再読み込みし、

1:39 Cloudflareのリゾルバは通常の30倍の負荷を受けます。 存在しないサイトに対して。 そしてドアです。 ツール、帯域外アクセス、バッジ:すべて同じネットワーク上。 エンジニアはデータセンターに車で向かいますが、入ることができず、その後、物理的アクセスを持つあらゆる人物に対して強化されたラックに遭遇します。 物理的アクセスを持つあらゆる人物に対して強化されたラックに遭遇します。 攻撃者を遅らせるために作られたものが、所有者も遅らせてしまいました。 バックボーンが回復し、彼らは意図的にトラフィックをゆっくりと増やしました。

1:59 各データセンターは数千万ワットを削減しており、それを一度に元に戻すと 二度目の停止を引き起こします。

git blame — 分割

2:05 git blame。Facebook、55パーセント:コマンドは監査されたが、 監査ツールにバグがあり、一つのコマンドがすべてのルーターに到達した。 DNS設計、25パーセント:釣り合いを欠いたヘルスチェック。 一つのネットワーク、15パーセント:ツール、帯域外、バッジ。 ラック、5パーセント:その役割を果たした。 影響範囲:35億ユーザー、ほぼ6時間。 株価は5パーセント下落し、ザッカーバーグの資産は帳簿上60億ドル減少しました。

影響範囲

2:27 Telegramはその日に7000万人の新規登録を主張しました。 評決、事後分析:NEEDS REVIEW。 同日夜の声明、翌日には署名入りの事後分析、 監査ツールのバグが平易な英語で認められました。

評決 + 月曜日の提言

2:38 修正リスト:テストと訓練を強化する。 本番ネットワークからドアを外すことについては何も言及されていません。 月曜日:帯域外アクセスとドアを、自分が運用していないネットワークに 置いてください。 まだ話すことが許されていないインシデントがあれば、コメント欄か thedailydiff.devまで送ってください。 そして、今日のdiffはこれで終わりです。 AxrisiのNikoでした。

2:58 責任を持ってマージしましょう。

情報源

  1. Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
  2. Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
  3. Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
  4. Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
  5. Andy Stone (Facebook), 16:07 UTCtwitter.com
  6. Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
  7. Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
  8. Hacker News (2,589 points)news.ycombinator.com
  9. The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
  10. Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
  11. Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
  12. Krebs on Securitykrebsonsecurity.com

関連動画

postmortem · ja · 2026/09/19

Google Cloudが空白フィールドでクラッシュ。3時間。

空白のフィールドを含むポリシ行がヌルポインタにヒットし、Google Cloudはすべてのリージョンで一度にクラッシュしました。その後、Cloudflareもダウンしました。2025年6月12日、17:49 UTC: すべてのGoogle Cloud APIリクエストを承認するバイナリであるService Controlが、「意図しない空白フィールド」を含むクォータポリシの変更を読み込み、2週間前

2:57 ↗
postmortem · ja · 2026/09/25

1ミリ秒のバグで英国の航空交通が6時間停止

9月8日火曜日の午前10時、NATSの国家空域システム(NAS)内で通常のスコークコード要求が、値の更新途中に優先度の高いメッセージによって中断された。露出ウィンドウは約1ミリ秒。要求は誤ったまま再開され、フライトデータが破損し、午後7時30分までに2,000便以上の英国発着便が遅延、欠航、または目的地変更となった。

3:06 ↗
postmortem · ja · 2026/09/22

再起動でテルストラは2006年に逆戻り。900万台の電話が影響。

メルボルンのエンジニアが午前2時50分にタイミングシャーシの電源を入れ直したところ、朝食の時間までにはオーストラリア最大のモバイルネットワークが「今は2006年11月である」と認識する事態に。2026年7月8日、テルストラのNTPシャーシ内のGPSカードが電源修理中に再起動し、ファームウェアにはGPS週数ロールオーバーのアップデートが一度も適用されていなかったため、古いエポックを選択し、1,024

3:15 ↗
postmortem · ja · 2026/09/12

正規表現がCloudflareをダウンさせた。27分間。

2019年7月2日13時42分(UTC):CloudflareのWebアプリケーションファイアウォール(WAF)に新しいルールが180以上の都市で約2秒で適用されました。これはシミュレートモードのXSSルールであり、何もブロックしませんが、すべてのリクエストで実行され、末尾は.*(?:.*=.*)となっています。PCREはバックトラックし、HTTPを処理するすべてのCPUコアが100%に達し、Cl

3:00 ↗