Facebookがインターネットから消滅。6時間。
Facebookはインターネットから自社のアドレスを削除し、エンジニアがそれを元に戻しに到着しても、バッジリーダーもダウンしていました。
Facebookはインターネットから自社のアドレスを削除し、エンジニアがそれを元に戻しに到着しても、バッジリーダーもダウンしていました。なぜなら、それらはFacebook上で動作していたからです。2021年10月4日、15:40 UTC:日常的なバックボーンメンテナンスコマンドが、Facebookのデータセンター間のすべてのリンクをダウンさせました。それをブロックするために構築された監査ツールにはバグがありました。データセンターに到達できないFacebookのネームサーバーは、設計上、独自のBGPルートを撤回しました。そして、facebook.com、Instagram、WhatsApp、Messengerは、ほぼ6時間にわたってDNSから消滅しました。内部ツール、帯域外アクセス、オフィスのバッジはすべて同じネットワーク上にあるため、修正にはラックに人がいる必要がありました。
この動画の要点
- Facebookが自社のアドレスを削除
- 情報源:Meta Engineering、Cloudflare、Hacker News
- これはThe Daily Diff、事後分析です
- タイムライン:15:39 コマンド → 15:40 撤回 → 21:20 復旧
- メカニズム:自分を削除するヘルスチェック、30倍のDNSストーム、ドア
翻訳されたトランスクリプト
オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。
Facebookが自社のアドレスを削除
0:00 Facebookはインターネットから自社のアドレスを削除し、エンジニアが それを元に戻しに到着しても、バッジリーダーもダウンしていました。 なぜなら、それらはFacebook上で動作していたからです。 Meta自身の事後分析(翌日):日常的なメンテナンスコマンドがすべての バックボーンリンクをダウンさせ、そのようなコマンドをブロックするために構築されたツールにはバグがありました。
情報源:Meta Engineering、Cloudflare、Hacker News
0:16 Cloudflare(外部から):UTC 15:40にFacebookのネームサーバーへのルートが 消滅し、dig facebook.comは地球上のどこでもSERVFAILを返しました。 どのようにそれが起こるのか、なぜ安全機能が事態を悪化させるのか、そして誰が非難されるのか。 これはThe Daily Diff、事後分析です。 UTCの午後早い時間。
これはThe Daily Diff、事後分析です
0:34 空いているバックボーン容量を確認するためのコマンドが、誤ってFacebookのデータセンター間の すべてのリンクをダウンさせ、まさにこれを検出するために構築された監査ツールは、
タイムライン:15:39 コマンド → 15:40 撤回 → 21:20 復旧
0:41 それを通過させてしまいました。 15:40。CloudflareのBGPフィードは撤回でいっぱいになり、FacebookのDNS プレフィックスはルーティングテーブルから消えました。 1分以内にCloudflareのエンジニアたちは部屋に集まり、自分たちが 1.1.1.1を壊したのではないかと考えていました。15:45、Hacker News、2600 ポイント。16:07、Facebookの広報担当者が、よりにもよってTwitterで:「一部のユーザーは アプリへのアクセスに問題が発生しています」と発言しました。 「一部のユーザー」とは35億人です。
1:06 18:51、ニューヨークタイムズ:従業員が建物から締め出され、 バッジが機能しない。19:52、CTOが謝罪。 21:00、5時間後、ルートが戻る。21:20、facebook.comが 解決される。なぜバックボーン障害がFacebookをインターネットから削除したのか?
メカニズム:自分を削除するヘルスチェック、30倍のDNSストーム、ドア
1:20 そのネームサーバーにはルールがあります:「データセンターに到達できない場合、 自分は異常だと宣言し、自分のアドレスの広告を停止する」というものです。 一つのサイトが不調になった場合には理にかなっています。 しかし、バックボーン全体がダウンすると、すべてのネームサーバーが一度にそれを行います。 サーバーは稼働しています。 誰もそれらを見つけることができません。 安全機能がネットワーク障害を存在障害に変えてしまいます。 それからインターネットが殺到します。アプリは再試行し、ユーザーは再読み込みし、
1:39 Cloudflareのリゾルバは通常の30倍の負荷を受けます。 存在しないサイトに対して。 そしてドアです。 ツール、帯域外アクセス、バッジ:すべて同じネットワーク上。 エンジニアはデータセンターに車で向かいますが、入ることができず、その後、物理的アクセスを持つあらゆる人物に対して強化されたラックに遭遇します。 物理的アクセスを持つあらゆる人物に対して強化されたラックに遭遇します。 攻撃者を遅らせるために作られたものが、所有者も遅らせてしまいました。 バックボーンが回復し、彼らは意図的にトラフィックをゆっくりと増やしました。
1:59 各データセンターは数千万ワットを削減しており、それを一度に元に戻すと 二度目の停止を引き起こします。
git blame — 分割
2:05 git blame。Facebook、55パーセント:コマンドは監査されたが、 監査ツールにバグがあり、一つのコマンドがすべてのルーターに到達した。 DNS設計、25パーセント:釣り合いを欠いたヘルスチェック。 一つのネットワーク、15パーセント:ツール、帯域外、バッジ。 ラック、5パーセント:その役割を果たした。 影響範囲:35億ユーザー、ほぼ6時間。 株価は5パーセント下落し、ザッカーバーグの資産は帳簿上60億ドル減少しました。
影響範囲
2:27 Telegramはその日に7000万人の新規登録を主張しました。 評決、事後分析:NEEDS REVIEW。 同日夜の声明、翌日には署名入りの事後分析、 監査ツールのバグが平易な英語で認められました。
評決 + 月曜日の提言
2:38 修正リスト:テストと訓練を強化する。 本番ネットワークからドアを外すことについては何も言及されていません。 月曜日:帯域外アクセスとドアを、自分が運用していないネットワークに 置いてください。 まだ話すことが許されていないインシデントがあれば、コメント欄か thedailydiff.devまで送ってください。 そして、今日のdiffはこれで終わりです。 AxrisiのNikoでした。
2:58 責任を持ってマージしましょう。
情報源
- Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
- Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
- Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
- Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
- Andy Stone (Facebook), 16:07 UTCtwitter.com
- Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
- Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
- Hacker News (2,589 points)news.ycombinator.com
- The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
- Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
- Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
- Krebs on Securitykrebsonsecurity.com



