Facebook slettede sig selv fra internettet. Seks timer.
Facebook fjerner sin egen adresse fra internettet, og da ingeniørerne ankommer for at genoprette den, er adgangskortlæserne også nede, fordi de kører på Facebook.
Facebook fjerner sin egen adresse fra internettet, og da ingeniørerne ankommer for at genoprette den, er adgangskortlæserne også nede, fordi de kører på Facebook. 4. oktober 2021, 15:40 UTC: en rutinemæssig backbone-vedligeholdelseskommando slår alle forbindelser mellem Facebooks datacentre ned; revisionsværktøjet, der er bygget til at blokere det, har en fejl; Facebooks navneservere, ude af stand til at nå datacentrene, trækker deres egne BGP-ruter tilbage efter design – og facebook.com, Instagram, WhatsApp og Messenger forsvinder fra DNS i næsten seks timer. Interne værktøjer, out-of-band adgang og kontorkort kører på det samme netværk, så rettelsen kræver folk ved rackene.
Læs den skriftlige udgave (engelsk) ↗
Hvad denne video dækker
- Facebook fjerner sin egen adresse
- Kvitteringerne: Meta Engineering, Cloudflare, Hacker News
- Dette er The Daily Diff, postmortem
- Tidslinje: 15:39 kommando → 15:40 tilbagetrukket → 21:20 tilbage
- Mekanisme: sundhedstjekket der sletter dig, 30× DNS-stormen, dørene
Oversat udskrift
Oversat fra den originale engelske fortælling. Tilgængelig lyd og undertekster styres af YouTube.
Facebook fjerner sin egen adresse
0:00 Facebook fjerner sin egen adresse fra internettet, og når dens ingeniører ankommer for at genoprette den, er adgangskortlæserne også nede, fordi de kører på Facebook. Metas egen postmortem, næste dag: en rutinemæssig vedligeholdelseskommando slår alle backbone-forbindelser ned, og værktøjet, der er bygget til at blokere sådanne kommandoer, har en fejl.
Kvitteringerne: Meta Engineering, Cloudflare, Hacker News
0:16 Cloudflare, udefra: kl. 15:40 UTC forsvinder ruterne til Facebooks navneservere, og dig facebook.com returnerer SERVFAIL overalt på planeten. Hvordan det sker, hvorfor en sikkerhedsfunktion gør det værre, og hvem der får skylden. Dette er The Daily Diff, postmortem. Tidlig eftermiddag, UTC.
Dette er The Daily Diff, postmortem
0:34 En kommando, der skulle kontrollere ledig backbone-kapacitet, slår i stedet alle forbindelser ned mellem Facebooks datacentre, og revisionsværktøjet, der er bygget til at fange præcis dette,
Tidslinje: 15:39 kommando → 15:40 tilbagetrukket → 21:20 tilbage
0:41 vinker det igennem. 15:40. Cloudflares BGP-feed fyldes med tilbagetrækninger; Facebooks DNS-præfikser forlader routingtabellen. Inden for et minut er Cloudflares ingeniører i et rum og spekulerer på, om de brød 1.1.1.1. 15:45, Hacker News, to tusind og seks hundrede point. 16:07, Facebooks talsmand, på Twitter af alle steder: nogle mennesker har problemer med at få adgang til vores apps. Nogle mennesker er tre og en halv milliard.
1:06 18:51, New York Times: medarbejdere låst ude af deres bygninger, adgangskort døde. 19:52, CTO undskylder. 21:00, fem timer inde, ruter vender tilbage; 21:20, facebook.com løses. Hvorfor sletter en backbone-fejl Facebook fra internettet?
Mekanisme: sundhedstjekket der sletter dig, 30× DNS-stormen, dørene
1:20 Dens navneservere har en regel: kan ikke nå datacentrene, erklær dig selv usund, stop med at annoncere din adresse. Fornuftigt når et sted går dårligt. Når hele backbone'en går ned, gør hver navneserver det på én gang. Serverne er oppe. Ingen kan finde dem. En sikkerhedsfunktion forvandler en netværksfejl til en eksistensfejl. Så hobes internettet sig op: apps prøver igen, brugere genindlæser,
1:39 og Cloudflares resolver ser tredive gange dens normale belastning, for et site der ikke er der. Og dørene. Værktøjer, out-of-band adgang, adgangskort: samme netværk. Ingeniører kører til datacentrene, kan ikke komme ind, møder derefter racks hærdet mod enhver med fysisk adgang. Bygget til at bremse en angriber, bremser den også ejeren. Backbone'en vender tilbage; de øger trafikken langsomt, med vilje.
1:59 Hvert datacenter har droppet titusindvis af megawatt, og at vende det i ét trin er en anden nedbrud.
git blame — splittelsen
2:05 git blame. Facebook, femoghalvtreds procent: kommandoen blev revideret, revisoren havde fejlen, én kommando nåede hver router. DNS-designet, femogtyve: et sundhedstjek uden proportioner. Ét netværk, femten: værktøjer, out-of-band, adgangskort. Rackene, fem, for at gøre deres job. Skadesradius: tre og en halv milliard brugere, næsten seks timer. Aktien lukker ned fem procent, seks milliarder fra Zuckerberg,
Skadesradius
2:27 på papiret. Telegram hævder halvfjerds millioner tilmeldinger den dag. Dom, postmortem: NEEDS REVIEW. Udtalelse samme aften, postmortem med navngiven forfatter inden for en dag, fejl i revisionsværktøj indrømmet i almindeligt engelsk.
Dom + mandagslinjen
2:38 Fejllisten: styrke test og øvelser. Intet om at fjerne dørene fra produktionsnetværket. Mandag: sæt din out-of-band adgang, og din dør, på et netværk du ikke driver. Send mig den hændelse du stadig ikke må tale om, i kommentarerne, eller på the daily diff dot dev. Og det er diffen for i dag. Jeg er Niko fra Axrisi.
2:58 Merge responsibly.
Kilder
- Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
- Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
- Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
- Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
- Andy Stone (Facebook), 16:07 UTCtwitter.com
- Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
- Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
- Hacker News (2,589 points)news.ycombinator.com
- The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
- Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
- Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
- Krebs on Securitykrebsonsecurity.com



