+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Facebook slettet seg selv fra internett. Seks timer.

Facebook fjerner sin egen adresse fra internett, og når ingeniørene ankommer for å legge den tilbake, er kortleserne også nede, fordi de kjører på Facebook.

Facebook fjerner sin egen adresse fra internett, og når ingeniørene ankommer for å legge den tilbake, er kortleserne også nede, fordi de kjører på Facebook. 4. oktober 2021, 15:40 UTC: en rutinemessig vedlikeholdskommando for ryggradnettverket tar ned alle koblinger mellom Facebooks datasentre; revisjonsverktøyet som er bygget for å blokkere den har en feil; Facebooks navneservere, ute av stand til å nå datasentrene, trekker sine egne BGP-ruter tilbake etter design – og facebook.com, Instagram, WhatsApp og Messenger forsvinner fra DNS i nesten seks timer. Interne verktøy, out-of-band-tilgang og kontoradgangskortene kjører på samme nettverk, så løsningen krever folk ved rackene.

Les den skriftlige utgaven (engelsk) ↗

Hva denne videoen dekker

  • Facebook fjerner sin egen adresse
  • Kvitteringene: Meta Engineering, Cloudflare, Hacker News
  • Dette er The Daily Diff, postmortem
  • Tidslinje: 15:39 kommando → 15:40 trukket tilbake → 21:20 tilbake
  • Mekanisme: helsesjekken som sletter deg, 30× DNS-stormen, dørene

Oversatt transkripsjon

Oversatt fra den originale engelske fortellingen. Tilgjengelig lyd og undertekster kontrolleres av YouTube.

Facebook fjerner sin egen adresse

0:00 Facebook fjerner sin egen adresse fra internett, og når ingeniørene kommer for å legge den tilbake, er kortleserne også nede, fordi de kjører på Facebook. Metas egen postmortem, neste dag: en rutinemessig vedlikeholdskommando tar ned hver ryggradkobling, og verktøyet bygget for å blokkere slike kommandoer har en feil.

Kvitteringene: Meta Engineering, Cloudflare, Hacker News

0:16 Cloudflare, fra utsiden: kl. 15:40 UTC forsvinner rutene til Facebooks navneservere, og dig facebook.com returnerer SERVFAIL overalt på planeten. Hvordan det skjer, hvorfor en sikkerhetsfunksjon gjør det verre, og hvem som får skylden. Dette er The Daily Diff, postmortem. Tidlig ettermiddag, UTC.

Dette er The Daily Diff, postmortem

0:34 En kommando ment å sjekke ledig ryggradkapasitet tar i stedet ned hver kobling mellom Facebooks datasentre, og revisjonsverktøyet bygget for å fange akkurat dette

Tidslinje: 15:39 kommando → 15:40 trukket tilbake → 21:20 tilbake

0:41 lar det passere. 15:40. Cloudflares BGP-strøm fylles med tilbaketrekninger; Facebooks DNS-prefiks forlater rutetabellen. Innen ett minutt er Cloudflares ingeniører i et rom og lurer på om de brøt 1.1.1.1. 15:45, Hacker News, tjueseks hundre poeng. 16:07, Facebooks talsmann, på Twitter av alle steder: noen mennesker har problemer med å få tilgang til appene våre. Noen mennesker er tre og en halv milliard.

1:06 18:51, The New York Times: ansatte låst ute fra bygningene sine, adgangskort døde. 19:52, CTO beklager. 21:00, fem timer inn, ruter returnerer; 21:20, facebook.com løses. Hvorfor sletter en ryggradfeil Facebook fra internett?

Mekanisme: helsesjekken som sletter deg, 30× DNS-stormen, dørene

1:20 Navneserverne har en regel: kan ikke nå datasentrene, erklær deg selv usunn, slutt å annonsere adressen din. Fornuftig når ett nettsted går dårlig. Når hele ryggradnettverket går ned, gjør hver navneserver det samtidig. Serverne er oppe. Ingen kan finne dem. En sikkerhetsfunksjon gjør en nettverksfeil til en eksistensfeil. Så legger internett på: apper prøver igjen, brukere laster inn på nytt,

1:39 og Cloudflares resolver ser tretti ganger sin normale belastning, for et nettsted som ikke er der. Og dørene. Verktøy, out-of-band-tilgang, adgangskort: samme nettverk. Ingeniører kjører til datasentrene, kommer seg ikke inn, og møter så rack herdet mot alle med fysisk tilgang. Bygget for å forsinke en angriper, forsinker det også eieren. Ryggradnettverket returnerer; de øker trafikken sakte, med vilje.

1:59 Hvert datasenter har droppet titalls megawatt, og å reversere det i ett trinn er et andre utfall.

git blame — splitten

2:05 git blame. Facebook, femtifem prosent: kommandoen ble revidert, revisoren hadde feilen, én kommando nådde hver ruter. DNS-designet, tjuefem: en helsesjekk uten sans for proporsjoner. Ett nettverk, femten: verktøy, out-of-band, adgangskort. Rackene, fem, for å gjøre jobben sin. Skadeomfang: tre og en halv milliard brukere, nesten seks timer. Aksjen stenger ned fem prosent, seks milliarder av Zuckerberg,

Skadeomfang

2:27 på papiret. Telegram hevder sytti millioner påmeldinger den dagen. Dom, postmortem: NEEDS REVIEW. Samme kveld uttalelse, navngitt forfatter postmortem innen en dag, revisjonsverktøyfeil innrømmet på enkelt norsk.

Dom + mandagslinjen

2:38 Fikselisten: styrke testing og øvelser. Ingenting om å ta dørene av produksjonsnettverket. Mandag: sett din out-of-band-tilgang, og din dør, på et nettverk du ikke opererer. Send meg hendelsen du fortsatt ikke får snakke om, i kommentarene, eller på the daily diff dot dev. Og det er The Daily Diff for i dag. Jeg er Niko fra Axrisi.

2:58 Merge responsibly.

Kilder

  1. Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
  2. Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
  3. Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
  4. Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
  5. Andy Stone (Facebook), 16:07 UTCtwitter.com
  6. Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
  7. Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
  8. Hacker News (2,589 points)news.ycombinator.com
  9. The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
  10. Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
  11. Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
  12. Krebs on Securitykrebsonsecurity.com

Relaterte videoer