O Facebook autoexcluiu-se da internet. Seis horas.
O Facebook remove o seu próprio endereço da internet e, quando os seus engenheiros chegam para o recolocar, os leitores de crachás também estão inoperantes, porque funcionam no Facebook.
O Facebook remove o seu próprio endereço da internet e, quando os seus engenheiros chegam para o recolocar, os leitores de crachás também estão inoperantes, porque funcionam no Facebook. 4 de outubro de 2021, 15:40 UTC: um comando de manutenção de rotina da backbone desativa todas as ligações entre os centros de dados do Facebook; a ferramenta de auditoria criada para o bloquear tem um erro; os servidores de nomes do Facebook, incapazes de aceder aos centros de dados, retiram as suas próprias rotas BGP por design — e facebook.com, Instagram, WhatsApp e Messenger desaparecem do DNS por quase seis horas. Ferramentas internas, acesso fora de banda e os crachás de escritório utilizam a mesma rede, pelo que a correção requer pessoas nos bastidores.
Ler a edição escrita (Inglês) ↗
O que este vídeo aborda
- O Facebook remove o seu próprio endereço
- Os comprovativos: Meta Engineering, Cloudflare, Hacker News
- Isto é The Daily Diff, post-mortem
- Cronologia: comando 15:39 → retirado 15:40 → de volta 21:20
- Mecanismo: a verificação de saúde que te apaga, a tempestade DNS 30×, as portas
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
O Facebook remove o seu próprio endereço
0:00 O Facebook remove o seu próprio endereço da internet, e quando os seus engenheiros chegam para o recolocar, os leitores de crachás também estão inoperantes, porque funcionam no Facebook. O próprio post-mortem da Meta, no dia seguinte: um comando de manutenção de rotina desativa todas as ligações da backbone, e a ferramenta criada para bloquear comandos desse tipo tem um erro.
Os comprovativos: Meta Engineering, Cloudflare, Hacker News
0:16 Cloudflare, de fora: às 15:40 UTC as rotas para os servidores de nomes do Facebook desaparecem, e dig facebook.com retorna SERVFAIL em todo o planeta. Como acontece, por que uma funcionalidade de segurança piora, e quem leva a culpa. Isto é The Daily Diff, post-mortem. Início da tarde, UTC.
Isto é The Daily Diff, post-mortem
0:34 Um comando destinado a verificar a capacidade livre da backbone desativa todas as ligações entre os centros de dados do Facebook, e a ferramenta de auditoria construída para detetar exatamente isto
Cronologia: comando 15:39 → retirado 15:40 → de volta 21:20
0:41 deixa-o passar. 15:40. O feed BGP da Cloudflare enche-se de retiradas; os prefixos DNS do Facebook saem da tabela de encaminhamento. Dentro de um minuto, os engenheiros da Cloudflare estão numa sala a perguntar-se se estragaram o 1.1.1.1. 15:45, Hacker News, dois mil e seiscentos pontos. 16:07, o porta-voz do Facebook, no Twitter de todos os lugares: algumas pessoas estão com problemas para aceder às nossas aplicações. Algumas pessoas são três mil e quinhentos milhões.
1:06 18:51, o New York Times: funcionários trancados fora dos seus edifícios, crachás inoperantes. 19:52, o CTO pede desculpas. 21:00, cinco horas depois, as rotas voltam; 21:20, facebook.com resolve. Por que é que uma falha da backbone apaga o Facebook da internet?
Mecanismo: a verificação de saúde que te apaga, a tempestade DNS 30×, as portas
1:20 Os seus servidores de nomes têm uma regra: se não conseguirem chegar aos centros de dados, declaram-se não saudáveis, param de anunciar o seu endereço. Sensato quando um site avaria. Quando toda a backbone avaria, todos os servidores de nomes o fazem de uma só vez. Os servidores estão ativos. Ninguém os consegue encontrar. Uma funcionalidade de segurança transforma uma falha de rede numa falha de existência. Depois a internet agrava a situação: as aplicações tentam novamente, os utilizadores recarregam,
1:39 e o resolvedor da Cloudflare vê trinta vezes a sua carga normal, para um site que não existe. E as portas. Ferramentas, acesso fora de banda, crachás: mesma rede. Engenheiros conduzem até aos centros de dados, não conseguem entrar, depois encontram racks reforçados contra qualquer pessoa com acesso físico. Construído para atrasar um atacante, também atrasa o proprietário. A backbone retorna; eles aumentam o tráfego lentamente, de propósito.
1:59 Cada centro de dados desligou dezenas de megawatts, e reverter isso num só passo é uma segunda interrupção.
git blame — a divisão
2:05 git blame. Facebook, cinquenta e cinco por cento: o comando foi auditado, o auditor tinha o erro, um comando atingiu todos os routers. O design DNS, vinte e cinco: uma verificação de saúde sem sentido de proporção. Uma rede, quinze: ferramentas, fora de banda, crachás. Os racks, cinco, por fazerem o seu trabalho. Raio de impacto: três mil e quinhentos milhões de utilizadores, quase seis horas. As ações fecham em baixa de cinco por cento, seis mil milhões de Zuckerberg,
Raio de impacto
2:27 no papel. O Telegram afirma setenta milhões de inscrições nesse dia. Veredito, post-mortem: NEEDS REVIEW. Declaração na mesma noite, post-mortem de autor nomeado dentro de um dia, erro da ferramenta de auditoria admitido em linguagem simples.
Veredito + a linha de segunda-feira
2:38 A lista de correções: fortalecer testes e simulações. Nada sobre tirar as portas da rede de produção. Segunda-feira: coloque o seu acesso fora de banda, e a sua porta, numa rede que não opera. Envie-me o incidente sobre o qual ainda não lhe é permitido falar, nos comentários, ou em the daily diff dot dev. E este é o diff para hoje. Sou o Niko da Axrisi.
2:58 Faça a fusão com responsabilidade.
Fontes
- Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
- Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
- Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
- Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
- Andy Stone (Facebook), 16:07 UTCtwitter.com
- Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
- Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
- Hacker News (2,589 points)news.ycombinator.com
- The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
- Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
- Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
- Krebs on Securitykrebsonsecurity.com



