+− THE DAILY DIFFdev & AI news
SHIP IT

Um reboot enviou a Telstra para 2006. Nove milhões de telefones.

Um engenheiro em Melbourne volta a ligar um chassis de temporização às 2:50 da manhã, e ao pequeno-almoço a maior rede móvel da Austrália concorda que é novembro de 2006.

Um engenheiro em Melbourne volta a ligar um chassis de temporização às 2:50 da manhã, e ao pequeno-almoço a maior rede móvel da Austrália concorda que é novembro de 2006. 8 de julho de 2026: uma placa GPS no chassis NTP da Telstra reinicia durante uma reparação da fonte de alimentação, o seu firmware nunca teve a atualização de "GPS week-rollover", por isso escolhe a época antiga e aterra 1.024 semanas no passado. Como uma solução de outubro de 2025 tinha tornado essa placa a única fonte de estrato 1 da rede — e uma mudança em 2020 para o "peering" NTP tinha deixado todas as outras fontes a jusante dela — a data errada ganha a votação. Os nós de "handover" reiniciam a partir das 4 da manhã, 45% de todas as chamadas e sessões de dados são afetadas, quase 9 milhões de clientes perdem chamadas, mensagens de texto ou dados, 604 chamadas para o Triple Zero dão erro, os comboios regionais de Victoria param, e a maioria dos serviços volta às 12:12. Os próprios alarmes da Telstra estavam numa plataforma verificada durante o horário de expediente; a empresa apercebeu-se porque os clientes estavam a pesquisar no Google "Telstra outage".

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Uma placa GPS acorda em novembro de 2006
  • Cronologia: design de 2010 → chassis de 2020 → placa GPS de outubro de 2025 → 02:50
  • A manhã: 04:00 MME reinicia → 04:20 tempestade de alarmes → 12:12 restaurado
  • Mecanismo: NTP vota sobre o acordo, não a plausibilidade
  • git blame — Telstra 55 · peering 25 · firmware 15 · a fonte de alimentação 5

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

Uma placa GPS acorda em novembro de 2006

0:00 Um engenheiro em Melbourne volta a ligar um chassis de temporização às duas e cinquenta da manhã, e ao pequeno-almoço a maior rede móvel da Austrália concorda que é novembro de dois mil e seis. O relatório externo da Telstra diz que a data deixou uma placa GPS e toda a rede votou a favor dela. Quase nove milhões de clientes perdem chamadas, mensagens de texto ou dados, e os comboios regionais de Victoria param por um dia. Como aconteceu, porque uma placa superou o relógio nacional,

0:23 e quem leva a culpa. Este é o The Daily Diff, post-mortem.

Cronologia: design de 2010 → chassis de 2020 → placa GPS de outubro de 2025 → 02:50

0:28 Dois mil e dez. O design é de livro. Três fontes de tempo nacionais alimentam dois servidores, esses alimentam três abaixo, e cada nó recebe o tempo apenas de cima. Os auditores consideram-no adequado ao propósito. Dois mil e vinte. Novo chassis. Não consegue alimentar o seu próprio servidor inferior, então Sydney e Melbourne são interligados e cada site cai para uma referência. Então tudo é mudado para "peering", onde qualquer servidor pode receber o tempo de qualquer

0:50 servidor que encontrar. As palavras "ciclo de temporização" não aparecem em nenhum documento. Outubro de dois mil e vinte e cinco. Melbourne continua a perder Sydney, e os seus alarmes dizem estrato cinco, o que significa que recebe o tempo dos seus próprios clientes. Ninguém abre um ticket. Em vez disso, os engenheiros ligam uma placa GPS que esteve inativa por cinco anos. Os alarmes param.

1:07 Melbourne é agora estrato um, o "rank" do instituto nacional, e ninguém o revisa. Oito de julho, duas e cinquenta da manhã. Uma fonte de alimentação precisa ser substituída, então o chassis reinicia, e a placa GPS com ele. O seu firmware nunca foi atualizado, então escolhe a época antiga e aterra mil e vinte e quatro semanas no passado. Melbourne é o topo da árvore, e a jusante começa a concordar.

A manhã: 04:00 MME reinicia → 04:20 tempestade de alarmes → 12:12 restaurado

1:26 Quatro da manhã, os nós de "handover" começam a reiniciar. Quatro e vinte, uma tempestade de alarmes, numa plataforma cujos alarmes são lidos no horário de expediente. Quatro e vinte e nove, a Telstra apercebe-se, porque os clientes estão a pesquisar no Google "Telstra outage". Os engenheiros que fizeram a mudança estão em descanso obrigatório, e encontrar a data leva horas. Por volta das doze e doze, a maioria dos clientes está de volta.

Mecanismo: NTP vota sobre o acordo, não a plausibilidade

1:47 Porque foi possível? O NTP tem duas defesas. O estrato inferior ganha, e os "outliers" são votados para fora. A placa GPS tornou a fonte quebrada a mais alta "rank", e todas as fontes que podiam discordar estavam a jusante, repetindo-a. O NTP nunca pergunta se uma data é plausível, apenas se os outros concordam. O protocolo funcionou.

2:06 A arquitetura não.

git blame — Telstra 55 · peering 25 · firmware 15 · a fonte de alimentação 5

2:07 git blame. Telstra, cinquenta e cinco por cento. Ninguém era dono do relógio, então ninguém revisou a mudança, e dois boletins do fornecedor sobre este bug exato ficaram por ler. Modo "peering", vinte e cinco, por deixar os servidores votarem com o seu próprio eco. O firmware, quinze, publicado e nunca instalado. Cinco por cento para a fonte de alimentação, por escolher dez para as três de uma quarta-feira. Raio de impacto. Quarenta e cinco por cento de todas as chamadas e sessões de dados naquele dia,

Raio de impacto: 45% das sessões, uma multa de 30 milhões de dólares por uma caixa de 30 mil dólares

2:30 disse o CEO ao Senado. A multa em causa é de trinta milhões de dólares, por uma atualização gratuita que falta num equipamento de trinta mil dólares. A placa tinha sobrevivido ao verdadeiro "rollover" em dois mil e dezanove porque ninguém a desligou. A reparação matou-a. Veredicto, post-mortem: SHIP IT, na resposta.

Veredicto + a linha de segunda-feira: um relógio com três chapéus

2:46 A Telstra contrata auditores externos, publica o relatório sem edição, com a frase de que nunca tratou o tempo como crítico, e muda todos os três sites dos servidores antigos antes que aconteça. Linha de segunda-feira: execute um "NTP trace" e conte quantas das suas fontes de tempo são um relógio usando três chapéus. Envie-me o incidente sobre o qual ainda não pode falar, nos comentários, ou em thedailydiff.dev. E esta é a diferença de hoje.

3:10 Eu sou o Niko da Axrisi. Faça a "merge" com responsabilidade.

Fontes

  1. Technology Audit Partners, "Findings Report on the July 8th Telstra Outage" (published by Telstra, Sep 2, 2026)www.telstra.com.au
  2. Vicki Brady (Telstra CEO), "What we've learned from the external investigation of our July outage" (Sep 2, 2026)www.telstra.com.au
  3. Netnod, Sven-Christian Ebenhag, "Telstra outage: The night a network decided the year was 2006" (Sep 17, 2026)www.netnod.se
  4. Hacker News on the Netnod post (93 points)news.ycombinator.com
  5. The Guardian, Senate inquiry: 45 % of sessions, ~9M customers, 604 Triple Zero errors (Jul 17, 2026)www.theguardian.com
  6. ABC News, "Telstra recently warned about timing issue linked to national outage" (Jul 10, 2026)www.abc.net.au
  7. The Register, the day itself (Jul 8, 2026)www.theregister.com
  8. ACS Information Age, the $30,000 box and the $30M fine (Jul 14, 2026)ia.acs.org.au

Vídeos relacionados