Um reboot enviou a Telstra para 2006. Nove milhões de telefones.
Um engenheiro em Melbourne volta a ligar um chassis de temporização às 2:50 da manhã, e ao pequeno-almoço a maior rede móvel da Austrália concorda que é novembro de 2006.
Um engenheiro em Melbourne volta a ligar um chassis de temporização às 2:50 da manhã, e ao pequeno-almoço a maior rede móvel da Austrália concorda que é novembro de 2006. 8 de julho de 2026: uma placa GPS no chassis NTP da Telstra reinicia durante uma reparação da fonte de alimentação, o seu firmware nunca teve a atualização de "GPS week-rollover", por isso escolhe a época antiga e aterra 1.024 semanas no passado. Como uma solução de outubro de 2025 tinha tornado essa placa a única fonte de estrato 1 da rede — e uma mudança em 2020 para o "peering" NTP tinha deixado todas as outras fontes a jusante dela — a data errada ganha a votação. Os nós de "handover" reiniciam a partir das 4 da manhã, 45% de todas as chamadas e sessões de dados são afetadas, quase 9 milhões de clientes perdem chamadas, mensagens de texto ou dados, 604 chamadas para o Triple Zero dão erro, os comboios regionais de Victoria param, e a maioria dos serviços volta às 12:12. Os próprios alarmes da Telstra estavam numa plataforma verificada durante o horário de expediente; a empresa apercebeu-se porque os clientes estavam a pesquisar no Google "Telstra outage".
Ler a edição escrita (Inglês) ↗
O que este vídeo aborda
- Uma placa GPS acorda em novembro de 2006
- Cronologia: design de 2010 → chassis de 2020 → placa GPS de outubro de 2025 → 02:50
- A manhã: 04:00 MME reinicia → 04:20 tempestade de alarmes → 12:12 restaurado
- Mecanismo: NTP vota sobre o acordo, não a plausibilidade
- git blame — Telstra 55 · peering 25 · firmware 15 · a fonte de alimentação 5
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
Uma placa GPS acorda em novembro de 2006
0:00 Um engenheiro em Melbourne volta a ligar um chassis de temporização às duas e cinquenta da manhã, e ao pequeno-almoço a maior rede móvel da Austrália concorda que é novembro de dois mil e seis. O relatório externo da Telstra diz que a data deixou uma placa GPS e toda a rede votou a favor dela. Quase nove milhões de clientes perdem chamadas, mensagens de texto ou dados, e os comboios regionais de Victoria param por um dia. Como aconteceu, porque uma placa superou o relógio nacional,
0:23 e quem leva a culpa. Este é o The Daily Diff, post-mortem.
Cronologia: design de 2010 → chassis de 2020 → placa GPS de outubro de 2025 → 02:50
0:28 Dois mil e dez. O design é de livro. Três fontes de tempo nacionais alimentam dois servidores, esses alimentam três abaixo, e cada nó recebe o tempo apenas de cima. Os auditores consideram-no adequado ao propósito. Dois mil e vinte. Novo chassis. Não consegue alimentar o seu próprio servidor inferior, então Sydney e Melbourne são interligados e cada site cai para uma referência. Então tudo é mudado para "peering", onde qualquer servidor pode receber o tempo de qualquer
0:50 servidor que encontrar. As palavras "ciclo de temporização" não aparecem em nenhum documento. Outubro de dois mil e vinte e cinco. Melbourne continua a perder Sydney, e os seus alarmes dizem estrato cinco, o que significa que recebe o tempo dos seus próprios clientes. Ninguém abre um ticket. Em vez disso, os engenheiros ligam uma placa GPS que esteve inativa por cinco anos. Os alarmes param.
1:07 Melbourne é agora estrato um, o "rank" do instituto nacional, e ninguém o revisa. Oito de julho, duas e cinquenta da manhã. Uma fonte de alimentação precisa ser substituída, então o chassis reinicia, e a placa GPS com ele. O seu firmware nunca foi atualizado, então escolhe a época antiga e aterra mil e vinte e quatro semanas no passado. Melbourne é o topo da árvore, e a jusante começa a concordar.
A manhã: 04:00 MME reinicia → 04:20 tempestade de alarmes → 12:12 restaurado
1:26 Quatro da manhã, os nós de "handover" começam a reiniciar. Quatro e vinte, uma tempestade de alarmes, numa plataforma cujos alarmes são lidos no horário de expediente. Quatro e vinte e nove, a Telstra apercebe-se, porque os clientes estão a pesquisar no Google "Telstra outage". Os engenheiros que fizeram a mudança estão em descanso obrigatório, e encontrar a data leva horas. Por volta das doze e doze, a maioria dos clientes está de volta.
Mecanismo: NTP vota sobre o acordo, não a plausibilidade
1:47 Porque foi possível? O NTP tem duas defesas. O estrato inferior ganha, e os "outliers" são votados para fora. A placa GPS tornou a fonte quebrada a mais alta "rank", e todas as fontes que podiam discordar estavam a jusante, repetindo-a. O NTP nunca pergunta se uma data é plausível, apenas se os outros concordam. O protocolo funcionou.
2:06 A arquitetura não.
git blame — Telstra 55 · peering 25 · firmware 15 · a fonte de alimentação 5
2:07 git blame. Telstra, cinquenta e cinco por cento. Ninguém era dono do relógio, então ninguém revisou a mudança, e dois boletins do fornecedor sobre este bug exato ficaram por ler. Modo "peering", vinte e cinco, por deixar os servidores votarem com o seu próprio eco. O firmware, quinze, publicado e nunca instalado. Cinco por cento para a fonte de alimentação, por escolher dez para as três de uma quarta-feira. Raio de impacto. Quarenta e cinco por cento de todas as chamadas e sessões de dados naquele dia,
Raio de impacto: 45% das sessões, uma multa de 30 milhões de dólares por uma caixa de 30 mil dólares
2:30 disse o CEO ao Senado. A multa em causa é de trinta milhões de dólares, por uma atualização gratuita que falta num equipamento de trinta mil dólares. A placa tinha sobrevivido ao verdadeiro "rollover" em dois mil e dezanove porque ninguém a desligou. A reparação matou-a. Veredicto, post-mortem: SHIP IT, na resposta.
Veredicto + a linha de segunda-feira: um relógio com três chapéus
2:46 A Telstra contrata auditores externos, publica o relatório sem edição, com a frase de que nunca tratou o tempo como crítico, e muda todos os três sites dos servidores antigos antes que aconteça. Linha de segunda-feira: execute um "NTP trace" e conte quantas das suas fontes de tempo são um relógio usando três chapéus. Envie-me o incidente sobre o qual ainda não pode falar, nos comentários, ou em thedailydiff.dev. E esta é a diferença de hoje.
3:10 Eu sou o Niko da Axrisi. Faça a "merge" com responsabilidade.
Fontes
- Technology Audit Partners, "Findings Report on the July 8th Telstra Outage" (published by Telstra, Sep 2, 2026)www.telstra.com.au
- Vicki Brady (Telstra CEO), "What we've learned from the external investigation of our July outage" (Sep 2, 2026)www.telstra.com.au
- Netnod, Sven-Christian Ebenhag, "Telstra outage: The night a network decided the year was 2006" (Sep 17, 2026)www.netnod.se
- Hacker News on the Netnod post (93 points)news.ycombinator.com
- The Guardian, Senate inquiry: 45 % of sessions, ~9M customers, 604 Triple Zero errors (Jul 17, 2026)www.theguardian.com
- ABC News, "Telstra recently warned about timing issue linked to national outage" (Jul 10, 2026)www.abc.net.au
- The Register, the day itself (Jul 8, 2026)www.theregister.com
- ACS Information Age, the $30,000 box and the $30M fine (Jul 14, 2026)ia.acs.org.au



