+− THE DAILY DIFFdev & AI news
SHIP IT

Un riavvio ha riportato Telstra al 2006. Nove milioni di telefoni.

Un ingegnere a Melbourne riaccende un telaio di temporizzazione alle 2:50 del mattino, e per l'ora di colazione la più grande rete mobile australiana concorda che è novembre 2006.

Un ingegnere a Melbourne riaccende un telaio di temporizzazione alle 2:50 del mattino, e per l'ora di colazione la più grande rete mobile australiana concorda che è novembre 2006. 8 luglio 2026: una scheda GPS nel telaio NTP di Telstra si riavvia durante una riparazione dell'alimentatore, il suo firmware non ha mai ricevuto l'aggiornamento per il "GPS week-rollover", quindi sceglie l'epoca vecchia e torna indietro di 1.024 settimane. Poiché una soluzione provvisoria dell'ottobre 2025 aveva reso quella scheda l'unica sorgente di stratum-1 della rete — e un passaggio al peering NTP nel 2020 aveva lasciato ogni altra sorgente a valle di essa — la data sbagliata vince la votazione. I nodi di "handover" si ripristinano dalle 4 del mattino, il 45% di tutte le chiamate e le sessioni dati sono interessate, quasi 9 milioni di clienti perdono chiamate, messaggi o dati, 604 chiamate al Triplo Zero (numero di emergenza) vanno in errore, i treni regionali del Victoria si fermano, e la maggior parte dei servizi torna operativa alle 12:12. I sistemi di allarme di Telstra si trovavano su una piattaforma controllata durante l'orario lavorativo; l'azienda si è accorta del problema perché i clienti cercavano su Google "Telstra outage".

Leggi l'edizione scritta (inglese) ↗

Contenuto di questo video

  • Una scheda GPS si "sveglia" a novembre 2006
  • Cronologia: design 2010 → chassis 2020 → scheda GPS ott 2025 → 02:50
  • La mattina: 04:00 reset MME → 04:20 tempesta di allarmi → 12:12 ripristinato
  • Meccanismo: NTP vota sulla concordanza, non sulla plausibilità
  • git blame — Telstra 55 · peering 25 · firmware 15 · l'alimentatore 5

Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

Una scheda GPS si "sveglia" a novembre 2006

0:00 Un ingegnere a Melbourne riaccende un telaio di temporizzazione alle tre meno dieci del mattino, e per l'ora di colazione la più grande rete mobile australiana concorda che è novembre duemilasei. Il rapporto esterno di Telstra dice che la data ha lasciato una scheda GPS e l'intera rete ha votato per essa. Quasi nove milioni di clienti perdono chiamate, messaggi o dati, e i treni regionali del Victoria si fermano per la giornata. Come è successo, perché una scheda ha superato l'orologio nazionale,

0:23 e chi è il responsabile. Questo è The Daily Diff, post-mortem.

Cronologia: design 2010 → chassis 2020 → scheda GPS ott 2025 → 02:50

0:28 Duemiladieci. Il design è esemplare. Tre sorgenti di tempo nazionali alimentano due server, questi ne alimentano tre sotto, e ogni nodo prende il tempo solo dall'alto. Gli auditor lo ritengono adatto allo scopo. Duemilaventi. Nuovo chassis. Non può alimentare il suo server inferiore, quindi Sydney e Melbourne vengono incrociate e ogni sito si riduce a un solo riferimento. Poi tutto viene passato al peering, dove ogni server può prendere il tempo da qualsiasi

0:50 server che trova. Le parole "loop di temporizzazione" non appaiono in nessun documento. Ottobre duemilaventicinque. Melbourne continua a perdere Sydney, e i suoi allarmi dicono stratum cinque, il che significa che prende il tempo dai suoi stessi clienti. Nessuno apre un ticket. Invece gli ingegneri attivano una scheda GPS che era rimasta inattiva per cinque anni. Gli allarmi si fermano.

1:07 Melbourne è ora stratum uno, il rango dell'istituto nazionale, e nessuno lo esamina. Otto luglio, due e cinquanta del mattino. Un alimentatore deve essere sostituito, quindi il telaio si riavvia, e con esso la scheda GPS. Il suo firmware non è mai stato aggiornato, quindi sceglie l'epoca vecchia e torna indietro di mille ventiquattro settimane nel passato. Melbourne è in cima all'albero, e il downstream inizia a concordare.

La mattina: 04:00 reset MME → 04:20 tempesta di allarmi → 12:12 ripristinato

1:26 Ore quattro del mattino, i nodi di "handover" iniziano a resettarsi. Quattro e venti, una tempesta di allarmi, su una piattaforma i cui allarmi vengono letti in orario lavorativo. Quattro e ventinove, Telstra si accorge, perché i clienti stanno cercando su Google Telstra outage. Gli ingegneri che hanno fatto il cambiamento sono a riposo obbligatorio, e trovare la data richiede ore. Per le dodici e dodici la maggior parte dei clienti è tornata operativa.

Meccanismo: NTP vota sulla concordanza, non sulla plausibilità

1:47 Perché è stato possibile? NTP ha due difese. Lo stratum più basso vince, e gli "outlier" vengono votati via. La scheda GPS ha reso la sorgente rotta il rango più alto, e ogni sorgente che avrebbe potuto non concordare si trovava a valle, ripetendola. NTP non chiede mai se una data sia plausibile, solo se gli altri sono d'accordo. Il protocollo ha funzionato.

2:06 L'architettura no.

git blame — Telstra 55 · peering 25 · firmware 15 · l'alimentatore 5

2:07 git blame. Telstra, cinquantacinque percento. Nessuno possedeva l'orologio, quindi nessuno ha rivisto il cambiamento, e due bollettini dei fornitori su questo esatto bug sono rimasti non letti. Modalità peering, venticinque, per aver permesso ai server di votare con il proprio eco. Il firmware, quindici, pubblicato e mai installato. Cinque percento all'alimentatore, per aver scelto le tre meno dieci di mercoledì. Raggio d'impatto. Quarantacinque percento di tutte le chiamate e le sessioni dati quel giorno,

Raggio d'impatto: 45% delle sessioni, una multa di 30 milioni di dollari per una scatola da 30.000 dollari

2:30 dice il CEO al Senato. La multa sul tavolo è di trenta milioni di dollari, per un aggiornamento gratuito mancante da una scatola da trentamila dollari. La scheda era sopravvissuta al vero "rollover" nel duemiladiciannove perché nessuno l'aveva spenta. La riparazione l'ha uccisa. Verdetto, post-mortem: SHIP IT, sulla risposta.

Verdetto + la "linea del lunedì": un orologio che "indossa tre cappelli"

2:46 Telstra assume revisori esterni, pubblica il rapporto senza modifiche, con la frase che non ha mai trattato il tempo come critico, e sposta tutti e tre i siti dai vecchi server prima che avvenga. Linea del lunedì: esegui una traccia NTP e conta quante delle tue sorgenti di tempo sono un unico orologio che "indossa tre cappelli". Inviami l'incidente di cui non ti è ancora permesso parlare, nei commenti, o su thedailydiff.dev. E questa è la differenza per oggi.

3:10 Sono Niko di Axrisi. Unisci responsabilmente.

Fonti

  1. Technology Audit Partners, "Findings Report on the July 8th Telstra Outage" (published by Telstra, Sep 2, 2026)www.telstra.com.au
  2. Vicki Brady (Telstra CEO), "What we've learned from the external investigation of our July outage" (Sep 2, 2026)www.telstra.com.au
  3. Netnod, Sven-Christian Ebenhag, "Telstra outage: The night a network decided the year was 2006" (Sep 17, 2026)www.netnod.se
  4. Hacker News on the Netnod post (93 points)news.ycombinator.com
  5. The Guardian, Senate inquiry: 45 % of sessions, ~9M customers, 604 Triple Zero errors (Jul 17, 2026)www.theguardian.com
  6. ABC News, "Telstra recently warned about timing issue linked to national outage" (Jul 10, 2026)www.abc.net.au
  7. The Register, the day itself (Jul 8, 2026)www.theregister.com
  8. ACS Information Age, the $30,000 box and the $30M fine (Jul 14, 2026)ia.acs.org.au

Video correlati