+− THE DAILY DIFFdev & AI news
SHIP IT

Ein Neustart schickte Telstra ins Jahr 2006 zurück. Neun Millionen Telefone.

Ein Ingenieur in Melbourne schaltet um 2:50 Uhr morgens ein Zeitmess-Chassis wieder ein, und bis zum Frühstück ist Australiens größtes Mobilfunknetz der Meinung, es sei November 2006.

Ein Ingenieur in Melbourne schaltet um 2:50 Uhr morgens ein Zeitmess-Chassis wieder ein, und bis zum Frühstück ist Australiens größtes Mobilfunknetz der Meinung, es sei November 2006. 8. Juli 2026: Eine GPS-Karte in Telstras NTP-Chassis startet während einer Reparatur des Netzteils neu, ihre Firmware hat nie das GPS-Wochenwechsel-Update erhalten, daher wählt sie die alte Epoche und landet 1.024 Wochen in der Vergangenheit. Da eine Problemumgehung vom Oktober 2025 diese Karte zur einzigen Stratum-1-Quelle des Netzwerks gemacht hatte – und eine Umstellung auf NTP-Peering im Jahr 2020 jede andere Quelle nachgeschaltet ließ – gewinnt das falsche Datum die Abstimmung. Übergabeknoten werden ab 4 Uhr morgens zurückgesetzt, 45 % aller Anrufe und Datensitzungen sind betroffen, fast 9 Millionen Kunden verlieren Anrufe, SMS oder Daten, 604 Notrufe (Triple Zero) schlagen fehl, Victorias Regionalzüge halten, und die meisten Dienste sind um 12:12 Uhr wiederhergestellt. Telstras eigene Alarme befanden sich auf einer Plattform, die während der Geschäftszeiten überprüft wurde; das Unternehmen bemerkte es, weil Kunden nach „Telstra-Ausfall“ suchten.

Die schriftliche Ausgabe lesen (Englisch) ↗

Was dieses Video behandelt

  • Eine GPS-Karte erwacht im November 2006
  • Zeitleiste: 2010 Design → 2020 Chassis → Okt 2025 GPS-Karte → 02:50
  • Der Morgen: 04:00 MME-Resets → 04:20 Alarmsturm → 12:12 Wiederherstellung
  • Mechanismus: NTP stimmt über Übereinstimmung ab, nicht über Plausibilität
  • git blame — Telstra 55 · Peering 25 · Firmware 15 · das Netzteil 5

Übersetztes Transkript

Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.

Eine GPS-Karte erwacht im November 2006

0:00 Ein Ingenieur in Melbourne schaltet um zehn vor drei Uhr morgens ein Zeitmess-Chassis wieder ein, und bis zum Frühstück ist Australiens größtes Mobilfunknetz sich einig, es ist November zweitausendsechs. Telstras externer Bericht besagt, dass das Datum einer GPS-Karte entwich und das gesamte Netzwerk dafür stimmte. Fast neun Millionen Kunden verlieren Anrufe, SMS oder Daten, und Victorias Regionalzüge halten den Tag über an. Wie es geschah, warum eine Karte der nationalen Uhr überlegen war,

0:23 und wer die Schuld trägt. Dies ist The Daily Diff, Postmortem.

Zeitleiste: 2010 Design → 2020 Chassis → Okt 2025 GPS-Karte → 02:50

0:28 Zweitausendzehn. Das Design ist lehrbuchmäßig. Drei nationale Zeitquellen speisen zwei Server, diese speisen drei darunter, und jeder Knoten nimmt die Zeit nur von oben. Die Prüfer nennen es zweckmäßig. Zweitausendzwanzig. Neues Chassis. Es kann seinen eigenen unteren Server nicht speisen, also werden Sydney und Melbourne querverdrahtet und jeder Standort reduziert sich auf eine Referenz. Dann wird alles auf Peering umgestellt, wobei jeder Server die Zeit von jedem

0:50 Server nehmen kann, den er findet. Die Worte „Timing-Schleife“ erscheinen in keinem Dokument. Oktober zweitausendfünfundzwanzig. Melbourne verliert Sydney immer wieder, und seine Alarme zeigen Stratum fünf an, was bedeutet, dass es die Zeit von seinen eigenen Kunden nimmt. Niemand erstellt ein Ticket. Stattdessen schalten die Ingenieure eine GPS-Karte ein, die fünf Jahre lang untätig war. Die Alarme hören auf.

1:07 Melbourne ist jetzt Stratum eins, der Rang des nationalen Instituts, und niemand überprüft es. Achter Juli, zwei Uhr fünfzig morgens. Ein Netzteil muss ersetzt werden, also startet das Chassis neu, und die GPS-Karte damit. Ihre Firmware wurde nie aktualisiert, also wählt sie die alte Epoche und landet tausend vierundzwanzig Wochen in der Vergangenheit. Melbourne ist an der Spitze des Baumes, und nachgeschaltete stimmen zu.

Der Morgen: 04:00 MME-Resets → 04:20 Alarmsturm → 12:12 Wiederherstellung

1:26 Vier Uhr morgens, die Übergabeknoten beginnen sich zurückzusetzen. Vier Uhr zwanzig, ein Alarmsturm, auf einer Plattform, deren Alarme während der Geschäftszeiten gelesen werden. Vier Uhr neunundzwanzig, Telstra bemerkt es, weil Kunden nach „Telstra-Ausfall“ googeln. Die Ingenieure, die die Änderung vorgenommen haben, befinden sich im obligatorischen Ruhestand, und das Finden des Datums dauert Stunden. Bis zwölf Uhr zwölf sind die meisten Kunden wieder online.

Mechanismus: NTP stimmt über Übereinstimmung ab, nicht über Plausibilität

1:47 Warum war das möglich? NTP hat zwei Verteidigungsmechanismen. Niedrigeres Stratum gewinnt, und Ausreißer werden herausgewählt. Die GPS-Karte machte die defekte Quelle zum höchsten Rang, und jede Quelle, die widersprechen konnte, befand sich nachgeschaltet, und wiederholte es. NTP fragt nie, ob ein Datum plausibel ist, nur ob die anderen zustimmen. Das Protokoll funktionierte.

2:06 Die Architektur nicht.

git blame — Telstra 55 · Peering 25 · Firmware 15 · das Netzteil 5

2:07 git blame. Telstra, fünfundfünfzig Prozent. Niemand war für die Uhr verantwortlich, also überprüfte niemand die Änderung, und zwei Anbieter-Bulletins über genau diesen Fehler blieben ungelesen. Peering-Modus, fünfundzwanzig, dafür, dass Server mit ihrem eigenen Echo abstimmen durften. Die Firmware, fünfzehn, veröffentlicht und nie installiert. Fünf Prozent an das Netzteil, dafür, dass es zehn vor drei an einem Mittwoch wählte. Auswirkungsbereich. Fünfundvierzig Prozent aller Anrufe und Datensitzungen an diesem Tag,

Auswirkungsbereich: 45 % der Sitzungen, eine 30-Millionen-Dollar-Strafe für eine 30.000-Dollar-Box

2:30 erzählt der CEO dem Senat. Die fällige Strafe beträgt dreißig Millionen Dollar, für ein kostenloses Update, das in einer dreißigtausend Dollar teuren Box fehlte. Die Karte hatte den echten Rollover im Jahr zweitausendneunzehn überlebt, weil niemand sie ausschaltete. Die Reparatur tötete sie. Urteil, Postmortem: SHIP IT, bezüglich der Reaktion.

Urteil + die Montagszeile: eine Uhr mit drei Hüten

2:46 Telstra beauftragt externe Prüfer, veröffentlicht den Bericht unredigiert, mit der Aussage, dass es die Zeit nie als kritisch angesehen habe, und verlagert alle drei Standorte von den alten Servern, bevor es landet. Montagszeile: Führen Sie einen NTP-Trace durch und zählen Sie, wie viele Ihrer Zeitquellen eine Uhr sind, die drei Hüte trägt. Schicken Sie mir den Vorfall, über den Sie immer noch nicht sprechen dürfen, in den Kommentaren oder unter thedailydiff.dev. Und das ist der Diff für heute.

3:10 Ich bin Niko von Axrisi. Verantwortungsbewusst zusammenführen.

Quellen

  1. Technology Audit Partners, "Findings Report on the July 8th Telstra Outage" (published by Telstra, Sep 2, 2026)www.telstra.com.au
  2. Vicki Brady (Telstra CEO), "What we've learned from the external investigation of our July outage" (Sep 2, 2026)www.telstra.com.au
  3. Netnod, Sven-Christian Ebenhag, "Telstra outage: The night a network decided the year was 2006" (Sep 17, 2026)www.netnod.se
  4. Hacker News on the Netnod post (93 points)news.ycombinator.com
  5. The Guardian, Senate inquiry: 45 % of sessions, ~9M customers, 604 Triple Zero errors (Jul 17, 2026)www.theguardian.com
  6. ABC News, "Telstra recently warned about timing issue linked to national outage" (Jul 10, 2026)www.abc.net.au
  7. The Register, the day itself (Jul 8, 2026)www.theregister.com
  8. ACS Information Age, the $30,000 box and the $30M fine (Jul 14, 2026)ia.acs.org.au

Ähnliche Videos