+− THE DAILY DIFFdev & AI news
SHIP IT

Sistem Telstra Kembali ke Tahun 2006 Setelah Reboot. Sembilan Juta Telepon Terpengaruh.

Seorang insinyur di Melbourne menghidupkan kembali sasis pewaktu pada pukul 02.50 pagi, dan saat sarapan jaringan seluler terbesar di Australia setuju bahwa saat itu adalah November 2006.

Seorang insinyur di Melbourne menghidupkan kembali sasis pewaktu pada pukul 02.50 pagi, dan saat sarapan jaringan seluler terbesar di Australia setuju bahwa saat itu adalah November 2006. 8 Juli 2026: sebuah kartu GPS di sasis NTP Telstra memulai ulang selama perbaikan catu daya, firmware-nya tidak pernah memiliki pembaruan "GPS week-rollover", jadi ia memilih epoch lama dan kembali 1.024 minggu ke masa lalu. Karena solusi pada Oktober 2025 telah menjadikan kartu tersebut satu-satunya sumber stratum-1 jaringan — dan peralihan pada tahun 2020 ke peering NTP telah menempatkan setiap sumber lain di bawahnya — tanggal yang salah memenangkan suara. Node serah terima direset mulai pukul 04.00 pagi, 45% dari semua panggilan dan sesi data terpengaruh, hampir 9 juta pelanggan kehilangan panggilan, pesan, atau data, 604 panggilan Triple Zero mengalami kesalahan, kereta regional Victoria berhenti, dan sebagian besar layanan kembali pada pukul 12.12 siang. Alarm Telstra sendiri berada di platform yang diperiksa pada jam kerja; perusahaan menyadari karena pelanggan mencari "Telstra outage" di Google.

Baca edisi tertulis (Inggris) ↗

Isi video ini

  • Kartu GPS bangun pada November 2006
  • Garis Waktu: desain 2010 → sasis 2020 → kartu GPS Okt 2025 → 02:50
  • Pagi hari: 04:00 reset MME → 04:20 badai alarm → 12:12 dipulihkan
  • Mekanisme: NTP memilih berdasarkan kesepakatan, bukan plausibilitas
  • git blame — Telstra 55 · peering 25 · firmware 15 · catu daya 5

Transkrip terjemahan

Diterjemahkan dari narasi asli bahasa Inggris. Audio dan teks tersedia yang dikontrol oleh YouTube.

Kartu GPS bangun pada November 2006

0:00 Seorang insinyur di Melbourne menghidupkan kembali sasis pewaktu pada pukul dua lewat lima puluh pagi, dan saat sarapan jaringan seluler terbesar di Australia setuju bahwa saat itu adalah November dua ribu enam. Laporan eksternal Telstra mengatakan tanggal yang salah berasal dari satu kartu GPS dan seluruh jaringan memilihnya. Hampir sembilan juta pelanggan kehilangan panggilan, pesan, atau data, dan kereta regional Victoria berhenti beroperasi sepanjang hari. Bagaimana itu terjadi, mengapa satu kartu mengungguli jam nasional,

0:23 dan siapa yang harus disalahkan. Ini The Daily Diff, postmortem.

Garis Waktu: desain 2010 → sasis 2020 → kartu GPS Okt 2025 → 02:50

0:28 Dua ribu sepuluh. Desainnya sesuai buku panduan. Tiga sumber waktu nasional memberi makan dua server, yang kemudian memberi makan tiga di bawahnya, dan setiap node mengambil waktu hanya dari atas. Auditor menyebutnya sesuai tujuan. Dua ribu dua puluh. Sasis baru. Sasis tersebut tidak dapat memberi makan server bawahnya sendiri, jadi Sydney dan Melbourne terhubung silang dan setiap situs hanya memiliki satu referensi. Kemudian semuanya dialihkan ke peering, di mana server mana pun dapat mengambil waktu dari server mana pun

0:50 yang ditemukannya. Kata-kata "timing loop" tidak muncul dalam dokumen apa pun. Oktober dua ribu dua puluh lima. Melbourne terus kehilangan Sydney, dan alarmnya menunjukkan stratum lima, artinya ia mengambil waktu dari pelanggannya sendiri. Tidak ada yang membuat tiket. Sebagai gantinya, para insinyur mengaktifkan kartu GPS yang telah tidak digunakan selama lima tahun. Alarm berhenti.

1:07 Melbourne sekarang menjadi stratum satu, peringkat lembaga nasional, dan tidak ada yang meninjaunya. Delapan Juli, pukul dua lewat lima puluh pagi. Catu daya perlu diganti, sehingga sasis memulai ulang, dan kartu GPS ikut serta. Firmware-nya tidak pernah diperbarui, sehingga ia memilih epoch lama dan kembali seribu dua puluh empat minggu ke masa lalu. Melbourne adalah yang teratas, dan yang di bawah mulai menyetujuinya.

Pagi hari: 04:00 reset MME → 04:20 badai alarm → 12:12 dipulihkan

1:26 Pukul empat pagi, node serah terima mulai melakukan reset. Pukul empat lewat dua puluh, badai alarm, di platform yang alarmnya dibaca pada jam kerja. Pukul empat lewat dua puluh sembilan, Telstra menyadarinya, karena pelanggan mencari di Google "Telstra outage". Para insinyur yang melakukan perubahan sedang dalam istirahat wajib, dan menemukan tanggal yang benar membutuhkan waktu berjam-jam. Pukul dua belas lewat dua belas sebagian besar pelanggan sudah kembali.

Mekanisme: NTP memilih berdasarkan kesepakatan, bukan plausibilitas

1:47 Mengapa ini bisa terjadi? NTP memiliki dua pertahanan. Stratum lebih rendah menang, dan outlier dikeluarkan melalui pemungutan suara. Kartu GPS membuat sumber yang rusak menjadi peringkat tertinggi, dan setiap sumber yang bisa tidak setuju berada di bawahnya, mengulanginya. NTP tidak pernah bertanya apakah suatu tanggal masuk akal, hanya apakah yang lain setuju. Protokol berfungsi.

2:06 Arsitektur tidak berfungsi.

git blame — Telstra 55 · peering 25 · firmware 15 · catu daya 5

2:07 git blame. Telstra, lima puluh lima persen. Tidak ada yang memiliki jam, jadi tidak ada yang meninjau perubahan, dan dua buletin vendor tentang bug yang persis sama tidak terbaca. Mode peering, dua puluh lima, karena membiarkan server memilih dengan gema mereka sendiri. Firmware, lima belas, dipublikasikan dan tidak pernah diinstal. Lima persen untuk catu daya, karena memilih pukul dua lewat lima puluh pagi pada hari Rabu. Jangkauan dampak. Empat puluh lima persen dari semua panggilan dan sesi data hari itu,

Jangkauan dampak: 45% sesi, denda $30 juta untuk kotak $30 ribu

2:30 kata CEO kepada Senat. Denda yang dikenakan adalah tiga puluh juta dolar, untuk pembaruan gratis yang hilang dari kotak seharga tiga puluh ribu dolar. Kartu tersebut telah bertahan dari "rollover" yang sebenarnya pada tahun dua ribu sembilan belas karena tidak ada yang mematikannya, Perbaikanlah yang mematikannya. Putusan, postmortem: SHIP IT, pada responsnya.

Putusan + pernyataan Senin: satu jam yang memiliki tiga fungsi

2:46 Telstra menyewa auditor eksternal, mempublikasikan laporan tanpa diedit, dengan pernyataan bahwa mereka tidak pernah memperlakukan waktu sebagai kritis, dan memindahkan ketiga situs dari server lama sebelum itu terjadi. Pernyataan Senin: jalankan pelacakan NTP dan hitung berapa banyak sumber waktu Anda yang merupakan satu jam yang memiliki tiga fungsi. Kirimkan insiden yang masih belum boleh Anda bicarakan, di kolom komentar, atau di thedailydiff.dev. Dan itulah perbedaan untuk hari ini.

3:10 Saya Niko dari Axrisi. Gabungkan dengan bertanggung jawab.

Sumber

  1. Technology Audit Partners, "Findings Report on the July 8th Telstra Outage" (published by Telstra, Sep 2, 2026)www.telstra.com.au
  2. Vicki Brady (Telstra CEO), "What we've learned from the external investigation of our July outage" (Sep 2, 2026)www.telstra.com.au
  3. Netnod, Sven-Christian Ebenhag, "Telstra outage: The night a network decided the year was 2006" (Sep 17, 2026)www.netnod.se
  4. Hacker News on the Netnod post (93 points)news.ycombinator.com
  5. The Guardian, Senate inquiry: 45 % of sessions, ~9M customers, 604 Triple Zero errors (Jul 17, 2026)www.theguardian.com
  6. ABC News, "Telstra recently warned about timing issue linked to national outage" (Jul 10, 2026)www.abc.net.au
  7. The Register, the day itself (Jul 8, 2026)www.theregister.com
  8. ACS Information Age, the $30,000 box and the $30M fine (Jul 14, 2026)ia.acs.org.au

Video terkait