+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Un bug di un millisecondo ha fermato il traffico aereo del Regno Unito. Sei ore.

Alle 10:00 di martedì 8 settembre, una richiesta di codice squawk di routine all'interno del National Airspace System (NAS) di NATS viene interrotta da un messaggio a priorità più alta mentre sta aggiornando un valore.

Alle 10:00 di martedì 8 settembre, una richiesta di codice squawk di routine all'interno del National Airspace System (NAS) di NATS viene interrotta da un messaggio a priorità più alta mentre sta aggiornando un valore. La finestra di esposizione è di circa un millisecondo. La richiesta riprende in modo errato, i dati di volo risultano corrotti e alle 19:30 più di 2.000 voli nel Regno Unito sono stati ritardati, cancellati o dirottati.

Leggi l'edizione scritta (inglese) ↗

Contenuto di questo video

  • 10:00: una richiesta, interrotta all'interno di una finestra di 1 ms
  • Cronologia: 10:00 squawk → 10:02 blip → 12:45 stop partenze → 13:32 link perso
  • La soluzione: riavviare i dati di volo di tutto il paese
  • Meccanismo: in pausa a metà di una scrittura
  • Perché una funzione di sicurezza ha bloccato il cielo

Trascrizione tradotta

Tradotto dalla narrazione originale inglese. L'audio e i sottotitoli disponibili sono controllati da YouTube.

10:00: una richiesta, interrotta all'interno di una finestra di 1 ms

0:00 Alle dieci del mattino, una richiesta di routine all'interno del sistema di dati di volo britannico viene interrotta esattamente nel millisecondo sbagliato, e entro sera più di duemila voli sono in ritardo, cancellati o dirottati. Questo è quanto emerge dal rapporto preliminare di Nats, il servizio di controllo del traffico aereo del Regno Unito. Nessun segno di attacco, e nessuno ha premuto il pulsante sbagliato. Solo un difetto ereditato, e un millisecondo molto specifico. Come è successo, perché un millisecondo è stato sufficiente, e chi è effettivamente il responsabile. Questo è The Daily Diff, postmortem.

0:31 Dieci in punto. Qualcuno chiede manualmente un codice squawk, il numero a quattro cifre che

Cronologia: 10:00 squawk → 10:02 blip → 12:45 stop partenze → 13:32 link perso

0:36 lega un segnale radar al suo piano di volo. La richiesta è valida, così come il piano. Dieci e due. Il collegamento tra il Controllo dell'Area di Londra e il sistema centrale si interrompe, poi torna da solo dopo quarantacinque secondi. Il ticket dice recuperato, stabile, nessun impatto operativo. Dodici e trentadue. Il collegamento inizia a interrompersi di nuovo, più velocemente ogni volta, e i controllori perdono parte dell'automazione.

0:56 Entro le dodici e quarantacinque, le partenze dal Regno Unito sono bloccate. All'una e trentadue, il collegamento si interrompe e rimane inattivo. La soluzione è un riavvio controllato, e questa è la parte costosa,

La soluzione: riavviare i dati di volo di tutto il paese

1:06 perché lo stesso sistema alimenta i centri di controllo e gli aeroporti di tutto il paese. Il bug vive nello spazio aereo di Londra. Le restrizioni coprono tutto il Regno Unito. Il riavvio va dalle tre e un quarto alle quattro e dieci, e lo sbroglio dei piani di volo duplicati richiede fino alle sette meno dieci. Quindi perché un millisecondo è stato sufficiente?

Meccanismo: in pausa a metà di una scrittura

1:23 Il sistema gestisce i lavori per priorità, e mettere in pausa un piccolo lavoro per uno urgente è normale. Ma questo lavoro stava aggiornando un valore. Il messaggio urgente arriva all'interno di quel millisecondo, e l'aggiornamento si ferma a metà. Quando riprende, non riprende correttamente. I dati errati si diffondono quindi in alcuni degli aggiornamenti di volo successivi.

Perché una funzione di sicurezza ha bloccato il cielo

1:40 Londra cerca di leggerne uno, impiega troppo tempo e va in timeout. Un timeout interrompe il collegamento, come previsto, per proteggere entrambi i sistemi. La funzione di sicurezza funziona perfettamente. Questo è il problema. Le parole del rapporto. Se il messaggio urgente fosse arrivato un millisecondo prima o dopo, l'aggiornamento si sarebbe completato normalmente. Su Hacker News, un programmatore chiama un millisecondo un'eternità assoluta,

2:02 garantita che accadrà entro martedì di questa settimana. Era un martedì.

git blame — codice legacy 50 · piano di riavvio 30 · l'allarme delle 10:02 15 · 1 ms 5

2:05 git blame. Il codice legacy, cinquanta percento, per un aggiornamento che può essere messo in pausa a metà e torna errato. Il piano di riavvio, trenta, perché un record errato a Londra significa riavviare i dati di volo di tutto il paese. L'allarme delle dieci e due, quindici, per essersi riparato da solo ed essere stato archiviato come senza impatto. Cinque percento al millisecondo, per la sua tempistica. Raggio d'azione. Nats aveva previsto circa ottomila voli quel giorno e ne ha gestiti

Raggio d'azione: 8.000 previsti, 6.094 gestiti, terzo fallimento in tre anni

2:27 circa seimila. Le partenze dal Regno Unito si sono fermate per circa quattro ore e mezza, e l'arretrato ha richiesto oltre due giorni per essere smaltito. È il terzo fallimento del traffico aereo britannico in tre anni, e l'amministratore delegato definisce questo bug molto, molto oscuro.

Verdetto + la linea di lunedì: scritture atomiche, allarmi sonori

2:41 Verdetto, postmortem: NEEDS REVIEW. Il rapporto è rapido e specifico, e la correzione è scritta e in fase di test. Ma il piano è un riavvio più veloce, non uno più piccolo. Linea del lunedì: se un lavoro può essere messo in pausa, rendi la sua scrittura atomica, e tratta un allarme che si ripara da solo come un allarme. Inviatemi l'incidente di cui non vi è ancora permesso parlare, nei commenti, o a thedailydiff.dev. E questo è il diff per oggi.

3:02 Sono Niko di Axrisi. Merge responsibly.

Fonti

  1. NATS, Major Incident Preliminary Investigation Report, NAS incident 08 September 2026 (report date Sep 16)www.nats.aero
  2. NATS press release, "NATS publishes preliminary report on technical incident of 8 September" (Sep 18, 2026)www.nats.aero
  3. NATS on X, 8 Sepx.com
  4. BBC, "Flight chaos caused by 'millisecond' software defect, report says"www.bbc.co.uk
  5. The Guardian (Sep 18, 2026)www.theguardian.com
  6. Hacker News thread on the reportnews.ycombinator.com

Video correlati