Google Cloud gik ned på et blankt felt. Tre timer.
En politikrække med et par tomme felter rammer en null-pointer, og Google Cloud går ned i alle regioner på én gang – hvorefter Cloudflare følger med.
En politikrække med et par tomme felter rammer en null-pointer, og Google Cloud går ned i alle regioner på én gang – hvorefter Cloudflare følger med. 12. juni 2025, 17:49 UTC: Service Control, den binære fil, der godkender hver Google Cloud API-anmodning, læser en ændring i kvotapolitikken med "utilsigtede tomme felter", rammer en kodesti, der blev sendt to uger tidligere uden null-tjek og uden funktionsflag, og går ind i en nedbrudssløjfe i hver region – rækken var replikeret globalt inden for få sekunder. Eksterne API'er returnerer 503 i tre timer; us-central1 tager 2 timer og 40 minutter, fordi de genstartende opgaver maser den samme Spanner-tabel uden randomiseret backoff. Tre minutter inde i Googles nedbrud mister Cloudflare's Workers KV – hvis sandhedskilde sidder på "en tredjeparts cloud-udbyder" – 90 % af anmodningerne, og Access, WARP, Workers AI, Pages, Stream og Turnstile går ned med det i 2 timer og 28 minutter. Googles statussside poster sin første opdatering en time for sent, fordi den kører på Google Cloud.
Læs den skriftlige udgave (engelsk) ↗
Hvad denne video dækker
- Et tomt felt, en null-pointer, alle regioner
- Tidslinje: 29. maj → 17:45 → nedbrudssløjfe → rød knap → 17:52 Cloudflare
- us-central1: flok-effekten
- Mekanisme: tjek i anmodningssti, global replikering, én leverandør
- git blame — opdelingen
Oversat udskrift
Oversat fra den originale engelske fortælling. Tilgængelig lyd og undertekster styres af YouTube.
Et tomt felt, en null-pointer, alle regioner
0:00 En politikrække med tomme felter rammer en null-pointer, og Google Cloud går ned i alle regioner på én gang — og Cloudflare følger med, kalder derefter Google "en tredjepartsudbyder". 12. juni 2025, 17:49 UTC. Googles rapport: Service Control, den binære fil, der godkender hver API-anmodning, i en nedbrudssløjfe i tre timer. Cloudflares, samme aften: Workers KV, halvfems procent fejler, to timer otteogtyve.
0:23 Hvordan det skete, hvorfor ét tomt felt blev globalt på få sekunder, og hvem der får skylden. Dette er The Daily Diff, postmortem. 29. maj. Service Control får et nyt kvotatjek, afsendt region for region med en
Tidslinje: 29. maj → 17:45 → nedbrudssløjfe → rød knap → 17:52 Cloudflare
0:35 rød knap — men den nye kodesti kører aldrig under udrulning; intet udløser det endnu. Intet null-tjek. Intet funktionsflag. 17:45. En politikændring med tomme felter lander i Spanner-tabellen. Kvote er global, så rækken replikeres overalt inden for få sekunder. Hver Service Control-binær læser den, rammer null-pointeren, går ned, genstarter, læser den igen. Hvert API-kald: 503.
0:55 Google er hurtig: triage på to minutter, årsag på ti. Den røde knap er ude på fyrre, og små regioner genopretter sig først. Statussiden poster sin første opdatering en time inde, fordi den kører på Google Cloud. 17:52. Cloudflares WARP-team ser nye enheder mislykkes med at registrere. Workers KV, den butikshalvdel Cloudflare bruger til konfiguration og identitet, lever på en tredjeparts cloud. Access fejler hvert login — efter design fejler den lukket.
1:20 Workers AI fejler hver inferens. 19:11, Gergely Orosz: to uafhængige clouds nede på én gang, aldrig set før. 19:32, Google support fortæller en bruger, at der ikke er kendte forstyrrelser — prøv at rydde dine cookies. Alle andre genopretter sig inden 19:48.
us-central1: flok-effekten
1:34 us-central1 gør ikke: genstartende opgaver maser den samme Spanner-tabel, ingen randomiseret backoff, så Google begrænser dem manuelt. To timer fyrre. Ét: politikktjekket sidder inde i anmodningsstien; når tjekket dør,
Mekanisme: tjek i anmodningssti, global replikering, én leverandør
1:46 dør API'en. To: kvotedata bliver globale uden staging; en dårlig række er en global række. Tre: Cloudflare vidste det. Workers KV var midt i en migration til sin egen R2, ned til én udbyder — postmortem kalder det et hul i dækningen.
git blame — opdelingen
2:00 git blame. Google, femoghalvtreds procent: intet null-tjek, intet feature-flag, ingen backoff — deres rapport siger, at et flag ville have fanget det i staging. Global replikering, tyve: én række, hver region, sekunder. Cloudflare, tyve: halvdelen af en produktlinje på én leverandørs butik, og en postmortem, der aldrig siger Google. Statussiden, fem, for at leve på det, den rapporterer om. Eksplosionsradius: halvfjerds Google Cloud-produkter, ti Workspace-apps,
Eksplosionsradius
2:23 hver region. Tre timer. Hos Cloudflare: Access, WARP, Workers AI, Pages, Stream — to og en halv. Hacker News, fjorten hundrede point; topkommentar: statussiden er grøn.
Dom + mandagslinjen
2:33 Dom, postmortem: SHIP IT. Begge postmortems lander inden for tredive timer, begge skyder skylden på sig selv, og Googles rettelser er konkrete: fail open, flag slået fra som standard, eksponentiel backoff. Mandagslinjen: ny kode bag et flag, der sendes fra, og et null-tjek, hvor dataene kommer ind. Send mig den hændelse, du stadig ikke må tale om, i kommentarerne, eller på the daily diff dot dev. Og det er The Daily Diff for i dag.
2:53 Jeg er Niko fra Axrisi. Merge responsibly.
Kilder
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



