Google Cloud stürzt bei einem leeren Feld ab. Drei Stunden.
Eine Richtlinienzeile mit einigen leeren Feldern stößt auf einen Nullzeiger, und Google Cloud stürzt in jeder Region gleichzeitig ab – dann fällt Cloudflare mit.
Eine Richtlinienzeile mit einigen leeren Feldern stößt auf einen Nullzeiger, und Google Cloud stürzt in jeder Region gleichzeitig ab – dann fällt Cloudflare mit. 12. Juni 2025, 17:49 UTC: Service Control, die Binärdatei, die jede Google Cloud API-Anfrage genehmigt, liest eine Quotenrichtlinienänderung mit „unbeabsichtigten leeren Feldern“, stößt auf einen zwei Wochen zuvor ohne Nullprüfung und ohne Feature-Flag ausgelieferten Code-Pfad und gerät in jeder Region in eine Absturzschleife – die Zeile hatte sich innerhalb von Sekunden global repliziert. Externe APIs geben drei Stunden lang 503 zurück; us-central1 benötigt 2 Stunden und 40 Minuten, da die neu startenden Aufgaben dieselbe Spanner-Tabelle ohne randomisierte exponentielle Rückzugsstrategie überfluten. Drei Minuten nach dem Ausfall von Google verliert Cloudflare's Workers KV – dessen Wahrheitsquelle bei „einem Drittanbieter für Cloud-Dienste“ liegt – 90 % der Anfragen, und Access, WARP, Workers AI, Pages, Stream und Turnstile fallen damit für 2 Stunden und 28 Minuten aus. Die Statusseite von Google veröffentlicht ihr erstes Update eine Stunde zu spät, weil sie auf Google Cloud läuft.
Die schriftliche Ausgabe lesen (Englisch) ↗
Was dieses Video behandelt
- Ein leeres Feld, ein Nullzeiger, jede Region
- Zeitachse: 29. Mai → 17:45 → Absturzschleife → roter Knopf → 17:52 Cloudflare
- us-central1: der Herden-Effekt
- Mechanismus: Prüfung im Anforderungspfad, globale Replikation, ein Anbieter
- git blame — die Trennung
Übersetztes Transkript
Aus der englischen Originalerzählung übersetzt. Verfügbare Audio- und Untertitel werden von YouTube gesteuert.
Ein leeres Feld, ein Nullzeiger, jede Region
0:00 Eine Richtlinienzeile mit leeren Feldern trifft auf einen Nullzeiger, und Google Cloud stürzt ab in jeder Region gleichzeitig – und Cloudflare fällt damit, und nennt Google dann „einen Drittanbieter“. 12. Juni 2025, 17:49 UTC. Googles Bericht: Service Control, die Binärdatei, die jede API-Anfrage genehmigt, in einer Absturzschleife für drei Stunden. Cloudflares, am selben Abend: Workers KV, neunzig Prozent fehlerhaft, zwei Stunden achtundzwanzig.
0:23 Wie es geschah, warum ein leeres Feld in Sekunden global wurde, und wer die Schuld trägt. Dies ist The Daily Diff, Postmortem. 29. Mai. Service Control erhält eine neue Quotenprüfung, die Region für Region mit einem
Zeitachse: 29. Mai → 17:45 → Absturzschleife → roter Knopf → 17:52 Cloudflare
0:35 roten Knopf ausgeliefert wird – aber der neue Code-Pfad wird während des Rollouts nie ausgeführt; nichts löst ihn noch aus. Keine Nullprüfung. Kein Feature-Flag. 17:45. Eine Richtlinienänderung mit leeren Feldern landet in der Spanner-Tabelle. Die Quote ist global, daher repliziert sich die Zeile innerhalb von Sekunden überall. Jede Service Control-Binärdatei liest sie, trifft auf den Nullzeiger, stürzt ab, startet neu, liest sie erneut. Jeder API-Aufruf: 503.
0:55 Google ist schnell: Triage in zwei Minuten, Grundursache in zehn. Der rote Knopf ist in vierzig Minuten draußen, und kleinere Regionen erholen sich zuerst. Die Statusseite veröffentlicht ihr erstes Update nach einer Stunde, weil sie auf Google Cloud läuft. 17:52. Cloudflares WARP-Team stellt fest, dass neue Geräte sich nicht registrieren können. Workers KV, der Speicher, den die Hälfte von Cloudflare für Konfiguration und Identität verwendet, läuft auf einer Drittanbieter-Cloud. Access schlägt bei jeder Anmeldung fehl – absichtlich, es schlägt geschlossen fehl.
1:20 Workers AI schlägt bei jeder Inferenz fehl. 19:11, Gergely Orosz: zwei unabhängige Clouds gleichzeitig ausgefallen, noch nie zuvor gesehen. 19:32, der Google-Support teilt einem Nutzer mit, dass es keine bekannten Störungen gibt – versuchen Sie, Ihre Cookies zu löschen. Überall sonst ist die Wiederherstellung bis 19:48 abgeschlossen.
us-central1: der Herden-Effekt
1:34 us-central1 nicht: neu startende Aufgaben überfluten dieselbe Spanner-Tabelle, kein randomisierter Backoff, daher drosselt Google sie manuell. Zwei Stunden vierzig. Eins: Die Richtlinienprüfung befindet sich im Anforderungspfad; wenn die Prüfung stirbt,
Mechanismus: Prüfung im Anforderungspfad, globale Replikation, ein Anbieter
1:46 stirbt die API. Zwei: Kontingentdaten gehen global ohne Staging; eine fehlerhafte Zeile ist eine globale Zeile. Drei: Cloudflare wusste Bescheid. Workers KV war mitten in der Migration zu eigenem R2, reduziert auf einen Anbieter – das Postmortem nennt es eine Deckungslücke.
git blame — die Trennung
2:00 git blame. Google, fünfundfünfzig Prozent: keine Nullprüfung, kein Feature-Flag, kein Backoff – ihr Bericht besagt, dass ein Flag es im Staging abgefangen hätte. Globale Replikation, zwanzig: eine Zeile, jede Region, Sekunden. Cloudflare, zwanzig: die Hälfte einer Produktlinie auf dem Speicher eines Anbieters, und ein Postmortem, das Google nie nennt. Die Statusseite, fünf, weil sie auf dem läuft, worüber sie berichtet. Einflussbereich: siebzig Google Cloud-Produkte, zehn Workspace-Anwendungen,
Einflussbereich
2:23 jede Region. Drei Stunden. Bei Cloudflare: Access, WARP, Workers AI, Pages, Stream – zweieinhalb. Hacker News, vierzehnhundert Punkte; Top-Kommentar: Die Statusseite ist grün.
Urteil + die Montagslinie
2:33 Urteil, Postmortem: SHIP IT. Beide Postmortems erscheinen innerhalb von dreißig Stunden, beide geben sich selbst die Schuld, und Googles Korrekturen sind konkret: fail open, Flags standardmäßig aus, exponentieller Backoff. Die Montagslinie: neuer Code hinter einem Flag, das abgeschaltet wird, und eine Nullprüfung, wo die Daten ankommen. Senden Sie mir den Vorfall, über den Sie immer noch nicht sprechen dürfen, in den Kommentaren oder unter the daily diff dot dev. Und das ist der Diff für heute.
2:53 Ich bin Niko von Axrisi. Merge responsibly.
Quellen
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



