Google Cloud havaroval na prázdném poli. Tři hodiny.
Řádek zásad s několika prázdnými poli narazí na nulový ukazatel a Google Cloud havaruje ve všech regionech najednou – a s ním padne i Cloudflare.
Řádek zásad s několika prázdnými poli narazí na nulový ukazatel a Google Cloud havaruje ve všech regionech najednou – a s ním padne i Cloudflare. 12. června 2025, 17:49 UTC: Service Control, binární soubor, který schvaluje každý požadavek Google Cloud API, přečte změnu kvóty s „nezamýšlenými prázdnými poli“, narazí na kódovou cestu nasazenou o dva týdny dříve bez kontroly nul a bez příznaku funkce a přejde do cyklu pádu ve všech regionech – řádek se replikoval globálně během několika sekund. Externí rozhraní API vrací po dobu tří hodin chybu 503; us-central1 trvá 2 hodiny 40 minut, protože restartující se úkoly se hrnou na stejnou tabulku Spanner bez randomizovaného zpoždění. Tři minuty po výpadku Google ztrácí Workers KV od Cloudflare – jehož zdroj pravdy sídlí u „poskytovatele cloudových služeb třetí strany“ – 90 % požadavků a Access, WARP, Workers AI, Pages, Stream a Turnstile s ním padají na 2 hodiny 28 minut. Stavová stránka Google zveřejní svou první aktualizaci o hodinu později, protože běží na Google Cloud.
Přečtěte si psané vydání (anglicky) ↗
Co toto video pokrývá
- Prázdné pole, nulový ukazatel, každý region
- Časová osa: 29. května → 17:45 → cyklus pádu → červené tlačítko → 17:52 Cloudflare
- us-central1: efekt stáda
- Mechanismus: kontrola v cestě požadavku, globální replikace, jeden dodavatel
- git blame — rozdělení
Přeložený přepis
Přeloženo z původního anglického vyprávění. Dostupné audio a titulky jsou řízeny YouTube.
Prázdné pole, nulový ukazatel, každý region
0:00 Řádek zásad s prázdnými poli narazí na nulový ukazatel a Google Cloud havaruje v každém regionu najednou — a s ním padne i Cloudflare, pak nazývá Google „poskytovatelem třetí strany“. 12. června 2025, 17:49 UTC. Zpráva Google: Service Control, binární soubor, který schvaluje každý požadavek API, v cyklu pádu po dobu tří hodin. Cloudflare, tentýž večer: Workers KV, devadesát procent selhalo, dvě hodiny dvacet osm.
0:23 Jak se to stalo, proč jedno prázdné pole šlo globálně za sekundy, a kdo nese vinu. Toto je The Daily Diff, posmrtná analýza. 29. května. Service Control získá novou kontrolu kvót, dodávanou region po regionu s
Časová osa: 29. května → 17:45 → cyklus pádu → červené tlačítko → 17:52 Cloudflare
0:35 červeným tlačítkem — ale nová cesta kódu se nikdy nespustí během nasazení; nic to zatím nespouští. Žádná kontrola nul. Žádný příznak funkce. 17:45. Změna zásad s prázdnými poli se objeví v tabulce Spanner. Kvóta je globální, takže se řádek replikuje všude během několika sekund. Každý binární soubor Service Control ho přečte, narazí na nulový ukazatel, spadne, restartuje se, přečte ho znovu. Každé volání API: 503.
0:55 Google je rychlý: třídění za dvě minuty, hlavní příčina za deset. Červené tlačítko je venku za čtyřicet, a malé regiony se zotaví první. Stavová stránka zveřejní svou první aktualizaci po hodině, protože běží na Google Cloud. 17:52. Tým WARP od Cloudflare vidí, že se nová zařízení neregistrují. Workers KV, úložiště, které polovina Cloudflare používá pro konfiguraci a identitu, žije na cloudu třetí strany. Access selže při každém přihlášení — záměrně selže uzavřeně.
1:20 Workers AI selže při každé inferenci. 19:11, Gergely Orosz: dva nezávislé cloudy najednou mimo provoz, ještě nikdy neviděno. 19:32, podpora Google říká uživateli, že nejsou známy žádné poruchy — zkuste vymazat soubory cookie. Všude jinde se zotaví do 19:48.
us-central1: efekt stáda
1:34 us-central1 ne: restartující se úkoly se hrnou na stejnou tabulku Spanner, žádné randomizované zpoždění, takže je Google ručně škrtí. Dvě hodiny čtyřicet. Jedno: kontrola zásad se nachází uvnitř cesty požadavku; když kontrola zemře,
Mechanismus: kontrola v cestě požadavku, globální replikace, jeden dodavatel
1:46 API zemře. Dvě: data kvót jdou globálně bez stagování; špatný řádek je globální řádek. Tři: Cloudflare věděl. Workers KV bylo uprostřed migrace na vlastní R2, na jednoho poskytovatele — posmrtná analýza to nazývá mezerou v pokrytí.
git blame — rozdělení
2:00 git blame. Google, padesát pět procent: žádná kontrola nul, žádný příznak funkce, žádné zpoždění — jejich zpráva říká, že příznak by to zachytil ve stagování. Globální replikace, dvacet: jeden řádek, každý region, sekundy. Cloudflare, dvacet: polovina produktové řady na úložišti jednoho dodavatele, a posmrtná analýza, která nikdy neřekne Google. Stavová stránka, pět, za to, že žije na tom, o čem informuje. Poloměr dopadu: sedmdesát produktů Google Cloud, deset aplikací Workspace,
Poloměr dopadu
2:23 každý region. Tři hodiny. Na Cloudflare: Access, WARP, Workers AI, Pages, Stream — dvě a půl. Hacker News, čtrnáct set bodů; top komentář: stavová stránka je zelená.
Verdikt + pondělní řada
2:33 Verdikt, posmrtná analýza: SHIP IT. Obě posmrtné analýzy dorazí do třiceti hodin, obě se obviňují, a opravy Google jsou konkrétní: selhání otevření, příznaky ve výchozím nastavení vypnuté, exponenciální zpoždění. Pondělní řada: nový kód za příznakem, který je vypnutý, a kontrola nul tam, kde data přicházejí. Pošlete mi incident, o kterém stále nesmíte mluvit, do komentářů, nebo na the daily diff dot dev. A to je the diff pro dnešek.
2:53 Jsem Niko z Axrisi. SLOUČIT ZODPOVĚDNĚ.
Zdroje
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



