Google Cloud зваліўся на пустым полі. Тры гадзіны.
Радок палітыкі з некалькімі пустымі палямі трапляе ў нулявы паказальнік, і Google Cloud адначасова выходзіць з ладу ва ўсіх рэгіёнах — затым Cloudflare падае разам з ім.
Радок палітыкі з некалькімі пустымі палямі трапляе ў нулявы паказальнік, і Google Cloud адначасова выходзіць з ладу ва ўсіх рэгіёнах — затым Cloudflare падае разам з ім. 12 чэрвеня 2025 г., 17:49 UTC: Service Control, бінарны файл, які ўхваляе кожны запыт Google Cloud API, счытвае змяненне квотнай палітыкі з «ненаўмыснымі пустымі палямі», трапляе ў шлях кода, які быў адпраўлены двума тыднямі раней без праверкі на нуль і без флага функцыі, і пераходзіць у цыкл збою ва ўсіх рэгіёнах — радок быў рэплікаваны глабальна за лічаныя секунды. Знешнія API вяртаюць 503 на працягу трох гадзін; us-central1 займае 2 гадз. 40 хвіл., таму што перазапускаючыя задачы навальваюцца на тую ж табліцу Spanner без рандомізаванага адкату. Праз тры хвіліны пасля збою Google, Workers KV ад Cloudflare — чыя крыніца ісціны знаходзіцца на «староннім воблачным правайдэры» — губляе 90 % запытаў, а Access, WARP, Workers AI, Pages, Stream і Turnstile выходзяць з ладу разам з ім на 2 гадз. 28 хвіл. Старонка стану Google публікуе сваё першае абнаўленне з гадзінным спазненнем, таму што яна працуе на Google Cloud.
Чытаць пісьмовае выданне (англійская) ↗
Што ахоплівае гэта відэа
- Пустое поле, нулявы паказальнік, кожны рэгіён
- Храналогія: 29 мая → 17:45 → цыкл збою → чырвоная кнопка → 17:52 Cloudflare
- us-central1: эфект статка
- Механізм: праверка ў шляху запыту, глабальная рэплікацыя, адзін пастаўшчык
- git blame — падзел
Перакладзеная стэнаграма
Перакладзена з арыгінальнай англійскай агучкі. Даступнае аўдыя і субтытры кантралююцца YouTube.
Пустое поле, нулявы паказальнік, кожны рэгіён
0:00 Радок палітыкі з пустымі палямі трапляе ў нулявы паказальнік, і Google Cloud выходзіць з ладу ў кожным рэгіёне адразу — і Cloudflare падае разам з ім, затым называе Google «староннім пастаўшчыком». 12 чэрвеня 2025 г., 17:49 UTC. Справаздача Google: Service Control, бінарны файл, які ўхваляе кожны запыт API, у цыкле збою на працягу трох гадзін. Cloudflare, у той жа вечар: Workers KV, дзевяноста працэнтаў няспраўнасцяў, дзве гадзіны дваццаць восем.
0:23 Як гэта адбылося, чаму адно пустое поле стала глабальным за лічаныя секунды, і хто нясе адказнасць. Гэта The Daily Diff, пасмяротны аналіз. 29 мая. Service Control атрымлівае новую праверку квоты, адпраўленую рэгіён за рэгіёнам з
Храналогія: 29 мая → 17:45 → цыкл збою → чырвоная кнопка → 17:52 Cloudflare
0:35 чырвонай кнопкай — але новы шлях кода ніколі не выконваецца падчас разгортвання; нічога не запускае яго яшчэ. Без праверкі на нуль. Без флага функцыі. 17:45. Змяненне палітыкі з пустымі палямі трапляе ў табліцу Spanner. Квота глабальная, таму радок рэплікуецца ўсюды за лічаныя секунды. Кожны бінарны файл Service Control счытвае яго, трапляе ў нулявы паказальнік, зрываецца, перазапускаецца, зноў счытвае яго. Кожны выклік API: 503.
0:55 Google хуткі: сартаванне за дзве хвіліны, асноўная прычына за дзесяць. Чырвоная кнопка выключана праз сорак хвілін, і невялікія рэгіёны аднаўляюцца першымі. Старонка стану публікуе сваё першае абнаўленне праз гадзіну, таму што яна працуе на Google Cloud. 17:52. Каманда WARP Cloudflare бачыць, што новыя прылады не рэгіструюцца. Workers KV, сховішча, якое выкарыстоўвае палова Cloudflare для канфігурацыі і ідэнтыфікацыі, знаходзіцца ў староннім воблаку. Access не праходзіць кожны ўваход — па задумцы, ён не праходзіць пры закрыцці.
1:20 Workers AI не праходзіць кожны вывад. 19:11, Гергелі Орас: два незалежныя воблакі адначасова не працуюць, ніколі раней не бачылі. 19:32, падтрымка Google паведамляе карыстальніку, што вядомых збояў няма — паспрабуйце ачысціць файлы cookie. Усюды аднаўляецца да 19:48.
us-central1: эфект статка
1:34 us-central1 не аднаўляецца: перазапускаючыя задачы навальваюцца на тую ж табліцу Spanner, без рандомізаванага адкату, таму Google уручную рэгулюе іх. Дзве гадзіны сорак. Першае: праверка палітыкі знаходзіцца ў шляху запыту; калі праверка памірае,
Механізм: праверка ў шляху запыту, глабальная рэплікацыя, адзін пастаўшчык
1:46 API памірае. Другое: дадзеныя квот становяцца глабальнымі без стэйджынгу; дрэнны радок — гэта глабальны радок. Трэцяе: Cloudflare ведаў. Workers KV быў у сярэдзіне міграцыі на ўласны R2, да аднаго правайдэра — пасмяротны аналіз называе гэта прабелам у пакрыцці.
git blame — падзел
2:00 git blame. Google, пяцьдзесят пяць працэнтаў: без праверкі на нуль, без флага функцыі, без адкату — іх справаздача кажа, што флаг злавіў бы гэта на стэйджынгу. Глабальная рэплікацыя, дваццаць: адзін радок, кожны рэгіён, секунды. Cloudflare, дваццаць: палова лінейкі прадуктаў у сховішчы аднаго пастаўшчыка, і пасмяротны аналіз, які ніколі не называе Google. Старонка стану, пяць, за жыццё на тым, пра што яна паведамляе. Радыус паражэння: семдзесят прадуктаў Google Cloud, дзесяць прыкладанняў Workspace,
Радыус паражэння
2:23 кожны рэгіён. Тры гадзіны. У Cloudflare: Access, WARP, Workers AI, Pages, Stream — дзве з паловай. Hacker News, чатырнаццацьсот балаў; галоўны каментарый: старонка стану зялёная.
Вердыкт + лінія панядзелка
2:33 Вердыкт, пасмяротны аналіз: SHIP IT. Абодва пасмяротных аналізу з'явіліся на працягу трыццаці гадзін, абодва вінавацяць сябе, і выпраўленні Google канкрэтныя: адкрыты збой, флагі па змаўчанні выключаны, экспаненцыяльны адкат. Лінія панядзелка: новы код за флагам, які адключаецца, і праверка на нуль, дзе прыходзяць дадзеныя. Дасылайце мне інцыдэнт, пра які вам усё яшчэ не дазволена гаварыць, у каментарах, або на the daily diff dot dev. І гэта diff на сёння.
2:53 Я Ніка з Axrisi. Merge responsibly.
Крыніцы
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



