Google Cloud travou em um campo em branco. Três horas.
Uma linha de política com alguns campos em branco atinge um ponteiro nulo, e o Google Cloud trava em todas as regiões de uma vez — então o Cloudflare cai junto.
Uma linha de política com alguns campos em branco atinge um ponteiro nulo, e o Google Cloud trava em todas as regiões de uma vez — então o Cloudflare cai junto. 12 de junho de 2025, 17:49 UTC: O Service Control, o binário que aprova cada solicitação de API do Google Cloud, lê uma alteração de política de cota com "campos em branco não intencionais", atinge um caminho de código lançado duas semanas antes sem verificação de nulo e sem sinalizador de recurso, e entra em um loop de falhas em todas as regiões — a linha havia se replicado globalmente em segundos. As APIs externas retornam 503 por três horas; us-central1 leva 2 h 40 min porque as tarefas de reinicialização sobrecarregam a mesma tabela do Spanner sem espera exponencial randomizada. Três minutos após a interrupção do Google, o Workers KV do Cloudflare — cuja fonte de verdade reside em "um provedor de nuvem de terceiros" — perde 90 % das solicitações, e o Access, WARP, Workers AI, Pages, Stream e Turnstile caem junto por 2 h 28 min. A página de status do Google publica sua primeira atualização com uma hora de atraso, porque é executada no Google Cloud.
Leia a edição escrita (Inglês) ↗
O que este vídeo aborda
- Um campo em branco, um ponteiro nulo, todas as regiões
- Cronograma: 29 de maio → 17:45 → loop de falhas → botão vermelho → 17:52 Cloudflare
- us-central1: o efeito manada
- Mecanismo: verificação no caminho da solicitação, replicação global, um fornecedor
- git blame — a divisão
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
Um campo em branco, um ponteiro nulo, todas as regiões
0:00 Uma linha de política com campos em branco atinge um ponteiro nulo, e o Google Cloud trava em todas as regiões de uma vez — e o Cloudflare cai junto, então chama o Google de "um provedor terceirizado". 12 de junho de 2025, 17:49 UTC. Relatório do Google: Service Control, o binário que aprova cada solicitação de API, em um loop de falhas por três horas. Cloudflare, na mesma noite: Workers KV, noventa por cento falhando, duas horas e vinte e oito.
0:23 Como aconteceu, por que um campo em branco se tornou global em segundos, e quem leva a culpa. Este é The Daily Diff, post-mortem. 29 de maio. O Service Control recebe uma nova verificação de cota, lançada região por região com um
Cronograma: 29 de maio → 17:45 → loop de falhas → botão vermelho → 17:52 Cloudflare
0:35 botão vermelho — mas o novo caminho de código nunca é executado durante a implementação; nada o aciona ainda. Nenhuma verificação de nulo. Nenhuma feature flag. 17:45. Uma mudança de política com campos em branco chega à tabela do Spanner. A cota é global, então a linha se replica em todos os lugares em segundos. Cada binário do Service Control a lê, atinge o ponteiro nulo, trava, reinicia, lê novamente. Toda chamada de API: 503.
0:55 O Google é rápido: triagem em dois minutos, causa raiz em dez. O botão vermelho é acionado em quarenta, e as pequenas regiões se recuperam primeiro. A página de status publica sua primeira atualização uma hora depois, porque é executada no Google Cloud. 17:52. A equipe WARP do Cloudflare vê novos dispositivos falharem ao registrar. Workers KV, o armazenamento que metade do Cloudflare usa para configuração e identidade, reside em uma nuvem de terceiros. Access falha em cada login — por design, ele falha fechado.
1:20 Workers AI falha em cada inferência. 19:11, Gergely Orosz: duas nuvens independentes caem ao mesmo tempo, nunca visto antes. 19:32, o suporte do Google diz a um usuário que não há interrupções conhecidas — tente limpar seus cookies. Todos os outros se recuperam até as 19:48.
us-central1: o efeito manada
1:34 us-central1 não: tarefas de reinicialização sobrecarregam a mesma tabela do Spanner, sem espera exponencial randomizada, então o Google as restringe manualmente. Duas horas e quarenta. Um: a verificação de política está dentro do caminho da solicitação; quando a verificação falha,
Mecanismo: verificação no caminho da solicitação, replicação global, um fornecedor
1:46 a API falha. Dois: dados de cota se tornam globais sem testes; uma linha ruim é uma linha global. Três: Cloudflare sabia. Workers KV estava em processo de migração para seu próprio R2, com um único provedor — o post-mortem o chama de lacuna na cobertura.
git blame — a divisão
2:00 git blame. Google, cinquenta e cinco por cento: sem verificação de nulo, sem feature flag, sem espera exponencial randomizada — seu relatório diz que uma flag teria detectado isso em testes. Replicação global, vinte: uma linha, cada região, segundos. Cloudflare, vinte: metade de uma linha de produtos em um armazenamento de fornecedor único, e um post-mortem que nunca diz Google. A página de status, cinco, por depender do que ela relata. Raio de impacto: setenta produtos Google Cloud, dez aplicativos Workspace,
Raio de impacto
2:23 todas as regiões. Três horas. No Cloudflare: Access, WARP, Workers AI, Pages, Stream — duas e meia. Hacker News, mil e quatrocentos pontos; comentário principal: a página de status está verde.
Veredito + a linha da segunda-feira
2:33 Veredito, post-mortem: SHIP IT. Ambos os post-mortems chegam em trinta horas, ambos se culpam, e as correções do Google são concretas: falhar aberto, flags desativadas por padrão, espera exponencial randomizada. A linha da segunda-feira: novo código atrás de uma flag que é lançada desativada, e uma verificação de nulo onde os dados chegam. Envie-me o incidente sobre o qual você ainda não tem permissão para falar, nos comentários, ou em the daily diff dot dev. E essa é a diferença de hoje.
2:53 Sou Niko da Axrisi. Faça o merge com responsabilidade.
Fontes
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



