+− THE DAILY DIFFdev & AI news
SHIP IT

Google Cloud가 빈 필드에서 충돌했습니다. 세 시간.

몇 개의 빈 필드를 가진 정책 행이 널 포인터에 도달하고 Google Cloud는 모든 리전에서 동시에 충돌합니다.

몇 개의 빈 필드를 가진 정책 행이 널 포인터에 도달하고 Google Cloud는 모든 리전에서 동시에 충돌합니다. 그런 다음 Cloudflare도 함께 다운됩니다. 2025년 6월 12일 17:49 UTC: 모든 Google Cloud API 요청을 승인하는 바이너리인 Service Control이 “의도하지 않은 빈 필드”가 포함된 할당량 정책 변경 사항을 읽고, 2주 전에 널 검사 및 기능 플래그 없이 배포된 코드 경로에 도달하며, 모든 리전에서 충돌 루프에 들어갑니다. 해당 행은 몇 초 내에 전 세계적으로 복제되었습니다. 외부 API는 세 시간 동안 503을 반환합니다. us-central1은 재시작 작업이 무작위 백오프 없이 동일한 Spanner 테이블에 몰리면서 2시간 40분이 걸립니다. Google의 서비스 중단 3분 후, “타사 클라우드 공급자”에 진실의 원천을 두고 있는 Cloudflare의 Workers KV는 요청의 90%를 손실하고, Access, WARP, Workers AI, Pages, Stream 및 Turnstile은 2시간 28분 동안 함께 다운됩니다. Google의 상태 페이지는 Google Cloud에서 실행되기 때문에 한 시간 늦게 첫 번째 업데이트를 게시합니다.

서면판 읽기 (영어) ↗

이 동영상에서 다루는 내용

  • 빈 필드, 널 포인터, 모든 리전
  • 타임라인: 5월 29일 → 17:45 → 충돌 루프 → 빨간 버튼 → 17:52 Cloudflare
  • us-central1: 떼 효과
  • 메커니즘: 요청 경로 확인, 전역 복제, 단일 공급업체
  • git blame — 분할

번역된 스크립트

원래 영어 내레이션에서 번역되었습니다. 사용 가능한 오디오 및 캡션은 YouTube에서 제어합니다.

빈 필드, 널 포인터, 모든 리전

0:00 빈 필드를 가진 정책 행이 널 포인터에 도달하고 Google Cloud가 충돌합니다. 모든 리전에서 동시에 — 그리고 Cloudflare도 함께 다운됩니다, 그 다음 Google을 “타사 공급자”라고 부릅니다. 2025년 6월 12일 17:49 UTC. Google의 보고서: 모든 API 요청을 승인하는 바이너리인 Service Control은, 세 시간 동안 충돌 루프에 빠졌습니다. Cloudflare의 보고서, 같은 날 저녁: Workers KV, 90퍼센트 실패, 두 시간 이십팔 분.

0:23 어떻게 일어났는지, 왜 하나의 빈 필드가 몇 초 만에 전 세계로 퍼졌는지, 그리고 누가 비난을 받는지. 여기는 The Daily Diff, 사후 분석입니다. 5월 29일. Service Control은 새로운 할당량 검사를 받습니다. 각 리전별로

타임라인: 5월 29일 → 17:45 → 충돌 루프 → 빨간 버튼 → 17:52 Cloudflare

0:35 빨간 버튼과 함께 배포되었지만 — 새 코드 경로는 배포 중에는 실행되지 않습니다. 아무것도 아직 트리거하지 않습니다. 널 검사 없음. 기능 플래그 없음. 17:45. 빈 필드를 가진 정책 변경 사항이 Spanner 테이블에 들어갑니다. 할당량은 전역적이므로, 해당 행은 몇 초 내에 모든 곳으로 복제됩니다. 모든 Service Control 바이너리는 이를 읽고 널 포인터에 도달하여, 충돌하고, 재시작하고, 다시 읽습니다. 모든 API 호출: 503.

0:55 Google은 빠릅니다: 2분 만에 분류, 10분 만에 근본 원인 파악. 빨간 버튼은 40분 안에 눌리고, 작은 리전들이 먼저 복구됩니다. 상태 페이지는 한 시간 만에 첫 업데이트를 게시합니다, Google Cloud에서 실행되기 때문입니다. 17:52. Cloudflare의 WARP 팀은 새 장치가 등록에 실패하는 것을 확인합니다. Cloudflare의 절반이 구성 및 신원 확인에 사용하는 Workers KV는, 타사 클라우드에 있습니다. Access는 모든 로그인에 실패합니다 — 설계상, 닫힌 상태로 실패합니다.

1:20 Workers AI는 모든 추론에 실패합니다. 19:11, Gergely Orosz: 두 개의 독립적인 클라우드가 동시에 다운, 전례 없는 일입니다. 19:32, Google 지원팀은 사용자에게 알려진 중단이 없다고 말합니다 — 쿠키를 지워보십시오. 다른 모든 곳은 19:48까지 복구됩니다.

us-central1: 떼 효과

1:34 us-central1은 그렇지 않습니다: 재시작 작업이 동일한 Spanner 테이블에 몰리고, 무작위 백오프가 없어 Google이 수동으로 조절합니다. 두 시간 사십 분. 첫째: 정책 검사가 요청 경로 내에 있습니다. 검사가 죽으면,

메커니즘: 요청 경로 확인, 전역 복제, 단일 공급업체

1:46 API가 죽습니다. 둘째: 할당량 데이터는 스테이징 없이 전역으로 이동합니다. 잘못된 행은 전역 행입니다. 셋째: Cloudflare는 알고 있었습니다. Workers KV는 자체 R2로 마이그레이션 중이었고, 하나의 공급자로 축소되어 — 사후 분석은 이를 커버리지의 공백이라고 부릅니다.

git blame — 분할

2:00 git blame. Google, 55퍼센트: 널 검사 없음, 기능 플래그 없음, 백오프 없음 — 그들의 보고서는 플래그가 스테이징에서 이를 잡아냈을 것이라고 말합니다. 전역 복제, 20퍼센트: 하나의 행, 모든 리전, 몇 초. Cloudflare, 20퍼센트: 한 공급업체의 스토어에 제품 라인 절반, 그리고 Google이라는 말을 절대 하지 않는 사후 분석. 상태 페이지, 5퍼센트, 보고하는 대상에서 실행되기 때문입니다. 영향 범위: 70개의 Google Cloud 제품, 10개의 Workspace 앱,

영향 범위

2:23 모든 리전. 세 시간. Cloudflare에서: Access, WARP, Workers AI, Pages, Stream — 두 시간 반. Hacker News, 1400점; 최고 댓글: 상태 페이지는 녹색입니다.

판결 + 월요일 라인

2:33 판결, 사후 분석: SHIP IT. 두 사후 분석 모두 30시간 이내에 나왔고, 둘 다 자신을 비난하며, Google의 수정 사항은 구체적입니다: 개방형 실패, 기본적으로 플래그 꺼짐, 지수적 백오프. 월요일 라인: 꺼진 플래그 뒤에 있는 새 코드, 그리고 데이터가 들어오는 곳에 널 검사. 아직 이야기할 수 없는 사고를 저에게 보내주세요, 댓글로, 또는 the daily diff dot dev로. 그리고 이것이 오늘의 차이입니다.

2:53 저는 Axrisi의 Niko입니다. 책임감 있게 병합하세요.

출처

  1. Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
  2. Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
  3. Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
  4. Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
  5. @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
  6. Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
  7. Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
  8. Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
  9. Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com

관련 동영상

postmortem · ko · 2026. 9. 16.

Facebook이 인터넷에서 스스로를 삭제했습니다. 6시간 동안.

Facebook이 인터넷에서 자체 주소를 삭제하고, 엔지니어들이 이를 복구하기 위해 도착했을 때, 뱃지 리더기 또한 작동하지 않았는데, 이는 뱃지 리더기가 Facebook에 연결되어 있었기 때문입니다. 2021년 10월 4일 15:40 UTC: 일상적인 백본 유지보수 명령이 Facebook 데이터 센터 간의 모든 링크를 중단시켰습니다. 이를 차단하도록 구축

3:01 ↗
postmortem · ko · 2026. 9. 25.

1밀리초 버그로 영국 항공 교통 6시간 마비.

9월 8일 화요일 오전 10시, NATS의 국가 영공 시스템(NAS) 내에서 일상적인 스쾍 코드 요청이 값을 업데이트하는 도중에 우선순위가 더 높은 메시지에 의해 중단되었습니다. 노출 시간은 약 1밀리초입니다. 요청이 잘못 재개되고 비행 데이터가 손상되어 오후 7시 30분까지 2,000편 이상의 영국 항공편이 지연, 취소 또는 회항되었습니다.

3:06 ↗
postmortem · ko · 2026. 9. 22.

재부팅으로 텔스트라가 2006년으로 돌아갔습니다. 9백만 대의 전화.

멜버른의 한 엔지니어가 새벽 2시 50분에 타이밍 섀시 전원을 다시 켰고, 아침 식사 시간까지 호주 최대의 모바일 네트워크는 2006년 11월이라고 동의했습니다. 2026년 7월 8일: 텔스트라의 NTP 섀시에 있는 GPS 카드가 전원 공급 장치 수리 중에 재부팅되었고, 펌웨어는 GPS 주 롤오버 업데이트가 없었기 때문에 이전 에포크를 선택하여 1,024주

3:15 ↗