Google Cloud gặp sự cố trên một trường trống. Ba giờ.
Một hàng chính sách với một vài trường trống gặp phải con trỏ null, và Google Cloud gặp sự cố ở mọi khu vực cùng lúc — sau đó Cloudflare cũng bị ảnh hưởng.
Một hàng chính sách với một vài trường trống gặp phải con trỏ null, và Google Cloud gặp sự cố ở mọi khu vực cùng lúc — sau đó Cloudflare cũng bị ảnh hưởng. Ngày 12 tháng 6 năm 2025, 17:49 UTC: Service Control, tệp nhị phân phê duyệt mọi yêu cầu API của Google Cloud, đọc một thay đổi chính sách hạn ngạch với "các trường trống không mong muốn", gặp phải một đường dẫn mã được triển khai hai tuần trước đó mà không có kiểm tra null và không có cờ tính năng, và rơi vào vòng lặp sự cố ở mọi khu vực — hàng này đã được nhân bản toàn cầu trong vài giây. Các API bên ngoài trả về 503 trong ba giờ; us-central1 mất 2 giờ 40 phút vì các tác vụ khởi động lại đồng loạt truy cập vào cùng một bảng Spanner mà không có thời gian chờ ngẫu nhiên. Ba phút sau sự cố của Google, Workers KV của Cloudflare — nguồn sự thật nằm trên "nhà cung cấp đám mây bên thứ ba" — mất 90% yêu cầu, và Access, WARP, Workers AI, Pages, Stream và Turnstile cũng ngừng hoạt động trong 2 giờ 28 phút. Trang trạng thái của Google đăng bản cập nhật đầu tiên muộn một giờ, vì nó chạy trên Google Cloud.
Đọc phiên bản viết (tiếng Anh) ↗
Nội dung video này đề cập
- Một trường trống, một con trỏ null, mọi khu vực
- Dòng thời gian: 29 tháng 5 → 17:45 → vòng lặp sự cố → nút đỏ → 17:52 Cloudflare
- us-central1: hiệu ứng bầy đàn
- Cơ chế: kiểm tra trong đường dẫn yêu cầu, sao chép toàn cầu, một nhà cung cấp
- git blame — sự phân chia
Bản ghi đã dịch
Được dịch từ lời tường thuật tiếng Anh gốc. Âm thanh và phụ đề có sẵn được điều khiển bởi YouTube.
Một trường trống, một con trỏ null, mọi khu vực
0:00 Một hàng chính sách với các trường trống gặp phải con trỏ null, và Google Cloud gặp sự cố ở mọi khu vực cùng lúc — và Cloudflare cũng bị ảnh hưởng, sau đó gọi Google là "nhà cung cấp bên thứ ba". Ngày 12 tháng 6 năm 2025, 17:49 UTC. Báo cáo của Google: Service Control, tệp nhị phân phê duyệt mọi yêu cầu API, trong một vòng lặp sự cố trong ba giờ. Của Cloudflare, cùng buổi tối: Workers KV, chín mươi phần trăm thất bại, hai giờ hai mươi tám.
0:23 Làm thế nào nó xảy ra, tại sao một trường trống lại lan rộng toàn cầu trong vài giây, và ai phải chịu trách nhiệm. Đây là The Daily Diff, sau sự cố. 29 tháng 5. Service Control nhận một kiểm tra hạn ngạch mới, được triển khai theo từng khu vực với một
Dòng thời gian: 29 tháng 5 → 17:45 → vòng lặp sự cố → nút đỏ → 17:52 Cloudflare
0:35 nút đỏ — nhưng đường dẫn mã mới không bao giờ chạy trong quá trình triển khai; không có gì kích hoạt nó chưa. Không có kiểm tra null. Không có cờ tính năng. 17:45. Một thay đổi chính sách với các trường trống được đưa vào bảng Spanner. Hạn ngạch là toàn cầu, vì vậy hàng này được sao chép khắp mọi nơi trong vài giây. Mọi tệp nhị phân Service Control đều đọc nó, gặp phải con trỏ null, gặp sự cố, khởi động lại, đọc lại. Mọi cuộc gọi API: 503.
0:55 Google nhanh chóng: phân loại trong hai phút, nguyên nhân gốc trong mười. Nút đỏ được tắt trong bốn mươi phút, và các khu vực nhỏ phục hồi trước. Trang trạng thái đăng bản cập nhật đầu tiên sau một giờ, vì nó chạy trên Google Cloud. 17:52. Nhóm WARP của Cloudflare thấy các thiết bị mới không đăng ký được. Workers KV, kho lưu trữ mà một nửa Cloudflare sử dụng cho cấu hình và nhận dạng, nằm trên một đám mây của bên thứ ba. Access thất bại mọi lần đăng nhập — theo thiết kế, nó đóng khi thất bại.
1:20 Workers AI thất bại mọi suy luận. 19:11, Gergely Orosz: hai đám mây độc lập cùng lúc gặp sự cố, chưa từng thấy trước đây. 19:32, hỗ trợ của Google thông báo với người dùng rằng không có sự gián đoạn nào được biết — hãy thử xóa cookie của bạn. Mọi nơi khác phục hồi vào 19:48.
us-central1: hiệu ứng bầy đàn
1:34 us-central1 thì không: các tác vụ khởi động lại đồng loạt truy cập vào cùng một bảng Spanner, không có thời gian chờ ngẫu nhiên, vì vậy Google điều tiết chúng bằng tay. Hai giờ bốn mươi. Một: kiểm tra chính sách nằm trong đường dẫn yêu cầu; khi kiểm tra chết,
Cơ chế: kiểm tra trong đường dẫn yêu cầu, sao chép toàn cầu, một nhà cung cấp
1:46 API chết. Hai: dữ liệu hạn ngạch lan rộng toàn cầu mà không có thử nghiệm; một hàng xấu là một hàng toàn cầu. Ba: Cloudflare biết. Workers KV đang trong quá trình di chuyển sang R2 của riêng nó, chỉ còn một nhà cung cấp — báo cáo sau sự cố gọi đó là một khoảng trống trong phạm vi bảo hiểm.
git blame — sự phân chia
2:00 git blame. Google, năm mươi lăm phần trăm: không kiểm tra null, không cờ tính năng, không có thời gian chờ — báo cáo của họ nói rằng một cờ đã có thể phát hiện nó trong quá trình thử nghiệm. Sao chép toàn cầu, hai mươi: một hàng, mọi khu vực, giây. Cloudflare, hai mươi: một nửa dòng sản phẩm trên kho lưu trữ của một nhà cung cấp, và một báo cáo sau sự cố không bao giờ nói Google. Trang trạng thái, năm, vì hoạt động trên những gì nó báo cáo. Phạm vi ảnh hưởng: bảy mươi sản phẩm Google Cloud, mười ứng dụng Workspace,
Phạm vi ảnh hưởng
2:23 mọi khu vực. Ba giờ. Tại Cloudflare: Access, WARP, Workers AI, Pages, Stream — hai tiếng rưỡi. Hacker News, mười bốn trăm điểm; bình luận hàng đầu: trang trạng thái vẫn xanh.
Phán quyết + dòng Thứ Hai
2:33 Phán quyết, sau sự cố: SHIP IT. Cả hai báo cáo sau sự cố đều được công bố trong vòng ba mươi giờ, cả hai đều tự đổ lỗi, và các bản sửa lỗi của Google rất cụ thể: fail open, cờ tắt theo mặc định, thời gian chờ lũy thừa. Dòng Thứ Hai: mã mới đằng sau một cờ được tắt, và một kiểm tra null nơi dữ liệu được đưa vào. Gửi cho tôi sự cố mà bạn vẫn không được phép nói về, trong phần bình luận, hoặc tại the daily diff dot dev. Và đó là The Daily Diff cho hôm nay.
2:53 Tôi là Niko từ Axrisi. Merge responsibly.
Nguồn
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



