+− THE DAILY DIFFdev & AI news
SHIP IT

Google Cloud គាំង​ដោយសារ​វាល​ទទេ​។ បី​ម៉ោង​។

ជួរ​គោលការណ៍​ដែល​មាន​វាល​ទទេ​មួយ​ចំនួន​បាន​ប៉ះ​នឹង null pointer ហើយ Google Cloud បាន​គាំង​នៅ​គ្រប់​តំបន់​ក្នុង​ពេល​តែ​មួយ — បន្ទាប់​មក Cloudflare ក៏​ដួល​ជាមួយ​វា​ដែរ។

ជួរ​គោលការណ៍​ដែល​មាន​វាល​ទទេ​មួយ​ចំនួន​បាន​ប៉ះ​នឹង null pointer ហើយ Google Cloud បាន​គាំង​នៅ​គ្រប់​តំបន់​ក្នុង​ពេល​តែ​មួយ — បន្ទាប់​មក Cloudflare ក៏​ដួល​ជាមួយ​វា​ដែរ។ ថ្ងៃទី 12 ខែ​មិថុនា ឆ្នាំ 2025, 17:49 UTC៖ Service Control ដែល​ជា binary ដែល​អនុម័ត​រាល់​សំណើ Google Cloud API បាន​អាន​ការ​ផ្លាស់ប្តូរ​គោលការណ៍​កូតា​ដែល​មាន «វាល​ទទេ​ដែល​មិន​បាន​គ្រោង​ទុក» ប៉ះ​នឹង code path ដែល​បាន​ដាក់​ចេញ​ពីរ​សប្តាហ៍​មុន​ដោយ​គ្មាន null check និង​គ្មាន feature flag ហើយ​ចូល​ទៅ​ក្នុង crash loop នៅ​គ្រប់​តំបន់ — ជួរ​នោះ​បាន​ចម្លង​ទៅ​ទូទាំង​ពិភពលោក​ក្នុង​រយៈ​ពេល​ប៉ុន្មាន​វិនាទី។ API ខាង​ក្រៅ​ត្រឡប់ 503 សម្រាប់​រយៈ​ពេល​បី​ម៉ោង; us-central1 ចំណាយ​ពេល 2 ម៉ោង 40 នាទី ដោយសារ​កិច្ចការ​ដែល​ចាប់ផ្ដើម​ឡើង​វិញ​បាន​វាយលុក​តារាង Spanner ដូចគ្នា​ដោយ​គ្មាន randomized backoff។ បី​នាទី​បន្ទាប់​ពី​ការ​ដាច់​របស់ Google, Workers KV របស់ Cloudflare — ដែល​ប្រភព​នៃ​ការពិត​ស្ថិត​នៅ​លើ «អ្នក​ផ្តល់​សេវា​ពពក​ភាគី​ទី​បី» — បាន​បាត់បង់ 90% នៃ​សំណើ ហើយ Access, WARP, Workers AI, Pages, Stream និង Turnstile ក៏​បាន​ដាច់​ជាមួយ​វា​សម្រាប់​រយៈ​ពេល 2 ម៉ោង 28 នាទី។ ទំព័រ​ស្ថានភាព​របស់ Google បាន​បង្ហោះ​ការ​អាប់ដេត​ដំបូង​របស់​ខ្លួន​យឺត​មួយ​ម៉ោង ដោយសារ​វា​ដំណើរការ​លើ Google Cloud។

អានបោះពុម្ពជាលាយលក្ខណ៍អក្សរ (អង់គ្លេស) ↗

អ្វីដែលវីដេអូនេះគ្របដណ្ដប់

  • វាល​ទទេ, null pointer, គ្រប់​តំបន់
  • កាលប្បវត្តិ៖ 29 ឧសភា → 17:45 → crash loop → red button → 17:52 Cloudflare
  • us-central1: ឥទ្ធិពល​ហ្វូង
  • យន្តការ៖ ពិនិត្យ​មើល​ក្នុង​ផ្លូវ​ស្នើសុំ, ការ​ចម្លង​សកល, អ្នក​លក់​តែ​មួយ
  • git blame — ការ​បំបែក

កំណត់ត្រាដែលបានបកប្រែ

បកប្រែចេញពីការនិទានដើមជាភាសាអង់គ្លេស។ សំឡេង និងចំណងជើងរងដែលមានគឺស្ថិតនៅក្រោមការគ្រប់គ្រងរបស់ YouTube។

វាល​ទទេ, null pointer, គ្រប់​តំបន់

0:00 ជួរ​គោលការណ៍​ដែល​មាន​វាល​ទទេ​បាន​ប៉ះ​នឹង null pointer ហើយ Google Cloud បាន​គាំង​នៅ គ្រប់​តំបន់​ក្នុង​ពេល​តែ​មួយ — ហើយ Cloudflare ក៏​ដួល​ជាមួយ​វា បន្ទាប់​មក​ហៅ Google ថា «អ្នក​ផ្តល់​សេវា​ភាគី​ទី​បី»។ ថ្ងៃទី 12 ខែ​មិថុនា ឆ្នាំ 2025, 17:49 UTC។ របាយការណ៍​របស់ Google៖ Service Control ដែល​ជា binary ដែល​អនុម័ត​រាល់​សំណើ API ក្នុង​ crash loop សម្រាប់​រយៈពេល​បី​ម៉ោង។ របស់ Cloudflare នៅ​ល្ងាច​ដដែល៖ Workers KV បរាជ័យ​កៅសិប​ភាគរយ ពីរ​ម៉ោង​ម្ភៃ​ប្រាំបី។

0:23 តើ​វា​កើត​ឡើង​ដោយ​របៀប​ណា ហេតុអ្វី​វាល​ទទេ​មួយ​បាន​ទៅ​ជា​សកល​ក្នុង​ប៉ុន្មាន​វិនាទី ហើយ​អ្នក​ណា​ត្រូវ​ទទួល​ការ​ស្តី​បន្ទោស។ នេះ​គឺ The Daily Diff, ក្រោយ​មរណភាព។ ថ្ងៃទី 29 ឧសភា។ Service Control ទទួល​បាន​ការ​ត្រួតពិនិត្យ​កូតា​ថ្មី ដែល​ដាក់​ចេញ​ជា​តំបន់ៗ​ជាមួយ

កាលប្បវត្តិ៖ 29 ឧសភា → 17:45 → crash loop → red button → 17:52 Cloudflare

0:35 red button — ប៉ុន្តែ code path ថ្មី​មិន​ដែល​ដំណើរការ​ក្នុង​ពេល​ដាក់​ចេញ​ទេ; គ្មាន​អ្វី​បង្ក​ឲ្យ​វា​នៅ​ឡើយ​ទេ។ គ្មាន null check។ គ្មាន null check។ គ្មាន feature flag។ 17:45។ ការ​ផ្លាស់ប្តូរ​គោលការណ៍​ដែល​មាន​វាល​ទទេ​បាន​ចូល​ទៅ​ក្នុង​តារាង Spanner។ Quota គឺ​ជា​សកល ដូច្នេះ​ជួរ​នោះ​ចម្លង​ទៅ​គ្រប់​ទីកន្លែង​ក្នុង​រយៈ​ពេល​ប៉ុន្មាន​វិនាទី។ រាល់ binary របស់ Service Control អាន​វា ប៉ះ​នឹង null pointer គាំង ចាប់ផ្ដើម​ឡើង​វិញ អាន​វា​ម្ដង​ទៀត។ រាល់​ការ​ហៅ API៖ 503។

0:55 Google គឺ​លឿន៖ ការ​តម្រៀប​ក្នុង​ពីរ​នាទី, មូលហេតុ​ចម្បង​ក្នុង​ដប់​នាទី។ red button ចេញ​ក្នុង​សែសិប​នាទី ហើយ​តំបន់​តូចៗ​ងើប​ឡើង​វិញ​មុន​គេ។ ទំព័រ​ស្ថានភាព​បង្ហោះ​ការ​អាប់ដេត​ដំបូង​របស់​ខ្លួន​មួយ​ម៉ោង​ក្រោយ ដោយសារ​វា​ដំណើរការ​លើ Google Cloud។ 17:52។ ក្រុម WARP របស់ Cloudflare ឃើញ​ឧបករណ៍​ថ្មី​បរាជ័យ​ក្នុង​ការ​ចុះឈ្មោះ។ Workers KV ដែល​ជា​កន្លែង​ផ្ទុក​ពាក់​កណ្តាល​នៃ Cloudflare ប្រើ​សម្រាប់ config និង identity ស្ថិត​នៅ​លើ cloud ភាគី​ទី​បី។ Access បរាជ័យ​រាល់​ការ​ចូល — តាម​ការ​រចនា វា​បរាជ័យ​បិទ។

1:20 Workers AI បរាជ័យ​រាល់​ការ​សន្និដ្ឋាន។ 19:11, Gergely Orosz៖ clouds ឯករាជ្យ​ពីរ​ដាច់​ក្នុង​ពេល​តែ​មួយ មិន​ធ្លាប់​ឃើញ​ពី​មុន​មក។ 19:32, ជំនួយ​របស់ Google ប្រាប់​អ្នក​ប្រើ​ថា​គ្មាន​ការ​រំខាន​ដែល​គេ​ដឹង​ទេ — ព្យាយាម​សម្អាត ឃុកឃី​របស់​អ្នក។ គ្រប់​ទីកន្លែង​ផ្សេង​ទៀត​ងើប​ឡើង​វិញ​នៅ​ម៉ោង 19:48។

us-central1: ឥទ្ធិពល​ហ្វូង

1:34 us-central1 មិន​បាន​ទេ៖ កិច្ចការ​ដែល​ចាប់ផ្ដើម​ឡើង​វិញ​បាន​វាយលុក​តារាង Spanner ដូចគ្នា គ្មាន randomized backoff ដូច្នេះ Google កំណត់​ល្បឿន​ពួក​គេ​ដោយ​ដៃ។ ពីរ​ម៉ោង​សែសិប។ មួយ៖ ការ​ត្រួតពិនិត្យ​គោលការណ៍​ស្ថិត​នៅ​ក្នុង​ផ្លូវ​ស្នើសុំ; នៅ​ពេល​ដែល​ការ​ត្រួតពិនិត្យ​បរាជ័យ

យន្តការ៖ ពិនិត្យ​មើល​ក្នុង​ផ្លូវ​ស្នើសុំ, ការ​ចម្លង​សកល, អ្នក​លក់​តែ​មួយ

1:46 API បរាជ័យ។ ពីរ៖ ទិន្នន័យ​កូតា​ទៅ​ជា​សកល​ដោយ​គ្មាន​ការ​រៀបចំ; ជួរ​អាក្រក់​គឺ​ជា​ជួរ​សកល។ បី៖ Cloudflare ដឹង។ Workers KV កំពុង​ធ្វើ​ការ​ផ្លាស់ប្តូរ​ទៅ R2 របស់​ខ្លួន​ផ្ទាល់ ដោយ​នៅ​សល់​តែ​អ្នក​ផ្តល់​សេវា​មួយ — ក្រោយ​មរណភាព​ហៅ​វា​ថា​ជា​គម្លាត​ក្នុង​ការ​គ្របដណ្ដប់។

git blame — ការ​បំបែក

2:00 git blame។ Google, ហាសិប​ប្រាំ​ភាគរយ៖ គ្មាន null check, គ្មាន feature flag គ្មាន backoff — របាយការណ៍​របស់​ពួក​គេ​បាន​និយាយ​ថា flag នឹង​ចាប់​វា​បាន​ក្នុង​ការ​រៀបចំ។ ការ​ចម្លង​សកល, ម្ភៃ​ភាគរយ៖ មួយ​ជួរ, គ្រប់​តំបន់ វិនាទី។ Cloudflare, ម្ភៃ​ភាគរយ៖ ពាក់​កណ្តាល​ផលិតផល​លើ​កន្លែង​ផ្ទុក​របស់​អ្នក​លក់​ម្នាក់ និង​ក្រោយ​មរណភាព​ដែល​មិន​ដែល​និយាយ Google។ ទំព័រ​ស្ថានភាព, ប្រាំ​ភាគរយ, សម្រាប់​ការ​រស់​នៅ​លើ​អ្វី​ដែល​វា​រាយការណ៍។ កាំ​ផ្ទុះ៖ ផលិតផល Google Cloud ចំនួន​ចិតសិប, កម្មវិធី Workspace ចំនួន​ដប់

កាំ​ផ្ទុះ

2:23 គ្រប់​តំបន់។ បី​ម៉ោង។ នៅ Cloudflare៖ Access, WARP, Workers AI, Pages, Stream — ពីរ​កន្លះ។ Hacker News, ដប់បួន​រយ​ពិន្ទុ; មតិ​កំពូល៖ ទំព័រ​ស្ថានភាព​មាន​ពណ៌​បៃតង។

សាលក្រម + បន្ទាត់​ថ្ងៃ​ច័ន្ទ

2:33 សាលក្រម, ក្រោយ​មរណភាព៖ SHIP IT។ ក្រោយ​មរណភាព​ទាំង​ពីរ​ចេញ​ក្នុង​រយៈ​ពេល​សាមសិប​ម៉ោង, ទាំង​ពីរ​បន្ទោស​ខ្លួន​ឯង ហើយ​ការ​ជួសជុល​របស់ Google គឺ​ជាក់ស្តែង៖ fail open, flags បិទ​តាម​លំនាំ​ដើម exponential backoff។ បន្ទាត់​ថ្ងៃ​ច័ន្ទ៖ កូដ​ថ្មី​នៅ​ពី​ក្រោយ flag ដែល​ចេញ​បិទ និង null check នៅ​កន្លែង​ដែល​ទិន្នន័យ​ចូល។ ផ្ញើ​មក​ខ្ញុំ​នូវ​ឧប្បត្តិហេតុ​ដែល​អ្នក​នៅ​តែ​មិន​ត្រូវ​បាន​អនុញ្ញាត​ឲ្យ​និយាយ​អំពី ក្នុង​មតិ ឬ​នៅ​the daily diff dot dev។ ហើយ​នោះ​គឺ​ជា​ភាព​ខុស​គ្នា​សម្រាប់​ថ្ងៃ​នេះ។

2:53 ខ្ញុំ​គឺ Niko ពី Axrisi។ Merge responsibly.

ប្រភព

  1. Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
  2. Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
  3. Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
  4. Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
  5. @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
  6. Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
  7. Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
  8. Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
  9. Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com

វីដេអូដែលពាក់ព័ន្ធ

postmortem · km · 16 កញ្ញា 2026

Facebook បានលុបខ្លួនឯងចេញពីអ៊ីនធឺណិត។ ប្រាំមួយម៉ោង។

Facebook លុបអាសយដ្ឋានរបស់ខ្លួនចេញពីអ៊ីនធឺណិត ហើយនៅពេលវិស្វកររបស់ខ្លួនមកដាក់វាវិញ ឧបករណ៍អានផ្លាកសញ្ញាក៏ដំណើរការខុសប្រក្រតីផងដែរ ពីព្រោះពួកវាដំណើរការលើ Facebook ។ ថ្ងៃទី 4 ខែតុលា ឆ្នាំ 2021 ម៉ោង 15:40 ម

3:01 ↗
postmortem · km · 25 កញ្ញា 2026

កំហុសមួយមីលីវិនាទីបានបញ្ឈប់ចរាចរណ៍ផ្លូវអាកាសរបស់ចក្រភពអង់គ្លេស។ ប្រាំមួយម៉ោង។

នៅម៉ោង 10:00 ព្រឹកថ្ងៃអង្គារ ទី 8 ខែកញ្ញា សំណើលេខកូដ squawk ជាទម្លាប់មួយនៅក្នុងប្រព័ន្ធដែនអាកាសជាតិ (NAS) របស់ NATS ត្រូវបានរំខានដោយសារសារដែលមានអាទិភាពខ្ពស់ជាងខណៈដែលវាស្ថិតក្នុងដំណាក់កាលពាក់កណ្តាលនៃកា

3:06 ↗
postmortem · km · 22 កញ្ញា 2026

ការចាប់ផ្ដើមឡើងវិញបានបញ្ជូន Telstra ទៅឆ្នាំ 2006 ។ ទូរស័ព្ទប្រាំបួនលានគ្រឿង។

វិស្វករម្នាក់នៅទីក្រុង Melbourne បានបើកប្រអប់កំណត់ពេលឡើងវិញនៅម៉ោង 2:50 ព្រឹក ហើយនៅពេលអាហារពេលព្រឹក បណ្តាញទូរស័ព្ទចល័តដ៏ធំបំផុតរបស់អូស្ត្រាលីបានយល់ព្រមថាវាគឺជាខែវិច្ឆិកា ឆ្នាំ 2006។ ថ្ងៃទី 8 ខែកក្កដា ឆ

3:15 ↗
postmortem · km · 12 កញ្ញា 2026

Regex មួយបានបិទ Cloudflare។ 27 នាទី។

ថ្ងៃទី 2 ខែកក្កដា ឆ្នាំ 2019 ម៉ោង 13:42 UTC: វិធានថ្មីមួយសម្រាប់ Cloudflare's Web Application Firewall បានដំណើរការនៅក្នុងទីក្រុងជាង 180 ក្នុងរយៈពេលប្រហែល 2 វិនាទី។ វាជាវិធាន XSS នៅក្នុងរបៀបក្លែងធ្វើ ដ

3:00 ↗