Google Cloud သည် အကွက်လပ်တစ်ခုကြောင့် ပျက်သွားသည်။ သုံးနာရီကြာသည်။
အကွက်လပ်အချို့ပါရှိသော ပေါ်လစီတန်းတစ်ခုသည် null pointer သို့ ရောက်ရှိသွားပြီး Google Cloud သည် ဒေသတိုင်းတွင် တစ်ချိန်တည်း ပျက်သွားသည် — ထို့နောက် Cloudflare လည်း ၎င်းနှင့်အတူ ပြိုလဲသွားသည်။
အကွက်လပ်အချို့ပါရှိသော ပေါ်လစီတန်းတစ်ခုသည် null pointer သို့ ရောက်ရှိသွားပြီး Google Cloud သည် ဒေသတိုင်းတွင် တစ်ချိန်တည်း ပျက်သွားသည် — ထို့နောက် Cloudflare လည်း ၎င်းနှင့်အတူ ပြိုလဲသွားသည်။ 2025 ခုနှစ်၊ ဇွန်လ 12 ရက်၊ 17:49 UTC: Google Cloud API တောင်းဆိုမှုတိုင်းကို ခွင့်ပြုသည့် binary ဖြစ်သော Service Control သည် "မရည်ရွယ်ဘဲ အကွက်လပ်များ" ပါရှိသော quota-policy ပြောင်းလဲမှုကို ဖတ်မိပြီး၊ နှစ်ပတ်အစောပိုင်းက ထုတ်လုပ်ခဲ့သော null check နှင့် feature flag မပါရှိသည့် code path သို့ ရောက်ရှိကာ ဒေသတိုင်းတွင် crash loop သို့ ရောက်ရှိသွားသည် — ထိုတန်းသည် စက္ကန့်ပိုင်းအတွင်း ကမ္ဘာတစ်ဝှမ်းသို့ ပျံ့နှံ့သွားခဲ့သည်။ ပြင်ပ API များသည် သုံးနာရီကြာ 503 ကို ပြန်ပို့သည်; us-central1 သည် 2 နာရီ 40 မိနစ်ကြာသည် အဘယ်ကြောင့်ဆိုသော် ပြန်လည်စတင်သည့် tasks များသည် တူညီသော Spanner table ကို randomized backoff မပါဘဲ လွှမ်းမိုးသွားသောကြောင့်ဖြစ်သည်။ Google ၏ ပြတ်တောက်မှု စတင်ပြီး သုံးမိနစ်အကြာတွင် Cloudflare ၏ Workers KV — ၎င်း၏ source of truth သည် "third-party cloud provider" တွင်ရှိသည် — တောင်းဆိုမှု 90% ဆုံးရှုံးပြီး Access, WARP, Workers AI, Pages, Stream နှင့် Turnstile တို့သည် ၎င်းနှင့်အတူ 2 နာရီ 28 မိနစ်ကြာ ပြိုလဲသွားသည်။ Google ၏ status page သည် ၎င်း၏ ပထမဆုံး update ကို တစ်နာရီနောက်ကျပြီး တင်သည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်းသည် Google Cloud တွင် လည်ပတ်နေသောကြောင့်ဖြစ်သည်။
ရေးသားထားသော ထုတ်ဝေမှု (အင်္ဂလိပ်) ကို ဖတ်ရန် ↗
ဤဗီဒီယိုတွင် ဖော်ပြထားသောအရာများ
- အကွက်လပ်တစ်ခု၊ null pointer တစ်ခု၊ ဒေသတိုင်း
- အချိန်ဇယား- မေလ 29 → 17:45 → crash loop → red button → 17:52 Cloudflare
- us-central1: အုပ်စုလိုက် သက်ရောက်မှု
- ယန္တရား- တောင်းဆိုမှုလမ်းကြောင်းတွင် စစ်ဆေးခြင်း၊ ကမ္ဘာလုံးဆိုင်ရာ ပုံတူကူးခြင်း၊ ရောင်းချသူတစ်ဦးတည်း
- git blame — ကွဲပြားခြင်း
ဘာသာပြန်ထားသော စာသားမှတ်တမ်း
မူရင်း အင်္ဂလိပ်စကားပြောမှ ဘာသာပြန်ထားသည်။ ရရှိနိုင်သော အသံနှင့် စာတန်းထိုးများကို YouTube မှ ထိန်းချုပ်ထားသည်။
အကွက်လပ်တစ်ခု၊ null pointer တစ်ခု၊ ဒေသတိုင်း
0:00 အကွက်လပ်များပါရှိသော ပေါ်လစီတန်းတစ်ခုသည် null pointer သို့ ရောက်ရှိသွားပြီး Google Cloud သည် ဒေသတိုင်းတွင် တစ်ချိန်တည်း ပျက်သွားသည် — Cloudflare လည်း ၎င်းနှင့်အတူ ပြိုလဲသွားသည်၊ ထို့နောက် Google ကို "third-party provider" ဟု ခေါ်ဆိုသည်။ 2025 ခုနှစ်၊ ဇွန်လ 12 ရက်၊ 17:49 UTC။ Google ၏ အစီရင်ခံစာ- Service Control၊ API တောင်းဆိုမှုတိုင်းကို ခွင့်ပြုသည့် binary သည် သုံးနာရီကြာ crash loop တွင်ရှိသည်။ Cloudflare ၏ အဆိုအရ ထိုညနေပိုင်းတွင် Workers KV၊ ၉၀ ရာခိုင်နှုန်း ပျက်ကွက်သည်၊ နှစ်နာရီ နှစ်ဆယ့်ရှစ်မိနစ်။
0:23 ဘယ်လိုဖြစ်ခဲ့လဲ၊ ဘာကြောင့် အကွက်လပ်တစ်ခုတည်းက စက္ကန့်ပိုင်းအတွင်း ကမ္ဘာအနှံ့ ပျံ့နှံ့သွားခဲ့လဲ၊ ပြီးတော့ ဘယ်သူ့မှာ အပြစ်ရှိလဲ။ ဒီက The Daily Diff၊ သေပြီးနောက် စစ်ဆေးခြင်း။ မေလ 29 ရက်။ Service Control သည် red button ပါရှိသော ဒေသအလိုက် ထုတ်လုပ်သည့်
အချိန်ဇယား- မေလ 29 → 17:45 → crash loop → red button → 17:52 Cloudflare
0:35 quota စစ်ဆေးမှုအသစ်ကို ရရှိသည် — သို့သော် code path အသစ်သည် roll out လုပ်နေစဉ်အတွင်း ဘယ်တော့မှ မလည်ပတ်ပါ၊ ဘာမှ မစတင်သေးပါ။ Null check မရှိ။ Feature flag မရှိ။ 17:45။ အကွက်လပ်များပါရှိသော ပေါ်လစီပြောင်းလဲမှုသည် Spanner table သို့ ရောက်ရှိလာသည်။ Quota သည် ကမ္ဘာလုံးဆိုင်ရာဖြစ်သောကြောင့် ထိုတန်းသည် စက္ကန့်ပိုင်းအတွင်း နေရာတိုင်းသို့ ပုံတူကူးသည်။ Service Control binary တိုင်းသည် ၎င်းကို ဖတ်မိပြီး null pointer သို့ ရောက်ရှိကာ ပျက်စီး၊ ပြန်လည်စတင်၊ ထပ်မံဖတ်ရှုသည်။ API ခေါ်ဆိုမှုတိုင်း- 503။
0:55 Google သည် မြန်ဆန်သည်- နှစ်မိနစ်အတွင်း triage၊ ဆယ်မိနစ်အတွင်း root cause။ Red button ကို လေးဆယ်မိနစ်အတွင်း ထုတ်ပြီး အသေးစား ဒေသများက အရင်ပြန်လည်ကောင်းမွန်သည်။ Status page က ၎င်း၏ ပထမဆုံး update ကို တစ်နာရီနောက်ကျပြီး တင်သည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်းသည် Google Cloud တွင် လည်ပတ်နေသောကြောင့်ဖြစ်သည်။ 17:52။ Cloudflare ၏ WARP အဖွဲ့သည် စက်ပစ္စည်းအသစ်များ မှတ်ပုံတင်ရန် ပျက်ကွက်သည်ကို တွေ့ရသည်။ Workers KV၊ Cloudflare ၏ တစ်ဝက်ခန့်က config နှင့် identity အတွက် အသုံးပြုသည့် store သည် third-party cloud တွင် တည်ရှိသည်။ Access သည် login တိုင်းကို ပျက်ကွက်သည် — ဒီဇိုင်းအရ ၎င်းသည် ပိတ်ဆို့သည်။
1:20 Workers AI သည် inference တိုင်းကို ပျက်ကွက်သည်။ 19:11၊ Gergely Orosz: တစ်ချိန်တည်းတွင် လွတ်လပ်သော clouds နှစ်ခု ပျက်စီးသည်၊ ဒီလိုမျိုး တစ်ခါမှ မမြင်ဖူးပါ။ 19:32၊ Google support သည် အသုံးပြုသူတစ်ဦးကို သိရှိထားသော ပြတ်တောက်မှုများ မရှိကြောင်း ပြောသည် — သင်၏ cookies များကို ရှင်းကြည့်ပါ။ အခြားနေရာများအားလုံး 19:48 တွင် ပြန်လည်ကောင်းမွန်သည်။
us-central1: အုပ်စုလိုက် သက်ရောက်မှု
1:34 us-central1 က မကောင်းမွန်- ပြန်လည်စတင်သည့် tasks များသည် တူညီသော Spanner table ကို လွှမ်းမိုးသည်၊ randomized backoff မရှိ၊ ထို့ကြောင့် Google က ၎င်းတို့ကို ကိုယ်တိုင် ထိန်းချုပ်သည်။ နှစ်နာရီ လေးဆယ်။ တစ်: ပေါ်လစီစစ်ဆေးမှုသည် request path အတွင်း၌ ရှိသည်; စစ်ဆေးမှု ပျက်စီးသွားသောအခါ၊
ယန္တရား- တောင်းဆိုမှုလမ်းကြောင်းတွင် စစ်ဆေးခြင်း၊ ကမ္ဘာလုံးဆိုင်ရာ ပုံတူကူးခြင်း၊ ရောင်းချသူတစ်ဦးတည်း
1:46 API က ပျက်စီးသည်။ နှစ်: quota data သည် staging မပါဘဲ ကမ္ဘာလုံးဆိုင်ရာသို့ ရောက်ရှိသည်; မကောင်းသော တန်းတစ်ခုသည် ကမ္ဘာလုံးဆိုင်ရာ တန်းတစ်ခုဖြစ်သည်။ သုံး: Cloudflare က သိသည်။ Workers KV သည် ၎င်း၏ကိုယ်ပိုင် R2 သို့ ကူးပြောင်းနေဆဲဖြစ်ပြီး ပံ့ပိုးသူတစ်ဦးတည်းအထိ ရောက်ရှိနေသည် — postmortem က ၎င်းကို ကာမိမှု ကွာဟချက်ဟု ခေါ်ဆိုသည်။
git blame — ကွဲပြားခြင်း
2:00 git blame။ Google၊ ၅၅ ရာခိုင်နှုန်း- null check မရှိ၊ feature flag မရှိ၊ backoff မရှိ — ၎င်းတို့၏ အစီရင်ခံစာက flag တစ်ခုသည် staging တွင် ၎င်းကို တွေ့ရှိလိမ့်မည်ဟု ဆိုသည်။ ကမ္ဘာလုံးဆိုင်ရာ ပုံတူကူးခြင်း၊ ၂၀ ရာခိုင်နှုန်း- တန်းတစ်ခု၊ ဒေသတိုင်း၊ စက္ကန့်ပိုင်း။ Cloudflare၊ ၂၀ ရာခိုင်နှုန်း- ထုတ်ကုန်လိုင်းတစ်ဝက်သည် ရောင်းချသူတစ်ဦး၏ store တွင်ရှိသည်၊ ပြီးတော့ Google လို့ ဘယ်တော့မှ မပြောတဲ့ postmortem။ Status page၊ ငါး၊ ၎င်း၏ အစီရင်ခံသည့်အရာပေါ်တွင် တည်ရှိနေခြင်းအတွက်။ ပျက်စီးမှု အတိုင်းအတာ- Google Cloud ထုတ်ကုန် ၇၀၊ Workspace apps ၁၀ ခု၊
ပျက်စီးမှု အတိုင်းအတာ
2:23 ဒေသတိုင်း။ သုံးနာရီ။ Cloudflare တွင်- Access, WARP, Workers AI, Pages, Stream — နှစ်နာရီခွဲ။ Hacker News၊ ၁၄၀၀ မှတ်; ထိပ်တန်း comment: status page က စိမ်းနေသည်။
စီရင်ချက် + တနင်္လာနေ့ အခြေအနေ
2:33 စီရင်ချက်၊ postmortem: SHIP IT။ postmortems နှစ်ခုစလုံးသည် နာရီ ၃၀ အတွင်း ရောက်ရှိလာသည်၊ နှစ်ခုစလုံးသည် မိမိကိုယ်ကို အပြစ်တင်သည်၊ Google ၏ ပြင်ဆင်မှုများမှာ ခိုင်မာသည်- fail open၊ flags များကို default အားဖြင့် ပိတ်ထားသည်၊ exponential backoff။ Monday line: flag နောက်ကွယ်ရှိ new code ကို ship off လုပ်သည်၊ ပြီးတော့ data ဝင်လာတဲ့နေရာမှာ null check လုပ်သည်။ သင် မပြောပြနိုင်သေးတဲ့ incident ကို ကျွန်တော့်ဆီ ပို့ပေးပါ။ comments မှာဖြစ်ဖြစ်၊ daily diff dot dev မှာဖြစ်ဖြစ်။ ဒီနေ့အတွက် diff က ဒါပါပဲ။
2:53 ကျွန်တော်က Axrisi က Niko ပါ။ REVERT လုပ်ပါ။
ရင်းမြစ်များ
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



