Google Cloud mengalami crash pada bidang kosong. Tiga jam.
Baris kebijakan dengan beberapa bidang kosong mengalami null pointer, dan Google Cloud crash di setiap wilayah sekaligus — kemudian Cloudflare ikut tumbang.
Baris kebijakan dengan beberapa bidang kosong mengalami null pointer, dan Google Cloud crash di setiap wilayah sekaligus — kemudian Cloudflare ikut tumbang. 12 Juni 2025, 17:49 UTC: Service Control, biner yang menyetujui setiap permintaan Google Cloud API, membaca perubahan kebijakan kuota dengan "bidang kosong yang tidak disengaja", menemukan jalur kode yang dikirim dua minggu sebelumnya tanpa pemeriksaan null dan tanpa feature flag, dan masuk ke "crash loop" di setiap wilayah — baris tersebut telah direplikasi secara global dalam hitungan detik. API eksternal mengembalikan 503 selama tiga jam; us-central1 membutuhkan waktu 2 jam 40 menit karena tugas yang memulai ulang "stampede" tabel Spanner yang sama tanpa "randomized backoff". Tiga menit setelah pemadaman Google, Workers KV milik Cloudflare — yang sumber kebenarannya berada di "penyedia cloud pihak ketiga" — kehilangan 90% permintaan, dan Access, WARP, Workers AI, Pages, Stream, dan Turnstile ikut tumbang selama 2 jam 28 menit. Halaman status Google memposting pembaruan pertamanya satu jam terlambat, karena berjalan di Google Cloud.
Baca edisi tertulis (Inggris) ↗
Isi video ini
- Bidang kosong, "null pointer", setiap wilayah
- Linimasa: 29 Mei → 17:45 → "crash loop" → tombol merah → 17:52 Cloudflare
- us-central1: efek kawanan
- Mekanisme: pemeriksaan di jalur permintaan, replikasi global, satu vendor
- "git blame" — pemisahan
Transkrip terjemahan
Diterjemahkan dari narasi asli bahasa Inggris. Audio dan teks tersedia yang dikontrol oleh YouTube.
Bidang kosong, "null pointer", setiap wilayah
0:00 Baris kebijakan dengan bidang kosong mengalami "null pointer", dan Google Cloud crash di setiap wilayah sekaligus — dan Cloudflare ikut tumbang, kemudian menyebut Google "penyedia pihak ketiga". 12 Juni 2025, 17:49 UTC. Laporan Google: Service Control, biner yang menyetujui setiap permintaan API, dalam "crash loop" selama tiga jam. Laporan Cloudflare, di malam yang sama: Workers KV, sembilan puluh persen gagal, dua jam dua puluh delapan.
0:23 Bagaimana itu terjadi, mengapa satu bidang kosong mendunia dalam hitungan detik, dan siapa yang disalahkan. Ini adalah The Daily Diff, postmortem. 29 Mei. Service Control mendapatkan pemeriksaan kuota baru, dikirimkan per wilayah dengan
Linimasa: 29 Mei → 17:45 → "crash loop" → tombol merah → 17:52 Cloudflare
0:35 tombol merah — tetapi jalur kode baru tidak pernah berjalan selama peluncuran; tidak ada yang memicu itu belum. Tanpa pemeriksaan null. Tanpa "feature flag". 17:45. Perubahan kebijakan dengan bidang kosong masuk ke tabel Spanner. Kuota bersifat global, sehingga baris tersebut direplikasi di mana-mana dalam hitungan detik. Setiap biner Service Control membacanya, menemukan "null pointer", crash, memulai ulang, membacanya lagi. Setiap panggilan API: 503.
0:55 Google cepat: "triage" dalam dua menit, "root cause" dalam sepuluh. Tombol merah keluar dalam empat puluh, dan wilayah kecil pulih lebih dulu. Halaman status memposting pembaruan pertamanya satu jam kemudian, karena berjalan di Google Cloud. 17:52. Tim WARP Cloudflare melihat perangkat baru gagal mendaftar. Workers KV, penyimpanan yang digunakan separuh Cloudflare untuk konfigurasi dan identitas, berada di cloud pihak ketiga. Access gagal setiap login — secara desain, ia gagal tertutup.
1:20 Workers AI gagal setiap inferensi. 19:11, Gergely Orosz: dua cloud independen tumbang sekaligus, belum pernah terlihat sebelumnya. 19:32, dukungan Google memberitahu pengguna bahwa tidak ada gangguan yang diketahui — coba hapus cookie Anda. Di tempat lain pulih pada 19:48.
us-central1: efek kawanan
1:34 us-central1 tidak: tugas yang memulai ulang "stampede" tabel Spanner yang sama, tanpa "randomized backoff", jadi Google membatasi mereka secara manual. Dua jam empat puluh. Satu: pemeriksaan kebijakan berada di dalam jalur permintaan; ketika pemeriksaan mati,
Mekanisme: pemeriksaan di jalur permintaan, replikasi global, satu vendor
1:46 API mati. Dua: data kuota menjadi global tanpa "staging"; baris yang buruk adalah baris global. Tiga: Cloudflare tahu. Workers KV sedang dalam migrasi ke R2 miliknya sendiri, berkurang menjadi satu penyedia — postmortem menyebutnya celah dalam cakupan.
"git blame" — pemisahan
2:00 "git blame". Google, lima puluh lima persen: tanpa pemeriksaan null, tanpa "feature flag", tanpa "backoff" — laporan mereka mengatakan "flag" akan menangkapnya di "staging". Replikasi global, dua puluh: satu baris, setiap wilayah, detik. Cloudflare, dua puluh: separuh lini produk di penyimpanan satu vendor, dan "postmortem" yang tidak pernah menyebut Google. Halaman status, lima, karena berada di atas apa yang dilaporkannya. Radius ledakan: tujuh puluh produk Google Cloud, sepuluh aplikasi Workspace,
Radius ledakan
2:23 setiap wilayah. Tiga jam. Di Cloudflare: Access, WARP, Workers AI, Pages, Stream — dua setengah. Hacker News, empat belas ratus poin; komentar teratas: halaman status berwarna hijau.
Putusan + "the Monday line"
2:33 Putusan, postmortem: SHIP IT. Kedua "postmortem" mendarat dalam tiga puluh jam, keduanya menyalahkan diri sendiri, dan perbaikan Google konkret: gagal terbuka, "flag" mati secara default, "exponential backoff". "The Monday line": kode baru di balik "flag" yang mati, dan pemeriksaan null di mana data masuk. Kirimkan insiden yang masih belum boleh Anda bicarakan kepada saya, di komentar, atau di the daily diff dot dev. Dan itu "the diff" untuk hari ini.
2:53 Saya Niko dari Axrisi. Gabungkan secara bertanggung jawab.
Sumber
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



