تعطل Google Cloud بسبب حقل فارغ. ثلاث ساعات.
يصطدم صف سياسة به بعض الحقول الفارغة بمؤشر فارغ، وتتعطل Google Cloud في كل منطقة في وقت واحد - ثم تسقط Cloudflare معها.
يصطدم صف سياسة به بعض الحقول الفارغة بمؤشر فارغ، وتتعطل Google Cloud في كل منطقة في وقت واحد - ثم تسقط Cloudflare معها. 12 يونيو 2025، 17:49 بالتوقيت العالمي المنسق: Service Control، الثنائي الذي يوافق على كل طلب واجهة برمجة تطبيقات من Google Cloud، يقرأ تغييرًا في سياسة الحصص يحتوي على "حقول فارغة غير مقصودة"، ويصطدم بمسار تعليمات برمجية تم شحنه قبل أسبوعين بدون فحص فارغ ولا علامة ميزة، ويدخل في حلقة تعطل في كل منطقة - وقد تم نسخ الصف عالميًا في غضون ثوانٍ. تُرجع واجهات برمجة التطبيقات الخارجية 503 لمدة ثلاث ساعات؛ تستغرق us-central1 ساعتين و40 دقيقة لأن المهام التي يتم إعادة تشغيلها تزدحم نفس جدول Spanner بدون تأخير عشوائي. بعد ثلاث دقائق من انقطاع خدمة Google، تفقد Workers KV من Cloudflare - التي يقع مصدر الحقيقة الخاص بها على "موفر سحابة تابع لجهة خارجية" - 90٪ من الطلبات، وتتعطل Access وWARP وWorkers AI وPages وStream وTurnstile معها لمدة ساعتين و28 دقيقة. تنشر صفحة حالة Google أول تحديث لها متأخرًا بساعة، لأنها تعمل على Google Cloud.
اقرأ النسخة المكتوبة (الإنجليزية) ↗
ما يغطيه هذا الفيديو
- حقل فارغ، مؤشر فارغ، كل منطقة
- الجدول الزمني: 29 مايو ← 17:45 ← حلقة تعطل ← زر أحمر ← 17:52 Cloudflare
- us-central1: تأثير القطيع
- الآلية: التحقق في مسار الطلب، النسخ المتماثل العالمي، بائع واحد
- git blame — الانقسام
النص المترجم
مترجم من السرد الإنجليزي الأصلي. يتم التحكم في الصوت والتعليقات التوضيحية المتاحة بواسطة YouTube.
حقل فارغ، مؤشر فارغ، كل منطقة
0:00 يصطدم صف سياسة به حقول فارغة بمؤشر فارغ، وتتعطل Google Cloud في كل منطقة في وقت واحد — وتسقط Cloudflare معها، ثم تصف Google بأنها "موفر من طرف ثالث". 12 يونيو 2025، 17:49 بالتوقيت العالمي المنسق. تقرير Google: Service Control، الثنائي الذي يوافق على كل طلب واجهة برمجة تطبيقات، في حلقة تعطل لمدة ثلاث ساعات. تقرير Cloudflare، في نفس المساء: Workers KV، تسعون بالمائة فاشل، ساعتان وثمانية وعشرون دقيقة.
0:23 كيف حدث ذلك، لماذا أصبح حقل فارغ واحد عالميًا في ثوانٍ، ومن يقع عليه اللوم. هذا هو The Daily Diff، تقرير ما بعد الحادث. 29 مايو. يتلقى Service Control فحص حصص جديد، يتم شحنه منطقة تلو الأخرى مع
الجدول الزمني: 29 مايو ← 17:45 ← حلقة تعطل ← زر أحمر ← 17:52 Cloudflare
0:35 زر أحمر — لكن مسار الكود الجديد لا يعمل أبدًا أثناء النشر؛ لا يوجد شيء يشغله حتى الآن. لا يوجد فحص فارغ. لا توجد علامة ميزة. 17:45. تغيير في السياسة مع حقول فارغة يهبط في جدول Spanner. الحصص عالمية، لذا يتم نسخ الصف في كل مكان في غضون ثوانٍ. كل ثنائي من Service Control يقرأه، يصطدم بالمؤشر الفارغ، يتعطل، يعيد التشغيل، يقرأه مرة أخرى. كل مكالمة واجهة برمجة تطبيقات: 503.
0:55 Google سريعة: فرز في دقيقتين، سبب جذري في عشرة. يتم إخراج الزر الأحمر في أربعين دقيقة، وتتعافى المناطق الصغيرة أولاً. صفحة الحالة تنشر أول تحديث لها بعد ساعة، لأنها تعمل على Google Cloud. 17:52. فريق Cloudflare WARP يرى أجهزة جديدة تفشل في التسجيل. Workers KV، مخزن النصف الذي تستخدمه Cloudflare للتكوين والهوية، يعمل على سحابة طرف ثالث. Access يفشل في كل تسجيل دخول — حسب التصميم، يفشل مغلقًا.
1:20 Workers AI يفشل في كل استنتاج. 19:11، Gergely Orosz: سحابتان مستقلتان تتعطلان في وقت واحد، لم نشاهدها من قبل. 19:32، دعم Google يخبر مستخدمًا أنه لا توجد اضطرابات معروفة — حاول مسح ملفات تعريف الارتباط الخاصة بك. كل مكان آخر يتعافى بحلول 19:48.
us-central1: تأثير القطيع
1:34 us-central1 لا تتعافى: المهام التي يتم إعادة تشغيلها تزدحم نفس جدول Spanner، لا يوجد تأخير عشوائي، لذلك تقوم Google بتقييدها يدويًا. ساعتان وأربعون دقيقة. واحد: فحص السياسة يقع داخل مسار الطلب؛ عندما يموت الفحص،
الآلية: التحقق في مسار الطلب، النسخ المتماثل العالمي، بائع واحد
1:46 تموت واجهة برمجة التطبيقات. اثنان: بيانات الحصص تنتشر عالميًا بدون مرحلة اختبار؛ صف سيء هو صف عالمي. ثلاثة: Cloudflare كانت تعلم. كانت Workers KV في منتصف عملية الترحيل إلى R2 الخاصة بها، وصولاً إلى موفر واحد — تقرير ما بعد الحادث يصفها بأنها فجوة في التغطية.
git blame — الانقسام
2:00 git blame. Google، خمسة وخمسون بالمائة: لا فحص فارغ، لا علامة ميزة، لا تأخير — يقول تقريرهم إن علامة ميزة كانت ستكشفها في مرحلة الاختبار. النسخ المتماثل العالمي، عشرون: صف واحد، كل منطقة، ثوانٍ. Cloudflare، عشرون: نصف خط إنتاج على متجر بائع واحد، وتقرير ما بعد الحادث لا يذكر Google أبدًا. صفحة الحالة، خمسة، لعيشها على ما تبلغ عنه. نطاق الانفجار: سبعون منتجًا من Google Cloud، عشرة تطبيقات Workspace،
نطاق الانفجار
2:23 كل منطقة. ثلاث ساعات. في Cloudflare: Access, WARP, Workers AI, Pages, Stream — ساعتان ونصف. Hacker News، ألف وأربعمائة نقطة؛ التعليق الأعلى: صفحة الحالة خضراء.
الحكم + خط الاثنين
2:33 الحكم، تقرير ما بعد الحادث: SHIP IT. يتم نشر كلا تقريري ما بعد الحادث في غضون ثلاثين ساعة، وكلاهما يلوم نفسه، وإصلاحات Google ملموسة: فشل مفتوح، إيقاف العلامات افتراضيًا، تأخير أسي. خط الاثنين: كود جديد خلف علامة يتم شحنها معطلة، وفحص فارغ حيث تأتي البيانات. أرسل لي الحادث الذي لا يزال لا يُسمح لك بالتحدث عنه، في التعليقات، أو على the daily diff dot dev. وهذا هو الـ diff لليوم.
2:53 أنا نيكو من Axrisi. ادمج بمسؤولية.
المصادر
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



