Google Cloud avarējusi tukša lauka dēļ. Trīs stundas.
Politikas rinda ar dažiem tukšiem laukiem saskaras ar nulles rādītāju, un Google Cloud avarē visos reģionos vienlaicīgi — tad Cloudflare nokrīt līdz ar to.
Politikas rinda ar dažiem tukšiem laukiem saskaras ar nulles rādītāju, un Google Cloud avarē visos reģionos vienlaicīgi — tad Cloudflare nokrīt līdz ar to. 2025. gada 12. jūnijs, 17:49 UTC: Service Control, binārais fails, kas apstiprina katru Google Cloud API pieprasījumu, nolasa kvotu politikas izmaiņas ar "neparedzētiem tukšiem laukiem", saskaras ar koda ceļu, kas tika piegādāts divas nedēļas agrāk bez nulles pārbaudes un bez funkciju karodziņa, un nonāk avārijas ciklā katrā reģionā — rinda bija replicēta globāli dažu sekunžu laikā. Ārējie API atgriež 503 trīs stundas; us-central1 aizņem 2 h 40 min, jo pārstartēšanas uzdevumi pārpludina to pašu Spanner tabulu bez nejaušas atkāpes. Trīs minūtes pēc Google pārtraukuma, Cloudflare Workers KV — kura patiesības avots atrodas "trešās puses mākoņpakalpojumu sniedzējā" — zaudē 90 % pieprasījumu, un Access, WARP, Workers AI, Pages, Stream un Turnstile nokrīt līdz ar to uz 2 h 28 min. Google statusa lapa publicē savu pirmo atjauninājumu stundu vēlāk, jo tā darbojas Google Cloud.
Lasiet rakstisko izdevumu (angļu valodā) ↗
Ko aptver šis video
- Tukšs lauks, nulles rādītājs, katrs reģions
- Laika skala: 29. maijs → 17:45 → avārijas cikls → sarkana poga → 17:52 Cloudflare
- us-central1: ganāmpulka efekts
- Mehānisms: pārbaude pieprasījuma ceļā, globāla replikācija, viens piegādātājs
- git blame — sadalījums
Tulkotais transkripts
Tulkojums no oriģinālā angļu stāstījuma. Pieejamais audio un subtitri tiek kontrolēti no YouTube.
Tukšs lauks, nulles rādītājs, katrs reģions
0:00 Politikas rinda ar tukšiem laukiem saskaras ar nulles rādītāju, un Google Cloud avarē visos reģionos vienlaicīgi — un Cloudflare nokrīt līdz ar to, pēc tam sauc Google par "trešās puses pakalpojumu sniedzēju". 2025. gada 12. jūnijs, 17:49 UTC. Google ziņojums: Service Control, binārais fails, kas apstiprina katru API pieprasījumu, avārijas ciklā trīs stundas. Cloudflare, tajā pašā vakarā: Workers KV, deviņdesmit procenti neveiksmīgi, divas stundas divdesmit astoņas minūtes.
0:23 Kā tas notika, kāpēc viens tukšs lauks kļuva globāls dažu sekunžu laikā, un kurš ir vainīgs. Šis ir The Daily Diff, pēc nāves analīze. 29. maijs. Service Control saņem jaunu kvotu pārbaudi, piegādāta pa reģioniem ar
Laika skala: 29. maijs → 17:45 → avārijas cikls → sarkana poga → 17:52 Cloudflare
0:35 sarkanu pogu — bet jaunais koda ceļš nekad nedarbojas ieviešanas laikā; nekas to vēl neiedarbina. Nav nulles pārbaudes. Nav funkciju karodziņa. 17:45. Politikas izmaiņas ar tukšiem laukiem nonāk Spanner tabulā. Kvota ir globāla, tāpēc rinda replicējas visur dažu sekunžu laikā. Katrs Service Control binārais fails to nolasa, saskaras ar nulles rādītāju, avarē, restartējas, nolasa to vēlreiz. Katrs API zvans: 503.
0:55 Google ir ātra: šķirošana divās minūtēs, pamatcēlonis desmit. Sarkana poga tiek izslēgta četrdesmit minūtēs, un mazie reģioni atjaunojas pirmie. Statusa lapa publicē savu pirmo atjauninājumu stundu vēlāk, jo tā darbojas Google Cloud. 17:52. Cloudflare WARP komanda redz, ka jaunas ierīces nespēj reģistrēties. Workers KV, krātuve, ko puse Cloudflare izmanto konfigurācijai un identitātei, dzīvo trešās puses mākonī. Access neizdodas katru pieteikšanos — pēc dizaina tas neizdodas aizvērtā veidā.
1:20 Workers AI neizdodas katrs secinājums. 19:11, Gergely Orosz: divi neatkarīgi mākoņi vienlaicīgi nedarbojas, nekad nav redzēts iepriekš. 19:32, Google atbalsts paziņo lietotājam, ka nav zināmu traucējumu — mēģiniet notīrīt sīkdatnes. Visur citur atjaunojas līdz 19:48.
us-central1: ganāmpulka efekts
1:34 us-central1 neizdodas: restartējošie uzdevumi pārpludina to pašu Spanner tabulu, nav nejaušas atkāpes, tāpēc Google tos manuāli ierobežo. Divas stundas četrdesmit minūtes. Viens: politikas pārbaude atrodas pieprasījuma ceļā; kad pārbaude sabojājas,
Mehānisms: pārbaude pieprasījuma ceļā, globāla replikācija, viens piegādātājs
1:46 API sabojājas. Divi: kvotu dati kļūst globāli bez testēšanas; slikta rinda ir globāla rinda. Trīs: Cloudflare zināja. Workers KV bija migrācijas vidū uz savu R2, līdz vienam pakalpojumu sniedzējam — pēc nāves analīze to sauc par pārklājuma trūkumu.
git blame — sadalījums
2:00 git blame. Google, piecdesmit pieci procenti: nav nulles pārbaudes, nav funkciju karodziņa, nav atkāpes — viņu ziņojumā teikts, ka karodziņš to būtu atklājis testēšanas laikā. Globāla replikācija, divdesmit: viena rinda, katrs reģions, sekundēs. Cloudflare, divdesmit: puse produktu līnijas pie viena piegādātāja veikala, un pēc nāves analīze, kurā nekad nav teikts Google. Statusa lapa, pieci, par dzīvošanu tajā, par ko tā ziņo. Sprādziena rādiuss: septiņdesmit Google Cloud produkti, desmit Workspace lietotnes,
Sprādziena rādiuss
2:23 katrs reģions. Trīs stundas. Cloudflare: Access, WARP, Workers AI, Pages, Stream — divas ar pusi. Hacker News, četrpadsmit simti punktu; augšējais komentārs: statusa lapa ir zaļa.
Spriedums + pirmdienas rinda
2:33 Spriedums, pēc nāves analīze: SHIP IT. Abas pēc nāves analīzes nonāk trīsdesmit stundu laikā, abas vaino sevi, un Google labojumi ir konkrēti: atvērta kļūda, karodziņi pēc noklusējuma izslēgti, eksponenciāla atkāpe. Pirmdienas rinda: jauns kods aiz karodziņa, kas tiek izsūtīts izslēgts, un nulles pārbaude, kur dati ienāk. Nosūtiet man incidentu, par kuru joprojām nedrīkstat runāt, komentāros vai vietnē the daily diff dot dev. Un tas ir šodienas atšķirība.
2:53 Esmu Niko no Axrisi. Apvienojiet atbildīgi.
Avoti
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



