+− THE DAILY DIFFdev & AI news
SHIP IT

A Google Cloud összeomlott egy üres mezőn. Három óra.

Egy néhány üres mezőt tartalmazó házirend-sor null mutatóra fut, és a Google Cloud egyszerre minden régióban összeomlik – majd a Cloudflare is vele együtt.

Egy néhány üres mezőt tartalmazó házirend-sor null mutatóra fut, és a Google Cloud egyszerre minden régióban összeomlik – majd a Cloudflare is vele együtt. 2025. június 12., 17:49 UTC: A Service Control, az a bináris fájl, amely minden Google Cloud API-kérést jóváhagy, beolvas egy kvóta-házirend változást „nem szándékos üres mezőkkel”, egy két héttel korábban kiadott kódútvonalra fut, null ellenőrzés és funkciójelző nélkül, és minden régióban összeomlási ciklusba kerül – a sor másodperceken belül globálisan replikálódott. A külső API-k 503-at adnak vissza három órán keresztül; az us-central1 2 óra 40 percig tart, mert az újrainduló feladatok ugyanazt a Spanner táblát rohanják meg, véletlenszerű késleltetés nélkül. A Google leállásának harmadik percében a Cloudflare Workers KV – amelynek igazságforrása egy „harmadik féltől származó felhőszolgáltatónál” található – a kérések 90%-át elveszíti, és az Access, WARP, Workers AI, Pages, Stream és Turnstile is leáll vele 2 óra 28 percre. A Google állapotoldala egy órával késve teszi közzé első frissítését, mert Google Cloudon fut.

Olvassa el az írott kiadást (angolul) ↗

Amit ez a videó tartalmaz

  • Egy üres mező, egy null mutató, minden régió
  • Idővonal: máj. 29 → 17:45 → összeomlási ciklus → piros gomb → 17:52 Cloudflare
  • us-central1: a „nyáj” hatás
  • Mechanizmus: ellenőrzés a kérés útvonalában, globális replikáció, egyetlen szolgáltató
  • git blame — az elválasztás

Lefordított átirat

Az eredeti angol narrációból fordítva. A rendelkezésre álló hangot és feliratokat a YouTube vezérli.

Egy üres mező, egy null mutató, minden régió

0:00 Egy üres mezőket tartalmazó házirend-sor null mutatóra fut, és a Google Cloud összeomlik egyszerre minden régióban – és a Cloudflare is vele együtt omlik össze, majd „harmadik fél szolgáltatónak” nevezi a Google-t. 2025. június 12., 17:49 UTC. A Google jelentése: Service Control, az a bináris, amely minden API-kérést jóváhagy, három órán keresztül összeomlási ciklusban. A Cloudflare-é, még aznap este: Workers KV, kilencven százalékban hibás, két óra huszonnyolc.

0:23 Hogyan történt, miért terjedt el másodpercek alatt egy üres mező globálisan, és ki a hibás. Ez a The Daily Diff, utólagos elemzés. Május 29. A Service Control új kvóta-ellenőrzést kap, régióról régióra terjesztve egy

Idővonal: máj. 29 → 17:45 → összeomlási ciklus → piros gomb → 17:52 Cloudflare

0:35 piros gombbal – de az új kódútvonal soha nem fut a bevezetés során; még semmi sem indítja el. Nincs null ellenőrzés. Nincs funkciójelző. 17:45. Egy üres mezőket tartalmazó házirend-változás landol a Spanner táblában. A kvóta globális, így a sor másodperceken belül mindenhol replikálódik. Minden Service Control bináris beolvassa, null mutatóra fut, összeomlik, újraindul, újra beolvassa. Minden API hívás: 503.

0:55 A Google gyors: két percen belül azonosítja a problémát, tíz percen belül a gyökérokot. A piros gomb negyven percen belül kint van, és a kisebb régiók először állnak helyre. Az állapotoldal egy órával később teszi közzé első frissítését, mert a Google Cloudon fut. 17:52. A Cloudflare WARP csapata azt látja, hogy új eszközök nem regisztrálnak. A Workers KV, a Cloudflare által konfigurációhoz és identitáshoz használt tárhely fele, egy harmadik féltől származó felhőben él. Az Access minden bejelentkezést elutasít – szándékosan, zárt hibát jelez.

1:20 A Workers AI minden következtetést elutasít. 19:11, Gergely Orosz: két független felhő egyszerre leállt, ilyet még sosem láttunk. 19:32, a Google ügyfélszolgálat azt mondja egy felhasználónak, hogy nincsenek ismert fennakadások – próbálja meg törölni a sütiket. Mindenhol máshol 19:48-ra helyreáll.

us-central1: a „nyáj” hatás

1:34 Az us-central1 nem: az újrainduló feladatok ugyanazt a Spanner táblát rohanják meg, nincs véletlenszerű késleltetés, így a Google kézzel szabályozza őket. Két óra negyven. Egy: a házirend-ellenőrzés a kérés útvonalában található; amikor az ellenőrzés meghal,

Mechanizmus: ellenőrzés a kérés útvonalában, globális replikáció, egyetlen szolgáltató

1:46 az API meghal. Kettő: a kvótaadatok globálissá válnak szakaszolás nélkül; egy rossz sor globális sor. Három: A Cloudflare tudta. A Workers KV épp migráció alatt állt a saját R2-jére, egy szolgáltatóra csökkenve – az utólagos elemzés „lefedettségi hiányosságnak” nevezi.

git blame — az elválasztás

2:00 git blame. Google, ötvenöt százalék: nincs null ellenőrzés, nincs funkciójelző, nincs késleltetés – jelentésük szerint egy jelző kiszűrte volna a tesztelés során. Globális replikáció, húsz: egy sor, minden régióban, másodpercek. Cloudflare, húsz: egy termékcsalád fele egyetlen szolgáltató tárhelyén, és egy utólagos elemzés, amely soha nem mondja ki a Google nevét. Az állapotoldal, öt, amiért azon él, amiről jelent. Kiterjedési sugar: hetven Google Cloud termék, tíz Workspace alkalmazás,

Kiterjedési sugar

2:23 minden régió. Három óra. A Cloudflare-nél: Access, WARP, Workers AI, Pages, Stream – kettő és fél. Hacker News, tizennégyezer pont; legnépszerűbb komment: az állapotoldal zöld.

Ítélet + a hétfői sor

2:33 Ítélet, utólagos elemzés: SHIP IT. Mindkét utólagos elemzés harminc órán belül elkészül, mindkettő magát hibáztatja, és a Google javításai konkrétak: fail open, jelzők alapértelmezés szerint kikapcsolva, exponenciális késleltetés. A hétfői sor: új kód egy jelző mögött, amely kikapcsolva van, és egy null ellenőrzés ott, ahol az adatok beérkeznek. Küldd el nekem az eseményt, amiről még mindig nem beszélhetsz, a kommentekben, vagy a daily diff dot dev címen. És ez a mai különbség.

2:53 Niko vagyok az Axrisitől. Egyesíts felelősségteljesen.

Források

  1. Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
  2. Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
  3. Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
  4. Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
  5. @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
  6. Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
  7. Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
  8. Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
  9. Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com

Kapcsolódó videók