Google Cloud kraschade på ett tomt fält. Tre timmar.
En policyrad med några tomma fält träffar en nullpekare, och Google Cloud kraschar i varje region samtidigt — sedan faller Cloudflare med det.
En policyrad med några tomma fält träffar en nullpekare, och Google Cloud kraschar i varje region samtidigt — sedan faller Cloudflare med det. 12 juni 2025, 17:49 UTC: Service Control, den binära fil som godkänner varje Google Cloud API-förfrågan, läser en kvotpolicyändring med "oavsiktligt tomma fält", träffar en kodväg som lanserats två veckor tidigare utan nullkontroll och utan funktionsflagga, och går in i en kraschloop i varje region — raden hade replikerats globalt inom sekunder. Externa API:er returnerar 503 i tre timmar; us-central1 tar 2 h 40 min eftersom de omstartande uppgifterna stormar samma Spanner-tabell utan slumpmässig backoff. Tre minuter in i Googles avbrott förlorar Cloudflares Workers KV — vars "källa till sanning" ligger hos "en tredjeparts molnleverantör" — 90 % av förfrågningarna, och Access, WARP, Workers AI, Pages, Stream och Turnstile går ner med det i 2 h 28 min. Googles statussida publicerar sin första uppdatering en timme för sent, eftersom den körs på Google Cloud.
Läs den skrivna upplagan (engelska) ↗
Vad den här videon täcker
- Ett tomt fält, en nullpekare, varje region
- Tidslinje: 29 maj → 17:45 → kraschloop → röd knapp → 17:52 Cloudflare
- us-central1: flockeffekten
- Mekanism: kontroll i begäransvägen, global replikering, en leverantör
- git blame — uppdelningen
Översatt transkription
Översatt från den ursprungliga engelska berättelsen. Tillgängligt ljud och undertexter styrs av YouTube.
Ett tomt fält, en nullpekare, varje region
0:00 En policyrad med tomma fält träffar en nullpekare, och Google Cloud kraschar i varje region samtidigt — och Cloudflare faller med det, och kallar sedan Google "en tredjepartsleverantör". 12 juni 2025, 17:49 UTC. Googles rapport: Service Control, den binära fil som godkänner varje API-förfrågan, i en kraschloop i tre timmar. Cloudflares, samma kväll: Workers KV, nittio procent misslyckas, två timmar tjugoåtta minuter.
0:23 Hur det hände, varför ett tomt fält blev globalt på sekunder, och vem som får skulden. Detta är The Daily Diff, postmortem. 29 maj. Service Control får en ny kvotkontroll, lanseras region för region med en
Tidslinje: 29 maj → 17:45 → kraschloop → röd knapp → 17:52 Cloudflare
0:35 röd knapp — men den nya kodvägen körs aldrig under utrullningen; inget triggar den ännu. Ingen nullkontroll. Ingen funktionsflagga. 17:45. En policyändring med tomma fält landar i Spanner-tabellen. Kvoten är global, så raden replikeras överallt inom sekunder. Varje Service Control-binär läser den, träffar nullpekaren, kraschar, startar om, läser den igen. Varje API-anrop: 503.
0:55 Google är snabb: triage på två minuter, grundorsak på tio. Den röda knappen är ute på fyrtio, och små regioner återhämtar sig först. Statussidan publicerar sin första uppdatering en timme senare, eftersom den körs på Google Cloud. 17:52. Cloudflares WARP-team ser nya enheter misslyckas med att registrera sig. Workers KV, lagret som hälften av Cloudflare använder för konfiguration och identitet, ligger på ett tredjeparts moln. Access misslyckas med varje inloggning — avsiktligt, den misslyckas stängd.
1:20 Workers AI misslyckas med varje inferens. 19:11, Gergely Orosz: två oberoende moln nere samtidigt, aldrig sett förut. 19:32, Googles support säger till en användare att det inte finns några kända störningar — försök rensa dina cookies. Överallt annars återhämtar sig vid 19:48.
us-central1: flockeffekten
1:34 us-central1 gör det inte: omstartande uppgifter stormar samma Spanner-tabell, ingen slumpmässig backoff, så Google stryper dem för hand. Två timmar fyrtio minuter. Ett: policykontrollen sitter inuti begäransvägen; när kontrollen dör,
Mekanism: kontroll i begäransvägen, global replikering, en leverantör
1:46 dör API:et. Två: kvotdata blir globala utan staging; en dålig rad är en global rad. Tre: Cloudflare visste. Workers KV var mitt i migreringen till sitt eget R2, ner till en leverantör — postmortem kallar det ett glapp i täckningen.
git blame — uppdelningen
2:00 git blame. Google, femtiofem procent: ingen nullkontroll, ingen funktionsflagga, ingen backoff — deras rapport säger att en flagga skulle ha fångat det i staging. Global replikering, tjugo: en rad, varje region, sekunder. Cloudflare, tjugo: halva en produktlinje på en leverantörs butik, och en postmortem som aldrig nämner Google. Statussidan, fem, för att leva på det den rapporterar om. Påverkansområde: sjuttio Google Cloud-produkter, tio Workspace-appar,
Påverkansområde
2:23 varje region. Tre timmar. Hos Cloudflare: Access, WARP, Workers AI, Pages, Stream — två och en halv. Hacker News, fjortonhundra poäng; toppkommentar: statussidan är grön.
Dom + måndagsregeln
2:33 Dom, postmortem: SHIP IT. Båda postmortem landar inom trettio timmar, båda skyller på sig själva, och Googles korrigeringar är konkreta: misslyckas öppet, flaggor avstängda som standard, exponentiell backoff. Måndagsregeln: ny kod bakom en flagga som levereras avstängd, och en nullkontroll där datan kommer in. Skicka mig incidenten du fortfarande inte får prata om, i kommentarerna, eller på the daily diff dot dev. Och det var The Daily Diff för idag.
2:53 Jag är Niko från Axrisi. Merge responsibly.
Källor
- Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
- Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
- Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
- Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
- @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
- Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
- Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
- Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
- Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com



