+− THE DAILY DIFFdev & AI news
SHIP IT

Google Cloud va caure en un camp en blanc. Tres hores.

Una fila de política amb alguns camps en blanc va provocar un punter nul, i Google Cloud va caure en totes les regions alhora —aleshores Cloudflare va caure amb ell.

Una fila de política amb alguns camps en blanc va provocar un punter nul, i Google Cloud va caure en totes les regions alhora —aleshores Cloudflare va caure amb ell. 12 de juny de 2025, 17:49 UTC: Service Control, el binari que aprova cada sol·licitud d'API de Google Cloud, llegeix un canvi de política de quota amb "camps en blanc no intencionats", topa amb un camí de codi enviat dues setmanes abans sense comprovació de nul·litat ni bandera de característica, i entra en un bucle de fallada a totes les regions —la fila s'havia replicat globalment en segons. Les API externes retornen 503 durant tres hores; us-central1 triga 2 h 40 min perquè les tasques de reinici s'abalancen sobre la mateixa taula de Spanner sense retrocés aleatori. Tres minuts després de la interrupció de Google, Workers KV de Cloudflare —la font de veritat del qual resideix en "un proveïdor de núvol de tercers"— perd el 90 % de les sol·licituds, i Access, WARP, Workers AI, Pages, Stream i Turnstile cauen amb ell durant 2 h 28 min. La pàgina d'estat de Google publica la seva primera actualització una hora tard, perquè s'executa a Google Cloud.

Llegeix l'edició escrita (anglès) ↗

Què cobreix aquest vídeo

  • Un camp en blanc, un punter nul, totes les regions
  • Cronologia: 29 de maig → 17:45 → bucle de fallada → botó vermell → 17:52 Cloudflare
  • us-central1: l'efecte ramat
  • Mecanisme: comprovació al camí de sol·licitud, replicació global, un proveïdor
  • git blame — la divisió

Transcripció traduïda

Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.

Un camp en blanc, un punter nul, totes les regions

0:00 Una fila de política amb camps en blanc provoca un punter nul, i Google Cloud cau a totes les regions alhora — i Cloudflare cau amb ell, aleshores anomena Google "un proveïdor de tercers". 12 de juny de 2025, 17:49 UTC. Informe de Google: Service Control, el binari que aprova cada sol·licitud d'API, en un bucle de fallada durant tres hores. El de Cloudflare, la mateixa nit: Workers KV, noranta per cent fallant, dues hores vint-i-vuit.

0:23 Com va passar, per què un camp en blanc va anar global en segons, i qui té la culpa. Això és The Daily Diff, postmortem. 29 de maig. Service Control rep una nova comprovació de quota, enviada regió per regió amb un

Cronologia: 29 de maig → 17:45 → bucle de fallada → botó vermell → 17:52 Cloudflare

0:35 botó vermell — però el nou camí de codi mai s'executa durant el desplegament; res el activa encara. Sense comprovació de nul·litat. Sense bandera de característica. 17:45. Un canvi de política amb camps en blanc aterra a la taula de Spanner. La quota és global, així que la fila es replica a tot arreu en segons. Cada binari de Service Control el llegeix, topa amb el punter nul, cau, es reinicia, el llegeix de nou. Cada trucada d'API: 503.

0:55 Google és ràpid: triatge en dos minuts, causa arrel en deu. El botó vermell es prem en quaranta, i les regions petites es recuperen primer. La pàgina d'estat publica la seva primera actualització una hora més tard, perquè s'executa a Google Cloud. 17:52. L'equip de WARP de Cloudflare veu que els nous dispositius no es registren. Workers KV, la botiga que la meitat de Cloudflare utilitza per a la configuració i la identitat, resideix en un núvol de tercers. Access falla cada inici de sessió — per disseny, falla tancat.

1:20 Workers AI falla cada inferència. 19:11, Gergely Orosz: dos núvols independents caiguts alhora, mai vist abans. 19:32, el suport de Google informa a un usuari que no hi ha interrupcions conegudes — proveu d'esborrar les vostres galetes. Tota la resta es recupera a les 19:48.

us-central1: l'efecte ramat

1:34 us-central1 no ho fa: les tasques de reinici s'abalancen sobre la mateixa taula de Spanner, sense retrocés aleatori, així que Google les limita manualment. Dues hores quaranta. Un: la comprovació de la política es troba dins del camí de sol·licitud; quan la comprovació mor,

Mecanisme: comprovació al camí de sol·licitud, replicació global, un proveïdor

1:46 l'API mor. Dos: les dades de quota es globalitzen sense preparació; una fila dolenta és una fila global. Tres: Cloudflare ho sabia. Workers KV estava en plena migració cap al seu propi R2, amb un sol proveïdor — el postmortem ho anomena una bretxa de cobertura.

git blame — la divisió

2:00 git blame. Google, cinquanta-cinc per cent: sense comprovació de nul·litat, sense bandera de característica, sense retrocés — el seu informe diu que una bandera ho hauria detectat a l'etapa de prova. Replicació global, vint: una fila, cada regió, segons. Cloudflare, vint: la meitat d'una línia de productes en la botiga d'un sol proveïdor, i un postmortem que mai diu Google. La pàgina d'estat, cinc, per viure del que informa. Radi d'explosió: setanta productes de Google Cloud, deu aplicacions de Workspace,

Radi d'explosió

2:23 totes les regions. Tres hores. A Cloudflare: Access, WARP, Workers AI, Pages, Stream — dues i mitja. Hacker News, mil quatre-cents punts; comentari principal: la pàgina d'estat està verda.

Verdicte + la línia de dilluns

2:33 Verdicte, postmortem: SHIP IT. Ambdós postmortems aterren en trenta hores, ambdós es culpen a si mateixos, i les solucions de Google són concretes: FAIL OPEN, flags OFF BY DEFAULT, BACKOFF EXPONENTIAL. La línia de dilluns: nou codi darrere d'una bandera que s'envia apagada, i una comprovació de nul·litat on entren les dades. Envieu-me l'incident del qual encara no podeu parlar, als comentaris, o a the daily diff dot dev. I això és el diff per avui.

2:53 Sóc Niko d'Axrisi. Fusioneu amb responsabilitat.

Fonts

  1. Google Cloud Service Health, Incident Report (Jun 13, 2025) + Mini Incident Report (Jun 12)status.cloud.google.com
  2. Cloudflare, "Cloudflare service outage June 12, 2025" (Jun 12, 2025, 22:00 UTC)blog.cloudflare.com
  3. Cloudflare Status, "Broad Cloudflare service outages" (18:19–21:31 UTC)www.cloudflarestatus.com
  4. Gergely Orosz, 19:11 UTC, "Their infra is fully independent AFAIK"x.com
  5. @Google support, 19:32 UTC, "there aren't any known service disruptions"x.com
  6. Thomas Kurian (Google Cloud CEO), Jun 13 01:35 UTCx.com
  7. Hacker News, "GCP Outage" (1,468 points)news.ycombinator.com
  8. Hacker News, "Cloudflare was down" (341 points)news.ycombinator.com
  9. Hacker News, "Google Cloud Incident Report – 2025-06-13" (209 points)news.ycombinator.com

Vídeos relacionats