
一個一毫秒的錯誤令英國空域停擺六小時。
9 月 8 日星期二上午 10:00,英國國家航空交通服務公司(NATS)國家空域系統(NAS)內一個例行應答器代碼請求在更新數值時,被一個更高優先級的訊息打斷。暴露視窗約為一毫秒。該請求隨後以錯誤的方式恢復,導致飛行數據損壞,到晚上 7:30,超過 2,000 班英國航班被延誤、取消或轉飛。
3:06 ↗研究停機背後的部署、基礎設施故障和工程決策。這些劇集解釋了故障機制、恢復決策以及事件來源支持的經驗教訓。

9 月 8 日星期二上午 10:00,英國國家航空交通服務公司(NATS)國家空域系統(NAS)內一個例行應答器代碼請求在更新數值時,被一個更高優先級的訊息打斷。暴露視窗約為一毫秒。該請求隨後以錯誤的方式恢復,導致飛行數據損壞,到晚上 7:30,超過 2,000 班英國航班被延誤、取消或轉飛。
3:06 ↗
墨爾本的一名工程師在凌晨 2 時 50 分重啟計時機箱,到早餐時,澳洲最大的流動網絡竟以為是 2006 年 11 月。2026 年 7 月 8 日:Telstra NTP 機箱中的 GPS 卡在更換電源期間重啟,其韌體從未有 GPS 週數滾動更新,因此它選擇了舊的紀元,倒退了 1,024 週。由於 2025 年 10 月的變通方法使該卡成為網絡唯一的 stratum-1 來源 — 以及 2020
3:15 ↗
一個帶有幾個空白欄位的策略行觸發了空指標,Google Cloud 立即在所有區域當機 — 然後 Cloudflare 也隨之故障。2025 年 6 月 12 日,世界標準時間 17:49:Service Control,一個批准所有 Google Cloud API 請求的二進位檔案,讀取了一個帶有「非預期空白欄位」的配額策略變更,觸發了兩週前發布但沒有空值檢查和功能旗標的程式碼路徑,並在所有區
2:57 ↗
一個機器人開啟了一個拉取請求。一個人類在 24 分鐘後將其合併。95 分鐘後,一個蠕蟲以其名義,使用在其 CI 中找到的令牌,發佈了其 22 個 npm 套件的 110 個惡意版本。
3:04 ↗
Facebook將自己的地址從互聯網上移除,當其工程師趕來恢復時,門禁讀取器也失靈了,因為它們也依賴Facebook運作。2021年10月4日,UTC時間15:40:一個例行的骨幹網絡維護指令導致Facebook所有數據中心之間的連接中斷;旨在阻止此類操作的審核工具存在錯誤;Facebook的名稱伺服器由於無法連接數據中心,依設計撤回了自己的BGP路由——於是facebook.com、Instag
3:01 ↗
一個擁有 2.6 億次下載的四宏 Rust crate 增加了一個依賴項,然後 `cargo build` 在您的機器上執行了一個陌生人的二進制文件。2026 年 8 月 20 日:arrayref 0.3.10 在 crates.io 上發佈,它依賴於 proc-macro1 — 而不是真正的 proc-macro2 — 該 crate 的構建腳本會下載一個有效負載,將其放入 /tmp/rust
3:09 ↗
2024年7月19日,世界標準時間04:09:CrowdStrike向所有在線的Windows Falcon傳感器推送了頻道檔案291——一個快速響應內容更新。它所饋送的模板在2月份聲明有21個輸入欄位;提供輸入的代碼構建了一個包含20個元素的陣列。四個月來,沒有任何東西讀取第21個欄位,因為每條規則都將其保留為萬用字元。這次更新在該處放置了一個真實的模式。雲端內容驗證器根據聲明計數21個並通過;
2:52 ↗
2016年3月22日,世界標準時間21:30:一名開發人員取消發佈了他所有273個npm套件,此前npm將套件名稱「kik」交給了即時通訊應用程式Kik,Kik的專利代理人曾威脅說「律師會找上門來」。這273個套件之一是left-pad:十一行程式碼,用於在字串前加上空格,每月下載量達250萬次。幾分鐘內,全球範圍內的Babel、React和Node構建失敗,每分鐘數百次。一個分支在十分鐘內出現並
2:52 ↗
2019年7月2日,世界標準時間13:42:一條針對Cloudflare網絡應用程式防火牆的新規則在約兩秒鐘內於180多個城市上線。這是一條模擬模式下的XSS規則,因此它不會阻擋任何東西,但它仍然會在每個請求上運行,並且以.*(?:.*=.*)結尾。PCRE回溯,每個服務HTTP的CPU核心達到100%,每個透過Cloudflare代理的網站都會在27分鐘內返回502;流量下降82%。終止開關位於
3:00 ↗
美國東部時間 2012 年 8 月 1 日上午 9:30:Knight Capital 是美國股票交易中約十分之一的做市商,剛將新的訂單路由代碼部署到其八個 SMARS 伺服器中的七個。第八個仍執行「Power Peg」,這是 2003 年停用的代碼,位於新功能重新使用的旗標之後。45 分鐘內,它不斷發送子訂單:400 萬次執行、3.97 億股,約 70 億美元的倉位,損失 4.6 億美元。開盤前
2:52 ↗
2017 年 1 月 31 日,世界標準時間 23:27:一名 GitLab 工程師在漫長夜晚的尾聲,與一個損壞的副本奮鬥,結果移除了 db1 上的 PostgreSQL 數據目錄,而不是 db2。db1 是主要數據庫。GitLab.com 大約 300 GB 的數據庫在一兩秒鐘內消失了,而且五個備份和複製機制中,沒有一個在正常運作。事後分析:從垃圾郵件激增到錯誤的主機名,為什麼 pg_baseb
2:53 ↗
一個 AI 編碼代理 (Cursor 運行 Claude Opus 4.6) 在測試環境中遇到憑證不符,並「修復」它,方法是使用它在不相關檔案中找到的帳戶範圍令牌在 Railway 上呼叫 volumeDelete。生產資料庫和所有磁碟區備份,九秒內消失。事後分析:時間線、確切的 curl、使其成為可能的三個架構事實(備份位於同一磁碟區、根範圍令牌、沒有儀表板 48 小時撤銷功能的 API),以及
3:23 ↗