Facebook ลบตัวเองออกจากอินเทอร์เน็ต หกชั่วโมง
Facebook ลบที่อยู่ของตัวเองออกจากอินเทอร์เน็ต และเมื่อวิศวกรของบริษัทมาถึงเพื่อกู้คืน ระบบอ่านบัตรก็ใช้งานไม่ได้เช่นกัน เพราะทำงานบน Facebook 4 ตุลาคม 2021, 15:40 UTC: คำสั่งบำรุงรักษาโครงข่ายหลักตามปกติทำให้ลิงก์ทั้งหมดระหว่างศูนย์ข้อมูลของ Facebook ล่ม เครื่องมือตรวจสอบที่สร้างขึ้นเพื่อบล็อกคำสั่งนี้มีข้อบกพร่อง; เซิร์ฟเวอร์ชื่อของ Facebook ซึ่งไม่สามารถเข้าถึงศูนย์ข้อมูลได้ ถอนเส้นทาง BGP ของตัวเองตามการออกแบบ และ facebook.com, Instagram, WhatsApp และ Messenger หายไปจาก DNS เป็นเวลาเกือบหกชั่วโมง เครื่องมือภายใน การเข้าถึงแบบ out-of-band และบัตรประจำสำนักงานใช้เครือข่ายเดียวกัน ดังนั้นการแก้ไขจึงต้องให้คนไปที่แร็ค
Facebook ลบที่อยู่ของตัวเองออกจากอินเทอร์เน็ต และเมื่อวิศวกรของบริษัทมาถึงเพื่อกู้คืน ระบบอ่านบัตรก็ใช้งานไม่ได้เช่นกัน เพราะทำงานบน Facebook 4 ตุลาคม 2021, 15:40 UTC: คำสั่งบำรุงรักษาโครงข่ายหลักตามปกติทำให้ลิงก์ทั้งหมดระหว่างศูนย์ข้อมูลของ Facebook ล่ม เครื่องมือตรวจสอบที่สร้างขึ้นเพื่อบล็อกคำสั่งนี้มีข้อบกพร่อง; เซิร์ฟเวอร์ชื่อของ Facebook ซึ่งไม่สามารถเข้าถึงศูนย์ข้อมูลได้ ถอนเส้นทาง BGP ของตัวเองตามการออกแบบ และ facebook.com, Instagram, WhatsApp และ Messenger หายไปจาก DNS เป็นเวลาเกือบหกชั่วโมง เครื่องมือภายใน การเข้าถึงแบบ out-of-band และบัตรประจำสำนักงานใช้เครือข่ายเดียวกัน ดังนั้นการแก้ไขจึงต้องให้คนไปที่แร็ค
อ่านฉบับลายลักษณ์อักษร (ภาษาอังกฤษ) ↗
วิดีโอนี้ครอบคลุมอะไรบ้าง
- Facebook ลบที่อยู่ของตัวเอง
- หลักฐาน: Meta Engineering, Cloudflare, Hacker News
- นี่คือ The Daily Diff, รายงานหลังเหตุการณ์
- ไทม์ไลน์: 15:39 คำสั่ง → 15:40 ถอน → 21:20 กลับมา
- กลไก: การตรวจสอบสุขภาพที่ลบคุณ, พายุ DNS 30 เท่า, ประตู
บทถอดเสียงที่แปลแล้ว
แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube
Facebook ลบที่อยู่ของตัวเอง
0:00 Facebook ลบที่อยู่ของตัวเองออกจากอินเทอร์เน็ต และเมื่อวิศวกร มาถึงเพื่อกู้คืน ระบบอ่านบัตรก็ใช้งานไม่ได้เช่นกัน เพราะทำงานบน Facebook รายงานหลังเหตุการณ์ของ Meta เองในวันถัดมา: คำสั่งบำรุงรักษาตามปกติทำให้ ลิงก์โครงข่ายหลักทั้งหมดล่ม และเครื่องมือที่สร้างขึ้นเพื่อบล็อกคำสั่งเช่นนั้นมีข้อบกพร่อง
หลักฐาน: Meta Engineering, Cloudflare, Hacker News
0:16 Cloudflare, จากภายนอก: เวลา 15:40 UTC เส้นทางไปยังเซิร์ฟเวอร์ชื่อของ Facebook หายไป และ dig facebook.com ส่งคืน SERVFAIL ทุกที่ทั่วโลก มันเกิดขึ้นได้อย่างไร ทำไมคุณสมบัติด้านความปลอดภัยถึงทำให้แย่ลง และใครต้องรับผิดชอบ นี่คือ The Daily Diff, รายงานหลังเหตุการณ์ ช่วงบ่ายต้นๆ, UTC
นี่คือ The Daily Diff, รายงานหลังเหตุการณ์
0:34 คำสั่งที่ตั้งใจจะตรวจสอบความจุโครงข่ายหลักที่ว่างอยู่กลับทำให้ลิงก์ทุกจุด ระหว่างศูนย์ข้อมูลของ Facebook ล่ม และเครื่องมือตรวจสอบที่สร้างขึ้นเพื่อจับสิ่งนี้โดยเฉพาะ
ไทม์ไลน์: 15:39 คำสั่ง → 15:40 ถอน → 21:20 กลับมา
0:41 ปล่อยให้ผ่านไป 15:40. ฟีด BGP ของ Cloudflare เต็มไปด้วยการถอนเส้นทาง; คำนำหน้า DNS ของ Facebook ออกจากตารางการกำหนดเส้นทาง ภายในหนึ่งนาที วิศวกรของ Cloudflare ก็อยู่ในห้องสงสัยว่าพวกเขา ทำ 1.1.1.1 เสียหรือไม่ 15:45, Hacker News, สองพันหกร้อย คะแนน 16:07, โฆษกของ Facebook, บน Twitter: ผู้ใช้บางราย มีปัญหาในการเข้าถึงแอปของเรา บางคนคือสามพันห้าร้อยล้านคน
1:06 18:51, The New York Times: พนักงานถูกล็อกอยู่นอกอาคาร บัตรใช้งานไม่ได้ 19:52, CTO ขอโทษ 21:00, ห้าชั่วโมงผ่านไป, เส้นทางกลับมา; 21:20, facebook.com แก้ไขได้ ทำไมข้อผิดพลาดของโครงข่ายหลักถึงลบ Facebook ออกจากอินเทอร์เน็ต
กลไก: การตรวจสอบสุขภาพที่ลบคุณ, พายุ DNS 30 เท่า, ประตู
1:20 เซิร์ฟเวอร์ชื่อของบริษัทมีกฎ: ไม่สามารถเข้าถึงศูนย์ข้อมูลได้ ประกาศว่าตัวเองไม่สมบูรณ์ หยุดโฆษณาที่อยู่ของคุณ สมเหตุสมผลเมื่อไซต์หนึ่งเสีย เมื่อโครงข่ายหลักทั้งหมดเสีย เซิร์ฟเวอร์ชื่อทุกเครื่องก็ทำพร้อมกัน เซิร์ฟเวอร์ยังคงทำงานอยู่ ไม่มีใครหาเจอ คุณสมบัติความปลอดภัยเปลี่ยนข้อผิดพลาดของเครือข่ายเป็นข้อผิดพลาดของการมีอยู่ จากนั้นอินเทอร์เน็ตก็พยายามเชื่อมต่อ: แอปพยายามใหม่, ผู้ใช้โหลดซ้ำ
1:39 และตัวแก้ไข DNS ของ Cloudflare เห็นโหลดมากกว่าปกติสามสิบเท่า สำหรับไซต์ที่ไม่มีอยู่ และประตู เครื่องมือ, การเข้าถึงแบบ out-of-band, บัตร: เครือข่ายเดียวกัน วิศวกรขับรถไปที่ศูนย์ข้อมูล เข้าไม่ได้ จากนั้นก็เจอแร็คที่แข็งแรง ป้องกันใครก็ตามที่เข้าถึงทางกายภาพ สร้างขึ้นเพื่อชะลอผู้โจมตี มันก็ชะลอเจ้าของด้วย โครงข่ายหลักกลับมา; พวกเขาค่อยๆ เพิ่มปริมาณการรับส่งข้อมูลอย่างตั้งใจ
1:59 แต่ละศูนย์ข้อมูลได้ลดพลังงานลงหลายสิบเมกะวัตต์ และการกลับมาในคราวเดียว คือการหยุดชะงักครั้งที่สอง
git blame — การแบ่งส่วน
2:05 git blame. Facebook, ห้าสิบห้าเปอร์เซ็นต์: คำสั่งถูกตรวจสอบแล้ว ผู้ตรวจสอบมีข้อบกพร่อง คำสั่งเดียวส่งผลต่อเราเตอร์ทุกตัว การออกแบบ DNS, ยี่สิบห้าเปอร์เซ็นต์: การตรวจสอบสุขภาพที่ไม่มีความรู้สึกสมดุล เครือข่ายเดียว, สิบห้าเปอร์เซ็นต์: เครื่องมือ, out-of-band, บัตร แร็ค, ห้าเปอร์เซ็นต์, สำหรับการทำงานของมัน รัศมีผลกระทบ: ผู้ใช้สามพันห้าร้อยล้านคน, เกือบหกชั่วโมง หุ้นปิดลดลงห้าเปอร์เซ็นต์, Zuckerberg เสียหกพันล้าน
รัศมีผลกระทบ
2:27 บนกระดาษ Telegram อ้างว่ามีผู้สมัครสมาชิกเจ็ดสิบล้านคนในวันนั้น คำตัดสิน, รายงานหลังเหตุการณ์: NEEDS REVIEW แถลงการณ์ในคืนเดียวกัน, รายงานหลังเหตุการณ์โดยผู้เขียนระบุชื่อภายในหนึ่งวัน ยอมรับข้อบกพร่องของเครื่องมือตรวจสอบด้วยภาษาอังกฤษง่ายๆ
คำตัดสิน + แผนงานวันจันทร์
2:38 รายการแก้ไข: เสริมสร้างการทดสอบและการฝึกซ้อม ไม่มีอะไรเกี่ยวกับการถอดประตูออกจากเครือข่ายการผลิต วันจันทร์: นำการเข้าถึงแบบ out-of-band และประตูของคุณ ไปไว้บนเครือข่ายที่คุณไม่ได้ ดำเนินการ ส่งเหตุการณ์ที่คุณยังไม่ได้รับอนุญาตให้พูดถึงให้ฉัน ในความคิดเห็น หรือที่ the daily diff dot dev และนั่นคือ The Daily Diff สำหรับวันนี้ ฉันชื่อ Niko จาก Axrisi
2:58 SHIP IT อย่างรับผิดชอบ
แหล่งที่มา
- Meta Engineering, "More details about the October 4 outage" (Santosh Janardhan, Oct 5, 2021)engineering.fb.com
- Meta Engineering, "Update about the October 4th outage" (Oct 4, 2021)engineering.fb.com
- Cloudflare, "Understanding how Facebook disappeared from the Internet" (Oct 4, 2021)blog.cloudflare.com
- Mark Zuckerberg, note to employees (Oct 5, 2021)www.facebook.com
- Andy Stone (Facebook), 16:07 UTCtwitter.com
- Sheera Frenkel (NYT), 18:51 UTC, the badgestwitter.com
- Mike Schroepfer (Facebook CTO), 19:52 UTCtwitter.com
- Hacker News (2,589 points)news.ycombinator.com
- The New York Times, "Gone in Minutes, Out for Hours"www.nytimes.com
- Forbes, "Zuckerberg Loses $5.9B in a Day" (estimate)www.forbes.com
- Reuters, Telegram's 70 million sign-ups (Durov's figure)www.reuters.com
- Krebs on Securitykrebsonsecurity.com



