Kỹ sư Google rút toàn bộ cáp quang khiến một phần G-Cloud sập: Bài học RTFM ở quy mô siêu lớn

04 tháng 9, 2026·3 phút đọc

Một sự cố mất kết nối nghiêm trọng tại khu vực us-central1-b của Google Cloud xảy ra do một kỹ sư đã vô tình rút toàn bộ sợi cáp quang trong quá trình bảo trì phần cứng, vô hiệu hóa mọi cơ chế dự phòng. Sự cố kéo dài hơn 4 giờ, làm gián đoạn nghiêm trọng dịch vụ và làm dấy lên bài học về việc tuân thủ quy trình vận hành ngay cả ở những hệ thống hạ tầng lớn nhất.

Kỹ sư Google rút toàn bộ cáp quang khiến một phần G-Cloud sập: Bài học RTFM ở quy mô siêu lớn

Google Cloud vừa phải công khai lý do đầy bối rối cho sự cố mất kết nối một phần tại khu vực us-central1-b trong tuần này: một kỹ sư đã rút phích cắm của chúng. Sự cố kéo dài từ 07:41 đến 11:52 theo giờ Thái Bình Dương vào ngày 1 tháng 9 vừa qua, khiến một phần khu vực G-Cloud gặp phải tình trạng "suy giảm mạng nghiêm trọng và cô lập tài nguyên." Theo báo cáo tình trạng dịch vụ của Google, "tỷ lệ giảm lưu lượng truy cập đối với các tài nguyên trong khu vực bị ảnh hưởng đạt 100% vào thời điểm đỉnh điểm của sự cố, khiến các máy ảo không thể truy cập và gây ra tình trạng mất gói dữ liệu cao."

Nguyên nhân: Làm đúng quy trình nhưng sai quy trình

Báo cáo nguyên nhân gốc ban đầu giải thích rằng Google thiết kế các trung tâm dữ liệu đám mây của mình với cơ chế "dự phòng trên nhiều thiết bị định tuyến."

Hệ thống được thiết kế để chịu được mọi lỗi đơn lẻ của thiết bị hoặc đường truyền, và hầu hết các trường hợp lỗi kép hoặc lỗi ba đều không ảnh hưởng đến lưu lượng khách hàng. Để đảm bảo điều này, các thiết bị và đường truyền sợi quang được tách biệt về mặt vật lý trong mỗi trung tâm dữ liệu, với các nguồn điện đa dạng.

Nhưng có thể vượt qua tất cả sự dự phòng đó bằng cách... rút toàn bộ dây cáp.

"Nguyên nhân kỹ thuật trực tiếp của sự kiện này là việc ngắt kết nối vật lý ngoài ý muốn của các sợi cáp quang mạng trong quy trình bảo trì phần cứng định kỳ," Google giải thích.

"Một lỗi quy trình đã khiến hành động bảo trì vật lý lần lượt rút 100% các đường truyền sợi quang trên tất cả thiết bị trong vòng 13 phút. Bản chất của lỗi, kết hợp với tốc độ thao tác, khiến các cảnh báo về hành động sai không đến được kỹ sư kịp thời trước khi ngắt kết nối hoàn toàn."

Hậu quả và cách khắc phục

Sau khi kỹ sư ngắt kết nối các bộ định tuyến, các máy ảo trong một vùng của us-central1-b mất hoàn toàn liên lạc với thế giới bên ngoài. Chúng vẫn có thể liên lạc với nhau, nhưng người dùng không thể truy cập để kiểm tra tình trạng hệ thống.

Sau khi Google phát hiện sự cố, họ đã chuyển lưu lượng đi khỏi các bộ định tuyến bị ngắt kết nối. Các biện pháp dự phòng hoạt động khi lưu lượng truy cập tự động chuyển sang "các dung lượng khỏe mạnh ở nơi khác trong khu vực."

Trong khi đó, các kỹ thuật viên đã xác định và "cắm lại các sợi cáp quang bị đứt". Khi các kết nối vật lý được khôi phục hoàn toàn, lưu lượng truy cập trở lại bình thường.

Bài học: RTFM ở quy mô siêu lớn

Theo tìm hiểu của The Register, các công ty như Google thường tạo ra các quy trình chi tiết để bảo trì hạ tầng an toàn, và kỹ thuật viên phải tuân thủ nghiêm ngặt. Vì vậy, có vẻ kỹ sư rút cáp đã không tuân thủ một trong những nguyên tắc cơ bản nhất của ngành công nghệ: RTFM (Read The F*cking Manual).

Với người dùng doanh nghiệp Việt Nam đang sử dụng Google Cloud, sự cố này là lời nhắc nhở quan trọng về việc luôn cần có chiến lược đa vùng (multi-region)đa nhà cung cấp (multi-cloud) để đảm bảo tính liên tục của dịch vụ, bởi ngay cả nhà cung cấp hạ tầng lớn nhất cũng có thể gặp sự cố từ những lỗi "con người" đơn giản nhất.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗