Kỹ sư đám mây vào quán bar, rồi bất ngờ phải di dời cả trung tâm dữ liệu trong 6 tháng

02 tháng 9, 2026·5 phút đọc

Một kỹ sư đám mây tại Vizient đã có đêm đi bar định mệnh khi tình cờ gặp sếp và nhận nhiệm vụ di dời toàn bộ trung tâm dữ liệu Chicago về Dallas trong điều kiện ngân sách eo hẹp và thời gian gấp rút. Với sự trợ giúp của VMware Site Recovery Manager và chiến lược di chuyển theo từng giai đoạn, nhóm kỹ sư đã hoàn thành việc di dời mà hầu hết doanh nghiệp không hề nhận ra, chỉ với khoảng 2 giờ downtime cho hệ thống production.

Kỹ sư đám mây vào quán bar, rồi bất ngờ phải di dời cả trung tâm dữ liệu trong 6 tháng

Việc ghé thêm một quán bar thứ hai trong cùng một đêm đôi khi có thể là một quyết định đầy rủi ro. Với Dave Bradley, một kỹ sư đám mây cấp cao tại Vizient (công ty dịch vụ chăm sóc sức khỏe), điều đó đã khiến anh bất đắc dĩ trở thành "ảo thuật gia" khi phải di dời toàn bộ trung tâm dữ liệu trong vòng 6 đến 7 tháng.

Từ cuộc vui đến nhiệm vụ bất khả thi

Sau khi tận hưởng khoảng thời gian vui vẻ cùng đồng nghiệp tại công ty teambuilding, Bradley quyết định ra về. Nhưng trên đường ra cửa, anh tình cờ thấy sếp của mình đang ngồi ở một quán bar khác cùng với các lãnh đạo cấp cao hơn. Sau một hồi trò chuyện, một trong những sếp lớn bất ngờ hỏi: "Chúng ta có thể đóng cửa trung tâm dữ liệu ở Chicago trong hai tuần và chuyển mọi thứ xuống Dallas không?"

Phản ứng đầu tiên của Bradley là "Cái gì?" nhưng với sự trợ giúp của chút rượu mạnh, anh và một đồng nghiệp bên mạng bắt đầu lên ý tưởng cho dự án ngay tại quán bar. Ban quản lý cuối cùng không giữ khắt khe mốc hai tuần, mà đưa ra mục tiêu đầy thách thức là 6-7 tháng.

Chiến lược "ảo thuật"

Vizient sử dụng hệ thống lưu trữ Pure Storage với kết nối 10Gbps giữa hai trung tâm dữ liệu. Việc nhân bản dữ liệu giữa các hệ thống lưu trữ rõ ràng là lựa chọn khả thi nhờ băng thông đủ lớn. Tuy nhiên, vấn đề phát sinh khi hai trung tâm dữ liệu có dải địa chỉ IP khác nhau và công ty không có đủ phần cứng để hỗ trợ toàn bộ khối lượng công việc trong thời gian chuyển đổi.

Trong một cuộc họp, ban lãnh đạo yêu cầu: "Cứ làm sao cho nó hoạt động được đi. Các anh giỏi mà." Từ đó, Bradley chấp nhận biệt danh "ảo thuật gia" và nổi tiếng khắp văn phòng với câu nói: "Cứ tin vào các ảo thuật gia."

Giải pháp phần cứng: Nhóm đã hợp nhất khối lượng công việc vào một tập hợp con máy chủ và hệ thống lưu trữ, qua đó giải phóng một số thiết bị để gửi trước đến Dallas, sẵn sàng tiếp nhận khối lượng công việc trong quá trình di chuyển.

Điểm mấu chốt đến từ kinh nghiệm trước đây của Bradley khi xây dựng hệ thống khôi phục thảm họa hoàn chỉnh bằng VMware Site Recovery Manager (SRM). Vizient vẫn còn bản quyền sử dụng công cụ này – một lợi thế lớn vì ngân sách di dời gần như bằng không – và SRM cho phép tự động gán lại địa chỉ IP sang dải địa chỉ mới trong quá trình di chuyển.

Ba đêm di dời lịch sử

Kế hoạch được chia thành ba đêm di chuyển chính, mỗi đêm dành cho một phần hạ tầng khác nhau:

  • Đêm thứ nhất: Di dời môi trường development với khoảng 70 máy ảo và 3 VLAN. Nhóm đã tạo các kịch bản tự động hóa, cho phép tắt máy ở Chicago, dựng VLAN mới ở Dallas và xác minh trước khi khởi động lại. "Chúng tôi đặt thêm vài điểm dừng để kiểm tra mọi thứ đều chính xác," Bradley chia sẻ. Hoạt động thành công nhưng khiến anh bất ngờ.

  • Thử thách bất ngờ: Ban quản lý đột ngột mua lại một công ty và yêu cầu đưa khối lượng công việc của công ty này cũng về Dallas. May mắn là công ty mới thuê chung tòa nhà và trung tâm dữ liệu với Vizient, chỉ có 50 máy ảo. Bradley đã linh hoạt di chuyển một hệ thống lưu trữ sang văn phòng công ty mới để sao chép dữ liệu, trong đó phát hiện rằng việc tắt một hệ thống Pure Storage yêu cầu... rút dây nguồn.

Bài học kinh điển: Luôn là DNS

Đêm thứ hai diễn ra suôn sẻ với môi trường test. Nhưng đến đêm thứ ba khi di chuyển 50 máy ảo từ công ty mới mua lại, mọi chuyện mới thực sự "khó chịu". Câu nói bất hủ trong giới IT "Luôn là DNS" (It's always DNS) đã chứng minh độ chính xác: SRM gặp lỗi nghiêm trọng khi cố gắng di chuyển máy chủ đang chạy cả DNS và Active Directory.

"Giữa lúc đó, chúng tôi phải gấp rút tìm hiểu chuyện gì đang xảy ra," Bradley nhớ lại. Nhóm mạng cuối cùng xác định phải để lại một số workload ở Chicago cho đến giai đoạn sau.

Đêm cuối cùng di chuyển môi trường production lại diễn ra một cách "chống đỉnh cao" nhất trong sự nghiệp của Bradley – chỉ mất 3,5 giờ và mọi kế hoạch hoạt động đúng như thiết kế. Tổng downtime của toàn bộ dự án chỉ khoảng 2 giờ cho hệ thống production và khoảng 1 giờ cho các hệ thống khác.

"Hầu hết doanh nghiệp không hề nhận ra điều gì đã xảy ra vì mọi thứ diễn ra quá suôn sẻ," anh tự hào cho biết.

Ba bài học xương máu từ dự án

Bradley đúc kết ba bài học quan trọng từ trải nghiệm này:

  • Vận chuyển là điểm nghẽn: FedEx (công ty chuyển phát nhanh) không cấp bảo hiểm cho một lần vận chuyển duy nhất toàn bộ thiết bị giữa Chicago và Dallas vì giá trị vượt quá hạn mức chính sách. Vizient buộc phải chia thành nhiều chuyến vận chuyển hệ thống lưu trữ và máy chủ. May mắn là trung tâm dữ liệu nằm gần sân bay Chicago, việc sắp xếp nhiều chuyến trở nên đơn giản hơn.

  • DNS luôn gây rắc rối, bất kể quy mô dự án.

  • Bài học cuối cùng mang tính hài hước: "Đôi khi, các dự án táo bạo bắt nguồn từ vài ba ly cocktail" – một lời cảnh báo nửa đùa nửa thật cho bất kỳ ai có ý định... vào quán bar thứ hai.

Câu chuyện của Bradley là minh chứng sống động cho thấy trong thế giới công nghệ, thành công không chỉ đến từ kỹ năng kỹ thuật mà còn từ sự linh hoạt, tinh thần đồng đội và đôi khi là một chút may mắn – cùng dũng khí để bước vào một quán bar không thuộc kế hoạch!

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗