Khi một trung tâm dữ liệu không còn đủ cho AI

Công nghệ07 tháng 10, 2026·4 phút đọc

Khi các mô hình AI ngày càng lớn, việc huấn luyện chúng vượt qua giới hạn của một trung tâm dữ liệu duy nhất đang trở thành bài toán hạ tầng cấp thiết. Điều này đặt ra thách thức mạng hoàn toàn mới, đòi hỏi các luồng dữ liệu khổng lồ, đồng bộ và gần như không mất gói giữa các địa điểm cách xa nhau.

Khi một trung tâm dữ liệu không còn đủ cho AI

Việc huấn luyện các mô hình AI lớn nhất hiện nay không còn đơn thuần là câu chuyện thêm GPU. Khi các cụm máy tính (cluster) ngày càng phình to, nguồn điện cung cấp trở thành giới hạn vật lý cứng, buộc các đội ngũ hạ tầng phải tính đến khả năng vận hành một khối lượng công việc huấn luyện duy nhất trải rộng trên nhiều trung tâm dữ liệu.

Điều này tạo ra một bài toán mạng hoàn toàn khác. Đường truyền liên kết giữa các trung tâm dữ liệu truyền thống vốn được thiết kế để di chuyển lưu lượng giữa các địa điểm. Nhưng huấn luyện AI lại đòi hỏi khắt khe hơn nhiều: các luồng dữ liệu khổng lồ, đồng bộ, mất gói tối thiểu và giao tiếp giữa các GPU được phối hợp cực kỳ chặt chẽ. Chỉ cần một phần của cụm bị đình trệ, tác động có thể lan ra toàn bộ tác vụ đang chạy.

Khi hạ tầng AI vượt khỏi ranh giới một trung tâm dữ liệu

Trong một cuộc phỏng vấn với The Register, ông Rakesh Chopra — Phó Chủ tịch cấp cao phụ trách Kiến trúc Silicon và Hệ thống, kiêm Cisco Fellow — đã chia sẻ về cái mà Cisco gọi là yêu cầu cấp thiết "Scale-Across" (mở rộng xuyên trung tâm). Theo ông, hạ tầng AI phân tán cần một cách tiếp cận hoàn toàn mới đối với bài toán định tuyến.

Ông giải thích cách nhu cầu của AI đang thay đổi vai trò của mạng lưới: từ chỗ chỉ là kênh truyền tải đơn thuần, mạng đang trở thành một phần cốt lõi của hệ thống tính toán. Thách thức đặt ra là làm sao khiến các cơ sở hạ tầng nằm cách xa nhau về địa lý có thể vận hành như thể chúng là một cỗ máy xác định duy nhất.

Khi khối lượng công việc trải dài trên các tuyến cáp quang đường trường, việc đệm dữ liệu, quang học kết hợp tốc độ cao và các vi xử lý tích hợp chặt chẽ trở thành yếu tố then chốt.

Bài toán nằm ngay bên trong cụm GPU

Cuộc trò chuyện cũng đi sâu vào bên trong bản thân cụm máy tính. Ông Chopra phác thảo cách kiến trúc Silicon One và Intelligent Collective Networking của Cisco được thiết kế để quản lý các đợt lưu lượng GPU đồng bộ, giảm điểm nghẽn và cải thiện thời gian hoàn thành tác vụ (job completion time).

Hiệu quả năng lượng là một chủ đề trung tâm khác, bao gồm cả sự đánh đổi giữa mức tiêu thụ của mạng lưới và lượng điện năng còn lại dành cho GPU. Khi các cụm máy tính ngày càng ngốn điện, phần năng lượng mà mạng lưới "ăn" vào ảnh hưởng trực tiếp đến năng lực huấn luyện thực tế.

Bảo mật và khả năng thích ứng lâu dài

An toàn bảo mật và vòng đời hệ thống cũng là những điểm được nhấn mạnh. Cuộc phỏng vấn đề cập đến MACsec và IPsec tăng tốc bằng phần cứng, cùng vai trò của khả năng lập trình (programmability) trong việc giúp hạ tầng thích ứng khi các khối lượng công việc AI liên tục tiến hóa.

Đối với các nhà lãnh đạo hạ tầng và trung tâm dữ liệu đang chuẩn bị cho những môi trường AI lớn hơn, phân tán hơn, cuộc thảo luận mang lại góc nhìn thực tiễn về những thách thức mạng lưới nảy sinh một khi một địa điểm duy nhất không còn đủ sức đáp ứng.

Ý nghĩa với thị trường Việt Nam

Với các doanh nghiệp và trung tâm dữ liệu tại Việt Nam đang bước vào giai đoạn đầu tư cho AI, bài học "Scale-Across" đáng để lưu tâm ngay từ bây giờ. Khi các trung tâm dữ liệu trong nước như những cơ sở tại Hòa Lạc, Quận 7 hay các dự án mới của Viettel, FPT, VNG mở rộng công suất, yếu tố kết nối quang tốc độ cao giữa các địa điểm và khả năng phối hợp lưu lượng GPU sẽ sớm trở thành yếu tố quyết định hiệu suất.

Việc chọn kiến trúc mạng có khả năng mở rộng xuyên cơ sở, hỗ trợ bảo mật bằng phần cứng và tối ưu năng lượng không còn là chuyện của tương lai xa — mà là điều kiện cạnh tranh cho hạ tầng AI trong vài năm tới.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗