Mạng AI thế hệ mới có thể phụ thuộc vào sự trở lại của 'tổng đài điện thoại'
Khi các cụm GPU siêu lớn trở thành chuẩn mực, nhu cầu về kết nối quang học tốc độ cao và linh hoạt tăng vọt. Các startup quang tử như iPronics đang gọi vốn hàng trăm triệu USD để phát triển bộ chuyển mạch quang học (OCS) thế hệ hai, hứa hẹn tốc độ cấu hình lại dưới mili giây và mật độ cổng cao hơn, thay thế các thiết kế MEMS truyền thống. Công nghệ này được coi là chìa khóa để quản lý và mở rộng quy mô các hệ thống AI tập trung hàng nghìn bộ tăng tốc.

Mạng AI thế hệ mới có thể phụ thuộc vào sự trở lại của 't�ng đài điện thoại'
Khi các thiết kế hệ thống AI đang tiến tới quy mô hàng nghìn GPU trong một cụm thống nhất, việc kết nối chúng lại với nhau một cách hiệu quả đang trở thành bài toán sống còn. Nhiều startup quang tử đang đổ hàng trăm triệu USD vào một công nghệ tưởng chừng cổ điển: chuyển mạch quang học (Optical Circuit Switching - OCS), mang tinh thần của tổng đài điện thoại nhưng được hiện đại hóa ở cấp độ chip silicon photonics.
Nvidia, Google và hàng loạt ông lớn công nghệ đều đang rót vốn khổng lồ để phát triển các giải pháp OCS thế hệ mới, với kỳ vọng tạo ra bước đột phá về băng thông và độ linh hoạt cho hạ tầng AI.
Vì sao chuyển mạch gói không còn đủ sức?
Trong các trung tâm dữ liệu truyền thống, dữ liệu được định tuyến qua các bộ chuyển mạch gói (packet switch) như ASIC Tomahawk của Broadcom hay Teralynx của Marvell. Tuy nhiên, khi mô hình AI đòi hỏi kết nối trực tiếp giữa hàng nghìn GPU với băng thông cực lớn và độ trễ cực thấp, cách tiếp cận này bộc lộ giới hạn về công suất và độ phức tạp.
OCS không phải là switch theo nghĩa thông thường. Giống như tổng đài viên ngày xưa cắm dây nối hai thuê bao, OCS định tuyến toàn bộ luồng ánh sáng từ một cổng đến một cổng khác mà không cần xử lý tín hiệu điện. Thay vì bàn tay con người, các bộ truyền động siêu nhỏ, gương MEMS hoặc tinh thể lỏng thực hiện việc kết nối trong "chớp mắt".
Nhờ vậy, OCS cho phép thay đổi cấu trúc mạng (topology) một cách linh hoạt mà không cần thay đổi phần cứng. Google là một trong những đơn vị tiên phong sử dụng công nghệ này trong các cụm TPU từ nhiều năm nay. Nhờ OCS, họ có thể thay đổi kích thước "pod" (nhóm GPU) theo nhu cầu hoặc nóng thay thế các bộ tăng tốc bị lỗi mà không cần gián đoạn toàn hệ thống.
Startup iPronics và tham vọng thay đổi cuộc chơi
Các thiết bị OCS thế hệ đầu sử dụng công nghệ MEMS với gương siêu nhỏ, tuy hoạt động ổn định nhưng tốc độ cấu hình lại khá chậm, thường khoảng 100 mili giây. Kích thước cũng là một vấn đề khi các thiết bị này chiếm rất nhiều không gian trong rack.
Hình ảnh mô tả cấu tạo chip chuyển mạch quang iPronics
Startup iPronics có trụ sở tại Tây Ban Nha đang muốn giải quyết những hạn chế này với thiết kế OCS "thế hệ hai" dựa trên silicon photonics. Điểm khác biệt lớn nhất là không có bất kỳ bộ phận cơ khí chuyển động nào. Thay vào đó, họ sử dụng các vi mạch quang tử để điều hướng tín hiệu ánh sáng.
Hãng tuyên bố công nghệ của họ có thể đạt thời gian cấu hình lại dưới 1 mili giây. Tính năng này mở ra khả năng thay đổi cấu trúc mạng ngay giữa lúc hệ thống đang chạy tải, bằng cách che giấu độ trễ vào các chu kỳ tính toán.
Mật độ cổng cũng được cải thiện đáng kể. Chip iPronics One hiện hỗ trợ 32 cổng trên một chip. Công ty cho biết đang phát triển các bản 72 và 144 cổng. Nhờ kiến trúc silicon photonics, chúng có thể được tích hợp rất dày đặc. iPronics ước tính có thể đóng gói tới 720 cặp cổng trong một đơn vị rack 1U. Để so sánh, các switch OCS hiện tại như sản phẩm 300 cổng của Coherent thường chiếm từ 8 rack trở lên.
Vai trò của OCS trong kiến trúc mạng AI lai
Những hệ thống GPU thế hệ mới như Nvidia NVL72 hay các cụm AMD Helios sử dụng cấu trúc mạng lưới "all-to-all" với độ đa dạng đường đi cực cao, giúp mọi GPU chỉ cách nhau một "bước nhảy" (hop). Tuy nhiên, OCS không hề xung đột với cách tiếp cận này.
Các chuyên gia cho rằng một mô hình lai sẽ phổ biến: bên trong rack vẫn dùng cáp đồng và chuyển mạch gói cho độ trễ cực thấp, còn giữa các rack sẽ sử dụng mạng lưới OCS. Điều này đặc biệt hữu ích với các cụm LPU (Large Processing Unit) khổng lồ mà Nvidia đang quảng bá.
Với các cụm gồm hơn 2.000 bộ tăng tốc sử dụng pipeline parallelism — nơi dữ liệu được xử lý tuần tự qua từng chip — OCS là lựa chọn lý tưởng. Nó cho phép các "neocloud" như Nebius dễ dàng thay đổi quy mô cụm máy cho phù hợp với từng mô hình AI cụ thể.
Bước đi tất yếu: Mật độ cáp quang cao hơn
Việc kết nối hàng nghìn GPU với nhau đòi hỏi một lượng cáp quang khổng lồ. Các đầu nối MPO truyền thống chỉ hỗ trợ từ 8 đến 24 sợi quang, giờ đã trở thành điểm nghẽn mới. Hãng Mixx Technologies vừa giới thiệu đầu nối SxC với 64 sợi trên một connector, giúp đóng gói 384 cổng 64 sợi trong một đơn vị rack OCP.
Với SerDes (mạch nối tiếp/giải nối tiếp) 400 Gbps, Mixx ước tính một rack như vậy có thể đạt tổng băng thông lên tới 614 TB/s. Đây được xem là hạ tầng cần thiết cho các siêu cụm AI trong tương lai gần.
Trong bối cảnh ngành công nghiệp AI đang tăng tốc, việc đầu tư vào hạ tầng kết nối quang học không còn là lựa chọn mà là điều kiện tiên quyết. Các startup như iPronics và Mixx đang đứng trước cơ hội lớn để trở thành những mắt xích quan trọng nhất trong chuỗi cung ứng AI toàn cầu.