Cuộc đua của các startup mạng AI nhằm thay thế NVLink của Nvidia
Cornelis Networks (tách ra từ Intel) và startup Delos Data đang giới thiệu các giải pháp kết nối mở thay thế NVLink, cho phép mở rộng hệ thống AI vượt ra ngoài phạm vi một rack. Cả hai hướng tới các tiêu chuẩn mở như UALink và Ethernet, đồng thời thu hút hàng trăm triệu USD đầu tư.

Cuộc đua của các startup mạng AI nhằm thay thế NVLink của Nvidia
Khi Nvidia ngày càng mở rộng ảnh hưởng thông qua công nghệ NVLink Fusion, các nhà cung cấp mạng đối thủ đang gấp rút đưa ra thị trường những giải pháp kết nối và switch thay thế. Tại hội nghị AI Infra Summit tuần này, Delos Data và Cornelis Networks chính thức tham gia cuộc đua mạng quy mô lớn (scale-up).
Các loại fabric scale-up như NVLink là yếu tố giúp Nvidia có thể khiến 8, 72, thậm chí 576 GPU hoạt động như một bộ tăng tốc AI khổng lồ duy nhất. Để bắt kịp, các đối thủ như AMD đã áp dụng những giao thức mới nổi như Ultra Accelerator Link (UALink).
Những nỗ lực bắt kịp của đối thủ
Hiện nay, các giao thức này phần lớn vẫn được truyền qua các switch Ethernet tiêu chuẩn. Chẳng hạn, AMD đang sử dụng switch Tomahawk 6 của Broadcom với băng thông 102,4 Tbps, kết nối tới các die I/O tùy chỉnh trên chip MI455X.
Các switch UALink và kết nối vật lý chuyên dụng vẫn còn khan hiếm, nhưng điều đó có thể sớm thay đổi nếu Cornelis và Delos thành công. Hai công ty này tiếp cận thách thức từ nhiều góc độ khác nhau, bao gồm tiêu chuẩn hóa, tối ưu phần mềm và phần cứng vật lý.
Cornelis và tiêu chuẩn cho mạng phi Nvidia
Tại AI Infra hôm thứ Hai, nhà cung cấp mạng chuyên về HPC Cornelis đã giới thiệu Active Compute Fabric (ACF), nhằm thiết lập một kiến trúc mở cho cả mạng scale-up lẫn scale-out, tích hợp khả năng tính toán lập trình được vào chính fabric mạng.
Tiêu chuẩn này đánh dấu bước chân của Cornelis vào đấu trường mạng scale-up. Được tách ra từ Intel năm 2020, công nghệ Omni-Path của Cornelis ban đầu được thiết kế như một kết nối scale-out cho các ứng dụng HPC, bao gồm siêu máy tính như Trinity và Lynx.
Với việc sắp ra mắt dòng switch và NIC CN6000 hỗ trợ tốc độ 800 Gbps, công ty đặt mục tiêu không chỉ mang công nghệ của mình đến với đông đảo người dùng thông qua giao thức Ultra Ethernet mở, mà còn nhắm tới cả mạng scale-up.
ACF mở rộng sứ mệnh của các công nghệ như UALink và Ethernet for Scale-Up Networking, nhằm đặt ra một chuẩn cơ sở cho khả năng tính toán trong mạng trên nhiều loại phần cứng khác nhau, không chỉ riêng các linh kiện dòng CN của Cornelis.
Một trong những công nghệ then chốt đằng sau các chip ASIC NVSwitch của Nvidia là hỗ trợ SHARP, cho phép offload các phép toán tập hợp (collective) trong mạng sang chip switch ASIC, giải phóng sức mạnh tính toán của GPU và giảm chi phí truyền thông.
Tăng tốc tập hợp không phải là điều mới mẻ, khi nhiều nhà cung cấp mạng lớn từ Broadcom đến Cisco đều đã triển khai ở một mức độ nào đó. Là một kiến trúc mở, ACF dường như đặt ra một chuẩn tối thiểu để khách hàng triển khai biết chính xác họ nhận được gì.
Tuy nhiên, Cornelis không dừng lại ở đó. Công ty nhìn thấy cơ hội tăng tốc nhiều chức năng khác, bao gồm:
- Offload KV cache dùng để lưu trữ và truy xuất trạng thái mô hình qua nhiều phiên.
- Điều phối chuyên gia MoE nhằm giảm truyền dữ liệu trùng lặp và chi phí truyền thông cho các mô hình mixture-of-experts trong suy luận và huấn luyện.
- Offload giao diện truyền thông điệp (MPI) cho các ứng dụng HPC.
- Checkpointing trong fabric để phục hồi lỗi trong quá trình huấn luyện và các tác vụ lớn khác.
"Chi phí truyền thông và đồng bộ hóa có thể khiến các bộ tăng tốc đắt tiền bị sử dụng lãng phí", công ty giải thích. Các bộ tăng tốc trong mạng này "cho phép mạng xử lý dữ liệu ngay khi nó di chuyển qua hệ thống".
Theo Cornelis, tiềm năng tiết kiệm từ việc giành lại phần tính toán nhàn rỗi là rất lớn. "Trong một hệ thống 100.000 GPU, mô hình hóa dựa trên dữ liệu công khai của Cornelis cho thấy khoảng một nửa số giờ GPU được dùng để chờ dữ liệu, tương đương khoảng 1,68 tỷ USD mỗi năm bị lãng phí và 500 GWh điện năng."
Tất nhiên, cần thận trọng với những tuyên bố này. Tuy nhiên, việc giành lại thời gian nhàn rỗi của GPU sẽ đồng nghĩa với khoản tiết kiệm đáng kể. Loại bỏ mọi nút thắt cổ chai đóng góp vào tình trạng đó thì nói dễ hơn làm.
Một loại NIC mới cho kỷ nguyên AI
Trong khi Cornelis đề cao kiến trúc ACF, Delos Data — startup do các cựu lãnh đạo của Barefoot Networks và Intel sáng lập — lại nhắm tới lớp vật lý với một loạt thiết kế tham chiếu mạng mới.
Được tiếp thị dưới danh mục Nonstop AI, các giao diện mạng này trải rộng toàn bộ phổ kết nối, từ các kết nối đồng đóng gói (co-packaged) đến các NIC truyền thống hơn.
Ý tưởng, theo công ty giải thích, là cung cấp cho khách hàng một bản thiết kế cấp hệ thống để tăng tốc di chuyển dữ liệu giữa các điểm đầu cuối và cho phép các miền tính toán lớn hơn vượt ra ngoài một rack.
Giao diện dữ liệu của Delos sẽ được cung cấp dưới ba dạng. Đầu tiên là một die I/O có khả năng đạt hơn 30 Tbps tổng băng thông, tương đương khoảng 8 TB/s theo mỗi hướng. Con số này cao hơn gấp đôi băng thông kết nối của các bộ tăng tốc mới nhất từ Nvidia hoặc AMD, vốn chỉ đạt 3,6 TB/s.
Mức độ cạnh tranh thực tế sẽ phụ thuộc vào thời điểm các chiplet I/O của Delos được triển khai. Tiến độ đó lại phụ thuộc rất nhiều vào việc tích hợp, vì những die I/O này cần được gắn trực tiếp vào gói bộ tăng tốc, đòi hỏi mức độ đồng thiết kế cao.
Điều quan trọng là Delos không cố nhốt khách hàng vào một khu vườn có tường bao như Nvidia làm với các die I/O hay IP của NVLink Fusion. Ít nhất ở thời điểm hiện tại, NVLink Fusion vẫn yêu cầu khách hàng mua NVSwitch cho mạng scale-up.
Các chiplet của Delos không phụ thuộc giao thức. Chúng không quan tâm bạn dùng ESUN, UALink hay thứ gì khác. Các nhà thiết kế chip muốn tập trung nguồn lực và vốn vào phần AI của bộ tăng tốc — điều đúng với phần lớn các hyperscaler — có thể chỉ cần cấp phép thiết kế chiplet của Delos.
Tính trung lập giao thức này cũng mở rộng sang công nghệ quang học gần gói (NPO) của Delos, vốn tích hợp giao diện dữ liệu hơn 10 Tbps — tương đương 2,5 TB/s băng thông hai chiều — với các engine quang từ những nhà cung cấp quang học hàng đầu.
Các hệ thống quy mô rack như NVL72 của Nvidia cho tới nay phần lớn vẫn dựa vào kết nối đồng do giới hạn về điện năng. Khi hệ thống phát triển từ rack 72 GPU lên các cụm quy mô hàng với 576 và cuối cùng là 1.152 GPU, quang học trở thành điều không thể tránh khỏi.
Việc tích hợp quang học trực tiếp vào bộ tăng tốc là khả thi với công nghệ hiện có, nhưng bán kính ảnh hưởng khi một module quang gặp lỗi là rất lớn. NPO mang đến một giải pháp thay thế: kết nối đồng được dùng trong rack, còn quang học được cung cấp qua các module NPO có thể bảo trì bởi người dùng giữa các rack.
Cuối cùng, Delos đang phát triển một NIC hơn 400 Gbps, cũng không phụ thuộc giao thức như phần còn lại của dòng sản phẩm. Đây có lẽ là mục ít gây bất ngờ nhất trong toàn bộ danh mục, vì mạng scale-out vẫn sẽ cần thiết cho các cụm huấn luyện lớn cũng như cho truy cập front-end và mạng lưu trữ.
Các giao diện này xây dựng trên thiết kế tham chiếu compute hiện có của Delos, cùng nền tảng phần mềm Nonstop AI được thiết kế để hỗ trợ cấu hình và giám sát các fabric hoặc mesh chuyển mạch, cho phép định tuyến lại lưu lượng động khi một liên kết gặp sự cố. Dữ liệu telemetry thu thập được từ các giao diện này mang lại khả năng quan sát mạng tốt hơn, giúp định tuyến lại và phục hồi nhanh chóng.
Thúc đẩy cạnh tranh
Giới đầu tư dường như rất háo hức với sự cạnh tranh nhiều hơn trong lĩnh vực scale-up. Cùng với các thông báo sản phẩm, Cornelis công bố khoản đầu tư khoảng 205 triệu USD để đưa thế hệ sản phẩm mạng scale-up và scale-out tiếp theo ra thị trường.
Trong khi đó, Delos Data thông báo hôm thứ Ba rằng họ đã huy động được hơn 100 triệu USD, với sự hỗ trợ từ các quỹ đầu tư mạo hiểm như Matrix, Playground và Socratic Partners.
Đối với độc giả Việt Nam theo dõi xu hướng hạ tầng AI, đây là tín hiệu đáng chú ý: khi các tiêu chuẩn mở như UALink và Ultra Ethernet phát triển, cơ hội cho các doanh nghiệp trong khu vực tham gia chuỗi cung ứng hạ tầng AI sẽ rộng mở hơn, đồng thời giảm sự phụ thuộc vào một nhà cung cấp duy nhất.


