Hot Chips 2026: Nvidia muốn đưa CUDA lên nền tảng RISC-V
Tại hội nghị Hot Chips 2026, Nvidia đã công bố kế hoạch mở rộng hỗ trợ CUDA sang kiến trúc RISC-V, mở ra cánh cửa cho các CPU RISC-V cấp máy chủ tham gia vào hệ sinh thái GPU compute. Tuy nhiên, để làm được điều này, các hệ thống RISC-V phải đáp ứng hàng loạt yêu cầu khắt khe về phần cứng và phần mềm như chuẩn RVA23, ACPI và PCIe coherency, điều mà hầu hết các thiết bị RISC-V hiện tại khó có thể đạt được. Bài viết phân tích chi tiết các yêu cầu này và những tác động tiềm năng đối với cộng đồng RISC-V.

Hot Chips 2026: Nvidia mở đường cho CUDA chạy trên nền tảng RISC-V
Trong một bước đi chiến lược nhằm mở rộng hệ sinh thái GPU compute, Nvidia vừa hé lộ kế hoạch hỗ trợ CUDA trên kiến trúc RISC-V. Đây được xem là tín hiệu tích cực cho cộng đồng RISC-V, vốn đang nỗ lực cạnh tranh với các kiến trúc lâu đời như x86-64 và aarch64, nhưng đi kèm với đó là một loạt điều kiện không hề dễ dàng.
CUDA từ lâu đã là nền tảng phần mềm quan trọng nhất trong lĩnh vực GPU compute, đặc biệt là các ứng dụng máy học và trí tuệ nhân tạo (AI). Hiện tại, CUDA chính thức hỗ trợ hai kiến trúc CPU chính là x86-64 và aarch64. Việc Nvidia quan tâm đến RISC-V cho thấy họ đang nhìn nhận tiềm năng của kiến trúc mã nguồn mở này trong phân khúc máy chủ và điện toán hiệu năng cao.
Hình minh họa về kiến trúc RISC-V và GPU Nvidia
Yêu cầu khắt khe từ Nvidia
Trong bài thuyết trình tại hội nghị Hot Chips 2026, đại diện Nvidia đã trình bày chi tiết các yêu cầu mà một CPU RISC-V phải đáp ứng để tương thích với CUDA. Về cơ bản, Nvidia đang hướng tới một tiêu chuẩn CPU cấp máy chủ (server-grade), chứ không phải các vi điều khiển hay bo mạch nhúng thông thường.
Điều kiện tiên quyết đầu tiên là CPU phải đạt chuẩn RVA23 và tuân thủ nghiêm ngặt các đặc tả server SoC và server platform của RISC-V. Các đặc tả này bao gồm tính năng RAS (Reliability, Availability, and Serviceability - Độ tin cậy, Khả dụng và Khả năng bảo trì), một bộ xử lý bảo mật chuyên dụng và các tính năng nền tảng khác.
Nvidia nhấn mạnh họ cần thêm một số yêu cầu vượt ra ngoài các đặc tả chuẩn của RISC-V vì gặp khó khăn trong việc tối ưu hiệu năng CUDA nếu thiếu chúng. Nvidia giải thích:
Chúng tôi không muốn gặp phải vấn đề "mẫu số chung nhỏ nhất" - nơi chúng tôi không thể sử dụng các phần mở rộng tăng hiệu năng vì không thể đảm bảo phần cứng sẽ hỗ trợ chúng. Điều đó buộc chúng tôi phải phát hành mã nguồn kém hiệu quả.
Một ví dụ điển hình là các vector extension (phần mở rộng vector) trên RISC-V, vì tính năng predication (dự đoán) trong đó giúp tránh được các nhánh rẽ (branches) không cần thiết trong quá trình xử lý.
Bước ngoặt ACPI
Một trong những thách thức lớn nhất mà Nvidia gặp phải chính là ACPI (Advanced Configuration and Power Interface). ACPI đóng vai trò quan trọng trong việc giúp phần mềm nhận diện khả năng phần cứng, cũng như quản lý năng lượng, hiệu năng và nhiệt độ.
Theo chia sẻ từ đội ngũ phần mềm của Nvidia, họ đã rất không hài lòng khi bắt đầu quá trình port CUDA sang RISC-V vì kiến trúc này không hỗ trợ ACPI. Tuy nhiên, tình thế đã thay đổi tích cực: vào năm 2025, diễn đàn UEFI đã chính thức thêm hỗ trợ ACPI cho RISC-V, và đặc tả RISC-V BRS (Boot and Runtime Services) cũng đã được phê chuẩn vào năm ngoái, bao gồm cả ACPI.
PCIe Coherency và kết nối ngang hàng
Nvidia đặt ra yêu cầu bắt buộc về PCIe coherency - một tính năng quan trọng đảm bảo tính nhất quán dữ liệu giữa CPU cache và GPU. Nếu thiếu tính năng này, một bài toán về thứ tự bộ nhớ sẽ nảy sinh: CPU có thể đã ghi dữ liệu nhưng nó vẫn nằm trong cache, trong khi DMA engines đọc dữ liệu từ DRAM và bỏ sót dữ liệu đã được sửa đổi bên trong cache phía CPU. Điều này có thể dẫn đến lỗi dữ liệu khi sao chép từ GPU trở lại hoặc ngược lại.
Ngoài ra, Nvidia cũng yêu cầu phần cứng hỗ trợ PCIe peer-to-peer communication - cho phép các thiết bị (như GPU và các accelerator khác) giao tiếp trực tiếp với nhau mà không cần đi qua bộ nhớ CPU. Nếu thiếu tính năng này, việc sao chép dữ liệu giữa các thiết bị sẽ phải đi vòng qua CPU, gây giảm hiệu năng và tăng độ phức tạp do cần thêm các tín hiệu đồng bộ hóa.
Sơ đồ minh họa yêu cầu phần cứng của CUDA trên RISC-V
NVLink Fusion: Cầu nối cho các CPU tùy chỉnh
Bên cạnh CUDA, Nvidia cũng giới thiệu sơ lược về yêu cầu cho NVLink Fusion - một sáng kiến cho phép các công ty khác triển khai IP NVLink của Nvidia trên chip của họ, từ đó kết nối với GPU Nvidia thông qua chuẩn NVLink C2C.
Khái niệm này tương tự như cách Nvidia hợp tác với MediaTek trong sản phẩm GB10, nơi die CPU của MediaTek được kết nối với GPU Nvidia thông qua NVLink C2C. Với NVLink Fusion, các nhà sản xuất có thể sử dụng CPU tùy chỉnh của mình - thậm chí là CPU RISC-V - và vẫn tận dụng được hệ sinh thái NVLink.
Các yêu cầu của NVLink Fusion bao gồm tất cả các yêu cầu của CUDA, cộng thêm những gì cần thiết để hỗ trợ các framework phần mềm như DOCA và NCCL. Đáng chú ý, Nvidia yêu cầu một mối quan hệ đối tác chặt chẽ với khách hàng - một điều có vẻ hiển nhiên, vì việc tích hợp IP là một quá trình phức tạp, đòi hỏi sự hợp tác sâu rộng tương tự như mô hình hợp tác MediaTek - Nvidia cho GB10.
Nhận định: Con đường còn dài phía trước
Dù đây là một tín hiệu đáng mừng, nhưng hệ sinh thái phần mềm của RISC-V vẫn còn một chặng đường dài trước khi có thể bắt kịp x86-64 và aarch64. Điều quan trọng cần lưu ý: những nỗ lực của Nvidia không có nghĩa là bạn có thể gắn một GPU Nvidia vào bất kỳ hệ thống RISC-V nào và bắt đầu sử dụng CUDA ngay lập tức.
Phần lớn phần cứng RISC-V hiện có sẽ không đáp ứng được các yêu cầu khắt khe của Nvidia. Trên thực tế, rất khó để kỳ vọng bất kỳ thiết bị RISC-V tiêu dùng nào có thể đạt được các tiêu chuẩn này trong tương lai gần. ACPI là một điểm nghẽn rõ ràng - ngay cả trong thế giới aarch64, hỗ trợ ACPI vẫn còn chắp vá dù đã được đưa vào tiêu chuẩn từ nhiều năm trước. Một chuẩn RISC-V được phê chuẩn vào năm 2025 có thể mất nhiều năm để được hỗ trợ rộng rãi.
Hình ảnh hệ thống máy chủ RISC-V hỗ trợ CUDA
Khi (và nếu) các hệ thống RISC-V có hỗ trợ CUDA xuất hiện, chúng rất có thể sẽ là những hệ thống máy chủ - chứ không phải các bo mạch đơn (SBC) mà người đam mê có thể mua với giá phải chăng. Nvidia cho biết họ đang hợp tác với SiFive, và SiFive dự kiến sẽ trình diễn một hệ thống chạy CUDA tại Hot Chips với cấu hình lõi số lượng lớn - một con chip máy chủ thực thụ.
Kỳ vọng cho tương lai
Với góc nhìn từ một người quan sát công nghệ, tôi hy vọng Nvidia có thể nới lỏng các yêu cầu của mình để tạo cơ hội cho các hệ thống RISC-V hiện có. Việc thiếu vector extensions hay PCIe coherency không nhất thiết dẫn đến các vấn đề hiệu năng không thể giải quyết. Việc sử dụng branches thay vì predication có thể hoạt động tốt nếu các nhánh đó dễ dự đoán. Tương tự, thao tác cache invalidation (hợp lệ hóa cache) để bù đắp cho việc thiếu PCIe coherency sẽ tốn một khoản chi phí hiệu năng, nhưng con số đó có thể chấp nhận được đối với các workload thiên về tính toán nhiều hơn là di chuyển dữ liệu.
Hy vọng rằng các yêu cầu hiện tại của Nvidia chỉ xuất phát từ sự thuận tiện trước mắt, nhằm đảm bảo một bản port CUDA nhanh chóng và ít rủi ro. Và hy vọng rằng CUDA sẽ phát triển theo hướng tiếp cận được với nhiều hệ thống RISC-V hơn, không chỉ giới hạn trong các thiết kế doanh nghiệp chuyên biệt. Nếu điều đó xảy ra, cộng đồng RISC-V nói riêng và ngành công nghệ nói chung sẽ có thêm một lựa chọn kiến trúc thực sự cạnh tranh - một điều tốt cho tất cả mọi người.
Bài viết liên quan

Công nghệ
Trí thông minh của bạch tuộc có thể liên quan đến đột biến gen chưa từng thấy
24 tháng 8, 2026

Công nghệ
Hot Chips 2026: High Bandwidth Flash (HBF) – Giải pháp mới cho cơn khát bộ nhớ AI?
24 tháng 8, 2026
Công nghệ
Trump muốn kìm hãm năng lượng sạch, nhưng ngành này vẫn bùng nổ kỷ lục
24 tháng 8, 2026