Chạy ứng dụng CUDA trên GPU AMD Windows: Giải pháp ZLUDA + ROCm/HIP đã hoạt động

Phần mềm13 tháng 9, 2026·5 phút đọc

Một kho GitHub mới công bố quy trình có thể tái lập để chạy các ứng dụng Windows hướng CUDA trên GPU AMD thông qua ZLUDA kết hợp ROCm/HIP. Cấu hình này đã được xác minh trên card Radeon RX 9060 XT với LibTorch 2.3.0+cu118, mở ra hy vọng cho cộng đồng AI và tính toán hiệu năng cao trên nền tảng AMD.

Chạy ứng dụng CUDA trên GPU AMD Windows: Giải pháp ZLUDA + ROCm/HIP đã hoạt động

Chạy ứng dụng CUDA trên GPU AMD Windows: Giải pháp ZLUDA + ROCm/HIP đã hoạt động

Một dự án mã nguồn mở mang tên CUDA-for-AMD-Windows vừa công bố quy trình có thể tái lập để chạy các ứng dụng Windows hướng CUDA trên GPU AMD. Cấu hình này dựa trên sự kết hợp giữa ZLUDA, AMD HIP SDKROCm, đã được xác minh trên card Radeon RX 9060 XT (gfx1200) với LibTorch 2.3.0+cu118. Đây là bước tiến đáng chú ý cho những ai muốn tận dụng GPU AMD cho các tác vụ AI và tính toán hiệu năng cao vốn thường bị ràng buộc bởi hệ sinh thái CUDA của NVIDIA.

Nền tảng Windows x64Nền tảng Windows x64

CUDA trên AMD: Bài toán khó đã có lời giải?

Từ lâu, CUDA là chuẩn de facto cho lập trình tính toán song song trên GPU. Tuy nhiên, nó gắn chặt với phần cứng NVIDIA, khiến người dùng AMD gặp không ít khó khăn khi muốn chạy các ứng dụng AI, học máy hay mô phỏng khoa học vốn được tối ưu cho CUDA. Giải pháp thay thế như ROCm/HIP tuy mạnh mẽ nhưng chưa phổ cập trên Windows như trên Linux.

Dự án mới này giải quyết vấn đề bằng cách dùng ZLUDA — một lớp tương thích dịch các lời gọi CUDA sang HIP/ROCm. Quy trình được thiết kế để chạy các ứng dụng tính toán hướng CUDA, bao gồm cả những workload dùng LibTorch có hỗ trợ CUDA.

GPU AMD RadeonGPU AMD Radeon

Cấu hình đã được xác minh

Theo tài liệu của dự án, đường dẫn chính thức chỉ dùng các thành phần upstream, không cần bất kỳ DLL riêng tư hay phục hồi nào. Các thành phần đã được kiểm tra gồm:

  • ZLUDA v6-preview.69 từ bản phát hành chính thức
  • AMD HIP SDK 6.4
  • LibTorch 2.3.0 + cu118
  • Card RX 9060 XT / gfx1200

Kết quả kiểm tra cho thấy các thư viện nvcuda, cuBLAS, cuBLASLt, cuSPARSEcuFFT đều vượt qua bài kiểm tra cuda_check. Đáng chú ý hơn, một mạng PPO với 2.216.347 tham số đã hoàn thành quá trình suy luận, học và tối ưu hóa trên thiết bị hướng CUDA. Một vòng xác minh sạch đã chạy hết 65.536 bước thời gian bằng runtime do kho lưu trữ này tạo ra.

Điều này không có nghĩa mọi chương trình CUDA hay mô hình AI đều chạy được. Phạm vi bao phủ API/thư viện CUDA phụ thuộc vào từng workload cụ thể.

Kiến trúc hoạt động như thế nào?

Luồng thực thi của giải pháp diễn ra theo các lớp kế tiếp:

  • Ứng dụng Windows hướng CUDA
  • ZLUDA (lớp tương thích)
  • cuBLAS / cuSPARSE / cuFFT (tương thích)
  • rocBLAS / hipBLASLt / rocSPARSE / HIP
  • GPU AMD

Cách cài đặt

Quy trình cài đặt khá đơn giản với vài bước chính:

  1. Cài đặt điều kiện tiên quyết của AMD: Driver GPU AMD mới nhất và AMD HIP SDK cho Windows (bao gồm HIP Libraries). Bản tham chiếu đã xác minh là HIP SDK 6.4.

  2. Clone và chạy trình cài đặt:

git clone https://github.com/Speedstu/CUDA-for-AMD-Windows.git
cd CUDA-for-AMD-Windows
powershell -ExecutionPolicy Bypass -File .\scripts\install.ps1

Script install.ps1 sẽ tự động phát hiện GPU AMD và kiến trúc gfxXXXX, xác minh driver/HIP SDK, tải bản ZLUDA chính thức đã ghim phiên bản, tải LibTorch 2.3.0+cu118 (khoảng 2,66 GB), kiểm tra mã băm SHA-256 và chạy cuda_check.exe. Nếu không cần LibTorch, có thể dùng tùy chọn -SkipLibTorch.

  1. Chạy ứng dụng hướng CUDA:
.\scripts\run-zluda.ps1 -Program C:\path\to\app.exe

Trình khởi chạy sẽ đặt các DLL tương thích ZLUDA bên cạnh ứng dụng đích và thiết lập đường dẫn runtime HIP/ROCm cho lần chạy đó.

Những hạn chế cần lưu ý

Dù đầy hứa hẹn, giải pháp này vẫn còn nhiều giới hạn:

  • Chỉ RX 9060 XT / gfx1200 được xác minh chính thức. Các GPU AMD khác chỉ là ứng viên tiềm năng, chưa được đảm bảo.
  • ZLUDA không phải là bản triển khai CUDA hoàn chỉnh.
  • Windows chỉ cung cấp một tập con của hệ sinh thái ROCm đầy đủ.
  • cuDNN/MIOpen không khả dụng trong đường dẫn HIP SDK ổn định đã xác minh, nên các phần mềm nặng về tích chập có thể cần stack HIP mới hơn hoặc nightly.
  • NCCL, TensorRT, hành vi PTX không được hỗ trợ và một số tiện ích mở rộng CUDA tùy chỉnh có thể thất bại.

Hiệu năng và đóng góp cộng đồng

Các lần chạy tinh chỉnh trước đây của đường dẫn ZLUDA + LibTorch đạt khoảng 70.000–109.000 bước/giây trên RX 9060 XT tham chiếu. Lần xác minh mới chỉ là bài kiểm tra tính đúng đắn ngắn, không phải benchmark được tinh chỉnh.

Dự án khuyến khích người dùng thử nghiệm trên các GPU khác và báo cáo kết quả — kể cả thất bại cũng hữu ích. Công cụ gpu-scan.ps1 ghi lại model, kiến trúc gfx, driver và thông tin HIP mà không thu thập tên người dùng, token hay tệp cá nhân.

Trạng thái kiểm thử tự độngTrạng thái kiểm thử tự động

Ý nghĩa với người dùng Việt Nam

Với cộng đồng AI và lập trình viên Việt Nam — những người thường cân nhắc giữa chi phí và hiệu năng khi chọn GPU — giải pháp này mở ra khả năng tận dụng các card AMD Radeon vốn có giá cạnh tranh hơn để chạy các workload học sâu. Tuy nhiên, do mới chỉ xác minh trên một mẫu card duy nhất, người dùng nên kiểm tra kỹ trước khi đầu tư vào cấu hình dựa trên công nghệ này. Các script và tài liệu của dự án được cấp phép MIT, trong khi ZLUDA, AMD ROCm/HIP, NVIDIA CUDA và PyTorch/LibTorch vẫn giữ giấy phép upstream riêng.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗