Huawei ra mắt NPU Ascend thế hệ mới: Tham vọng thoát khỏi bóng Nvidia
Tại hội nghị Connect, Huawei đã công bố thế hệ chip AI Ascend 960DT với hiệu năng vượt trội so với những gì Nvidia được phép bán tại Trung Quốc. Chip dự kiến ra mắt sớm hơn ba quý so với kế hoạch, hứa hẹn mang lại lựa chọn nội địa mạnh mẽ cho các nhà phát triển AI Trung Quốc.

Huawei vừa gây chú ý tại hội nghị thường niên Connect khi công bố thế hệ chip tăng tốc AI mới, hứa hẹn hiệu năng vượt xa bất kỳ sản phẩm nào mà Nvidia được phép bán tại Trung Quốc. Đây có thể là tin vui lớn cho các nhà phát triển AI trong nước, những người vốn quen với việc phải mua những con chip yếu hơn từ "tay buôn vũ khí AI" số một thế giới.
Ascend 960DT: Hiệu năng vượt trội, ra mắt sớm hơn kế hoạch
Chip mang tên mã Ascend 960DT — trong đó DT được cho là viết tắt của decode/training — dự kiến sẽ ra mắt sớm hơn ba quý so với kế hoạch ban đầu, cụ thể là vào quý I/2027. Đây là bước tiến đáng kể trong lộ trình phát triển chip AI của Huawei.
Về thông số kỹ thuật, Ascend 960DT sở hữu:
- Dung lượng bộ nhớ lên tới 288 GB sử dụng công nghệ HiZQ do Huawei tự phát triển, thay thế cho bộ nhớ băng thông cao (HBM) mà phần còn lại của thế giới đang dùng
- Hiệu năng lên tới 4 petaFLOPS ở FP4 (một nửa ở FP8)
- Hiệu năng và dung lượng bộ nhớ gấp đôi so với dòng 950-series ra mắt hồi đầu năm nay
So với các GPU của Mỹ, 960DT có dung lượng bộ nhớ và băng thông tương đương dòng B300 của Nvidia ra mắt năm ngoái, nhưng chỉ đạt khoảng một nửa hiệu năng FP8 và một phần ba hiệu năng FP4.
Dù là bước tiến lớn đối với nhà thiết kế chip Trung Quốc, Huawei vẫn còn chặng đường dài để đuổi kịp Rubin của Nvidia và MI455X mới ra mắt của AMD.
Cần lưu ý rằng cả hai dòng chip trên đều không được bán tại Trung Quốc, nên các nhà phát triển mô hình AI nước này thực tế không có lựa chọn nào tốt hơn. Chiếc GPU tốt nhất mà Nvidia được phép bán tại Trung Quốc chỉ cung cấp hiệu năng dấu phẩy động tương đương, gấp đôi bộ nhớ, gấp đôi băng thông và hỗ trợ quy mô lớn hơn.
Chiến lược mở rộng quy mô: Vũ khí bí mật của Huawei
Khoảng cách hiệu năng có thể không nghiêm trọng như vẻ ngoài của nó. Các mô hình AI ngày nay hiếm khi được huấn luyện hoặc chạy trên một GPU hay NPU duy nhất. Yếu tố quan trọng hơn thường là khả năng mở rộng quy mô của nền tảng.
Các hệ thống mới nhất của Nvidia và AMD đóng gói 72 GPU vào một nền tảng cấp rack, có thể mở rộng lên 576 bằng kết nối quang học. Huawei cũng đi theo hướng tương tự với dòng 960-series, sử dụng công nghệ quang học đóng gói gần (NPO) để mở rộng miền tính toán lên tới 4.096 chip, cung cấp tới 16 exaFLOPS hiệu năng FP4.
Điều Huawei thiếu về mật độ tính toán, hãng bù đắp bằng quy mô — chiến thuật tương tự mà Google từng áp dụng với các pod TPU. Điều này không gây ngạc nhiên khi mà mạng tốc độ cao vốn là sở trường của Huawei.
Công nghệ NPO giải quyết một thách thức lớn trong các thiết kế Huawei trước đây: module quang cắm rời tiêu tốn nhiều điện năng, dễ hỏng và chiếm nhiều không gian. Huawei cho biết NPO đã cho phép họ hợp nhất 48.000 module quang 800 Gbps thành 5.500 đơn vị Hi-One NPO, cắt giảm 550 kilowatt điện năng tiêu thụ và giảm một nửa tỷ lệ hỏng hóc, đạt 99,8% thời gian hoạt động.
Đây là tin đáng mừng cho các nhà xây dựng mô hình Trung Quốc đang chịu áp lực chuyển sang thiết bị nội địa. DeepSeek được cho là từng gặp khó khăn khi dùng NPU thế hệ trước của Huawei để huấn luyện và cuối cùng phải quay lại với GPU Nvidia.
Ascend 960PR: Phiên bản tối ưu cho suy luận
Bên cạnh 960DT băng thông cao, Huawei cũng đang chuẩn bị phiên bản tối ưu tính toán có tên 960PR cho quý III/2027. Phiên bản này đóng vai trò tương tự các accelerator Rubin CPX của Nvidia trước khi bị hủy hồi đầu năm nay.
PR được cho là viết tắt của prefill và recommenders. Chip này đánh đổi dung lượng và băng thông bộ nhớ để lấy hiệu năng tính toán độ chính xác thấp cao hơn:
- 8 petaFLOPS hiệu năng FP4
- 192 GB bộ nhớ HiBL tùy chỉnh, băng thông 2,4 TB/s
Chip này được thiết kế để hoạt động song song với 960DT nhằm tăng cường hiệu năng suy luận LLM. Giai đoạn prefill (xử lý prompt) được giao cho 960PR, trong khi giai đoạn decode (tạo token đầu ra) chạy trên 960DT.
Kiến trúc không đồng nhất này đã chứng minh hiệu quả trong việc tăng hiệu năng, tương tự cách Nvidia kết hợp Vera Rubin và Groq LPX. Điểm khác biệt chính là Huawei chưa có accelerator decode chuyên dụng dựa trên SRAM.
Tham vọng cụm triệu NPU và lộ trình tương lai
Tại Connect, Huawei đã tuyên bố ý định mở rộng cụm tính toán lên nửa triệu NPU trở lên. Trong một chứng minh khái niệm, hãng thông báo đã mở rộng thành công siêu pod TaiShan dựa trên Ascend 950 lên 4.096 accelerator. Với cấu trúc mạng Clos hai tầng bốn mặt phẳng, Huawei kỳ vọng sẽ sớm hỗ trợ các cụm lên tới 512.000 NPU, và với kiến trúc multi-rail, siêu cụm triệu NPU nằm trong tầm khả thi.
Tuy nhiên, đây dường như chỉ là cấu hình lý thuyết, chưa được chứng minh thực tế.
Huawei cũng tiết lộ hai thế hệ Ascend tiếp theo:
- Dòng Ascend 970 (2028): lên tới 3,6 petaFLOPS FP8 hoặc 14 petaFLOPS FP4, bộ nhớ 288 GB, băng thông 14,4 TB/s
- Thế hệ 2029: tăng gấp đôi lên 7,2 petaFLOPS FP8 và 28 petaFLOPS FP4, bộ nhớ 384 GB, băng thông 38,4 TB/s
Lộ trình này cho thấy Huawei đang tập trung nhiều diện tích die hơn cho các kiểu dữ liệu độ chính xác thấp, xu hướng tương tự ở chip mới của AMD và Nvidia.
Góc nhìn cho Việt Nam
Đối với Việt Nam, sự phát triển của Huawei trong lĩnh vực chip AI có ý nghĩa quan trọng. Khi các lệnh trừng phạt của Mỹ tiếp tục hạn chế khả năng tiếp cận chip Nvidia tiên tiến tại khu vực, các lựa chọn thay thế từ Huawei có thể mở ra cơ hội mới cho các doanh nghiệp và trung tâm dữ liệu trong nước.
Tuy nhiên, việc phụ thuộc vào hệ sinh thái công nghệ Trung Quốc cũng đặt ra những cân nhắc về địa chính trị và an ninh mạng. Các nhà hoạch định chính sách Việt Nam sẽ cần đánh giá kỹ lưỡng giữa lợi ích về chi phí, hiệu năng và rủi ro chiến lược khi lựa chọn nền tảng tính toán AI cho hạ tầng quốc gia.


