vLLM v0.28.0 ra mắt: Cải thiện hiệu năng lớn cho Kimi-K3, DeepSeek V4 và mở rộng hỗ trợ phần cứng
vLLM v0.28.0 là bản phát hành lớn với 584 commit từ 270 nhà đóng góp, tập trung tối ưu hiệu năng cho các mô hình Kimi-K3 và DeepSeek V4. Phiên bản này cũng giới thiệu nhiều cải tiến về kỹ thuật suy luận suy đoán (speculative decoding), quản lý KV cache phân tầng, cùng hỗ trợ mở rộng cho các nền tảng phần cứng như AMD ROCm, Intel XPU và CPU.

vLLM v0.28.0: Bản cập nhật lớn với hàng loạt cải tiến hiệu năng cho AI
vLLM, một trong những framework suy luận (inference) mã nguồn mở phổ biến nhất hiện nay, vừa chính thức phát hành phiên bản v0.28.0. Đây là một bản cập nhật quan trọng với 584 commit từ 270 nhà đóng góp (trong đó có 76 nhà đóng góp mới), đánh dấu những bước tiến vượt bậc về hiệu năng, khả năng mở rộng và hỗ trợ phần cứng mới. Bản phát hành này tập trung mạnh vào việc tối ưu cho các mô hình ngôn ngữ lớn thế hệ mới như Kimi-K3 và DeepSeek V4, đồng thời mang đến nhiều cải tiến hạ tầng quan trọng cho các hệ thống phục vụ quy mô lớn.
Điểm nổi bật: Hiệu năng đột phá cho Kimi-K3 và DeepSeek V4
Bản phát hành này dành sự chú trọng đặc biệt cho hai dòng mô hình đang rất được quan tâm.
-
Tối ưu hóa toàn diện cho Kimi-K3: vLLM đã thực hiện một nỗ lực tối ưu hóa lớn trên toàn bộ hệ thống, bao gồm hỗ trợ Decode Context Parallel (DCP), tích hợp các kernel FlashKDA mới, hỗ trợ hàm kích hoạt SiTU cho MegaMoE, và cải thiện tốc độ kernel từ 1,5 đến 3 lần nhờ kết hợp các thao tác all-gather.
-
Ngân sách token suy đoán thích ứng: Cải tiến này mang lại hiệu quả tốt hơn khoảng 60% về thời gian phản hồi token đầu tiên (TTFT) cho kỹ thuật DSpark, một phương pháp suy luận suy đoán tiên tiến.
-
Hỗ trợ DeepSeek V4 hoàn thiện: Sparse MLA (Multi-head Latent Attention) nay hoạt động end-to-end cho các chế độ decode thông thường, MTP (Multi-Token Prediction) và DSpark. Phiên bản này cũng bổ sung hỗ trợ AMD Quark NVFP4 và kích hoạt trên nền tảng ROCm cho các GPU gfx11 và gfx950.
Những tiến bộ kỹ thuật quan trọng khác
Ngoài hai mô hình chủ lực, vLLM v0.28.0 còn mang đến một loạt cải tiến kỹ thuật đáng chú ý.
Kỹ thuật suy luận suy đoán (Speculative Decoding) tiên tiến
Phiên bản này giới thiệu DFlash2 với tích hợp phép tích chập cục bộ và bộ chọn ứng viên, cùng DSpark với cơ chế xác minh theo độ tin cậy. Đáng chú ý, lập lịch không đồng bộ (async scheduling) nay được tự động kích hoạt cho các mô hình draft, giúp tăng tốc quá trình suy luận một cách đáng kể.
Model Runner V2 trưởng thành hơn
Kiến trúc Model Runner V2 được tiếp tục hoàn thiện với hỗ trợ cho việc tách rời các thành phần Encoder/Processor/Decoder (E/P/D), kỹ thuật giảm tải trọng số (weight offloading), và hỗ trợ bộ nhớ đệm KV đa tầng cho MTP. Điều này cho phép các hệ thống xử lý các mô hình phức tạp một cách linh hoạt và hiệu quả hơn.
Quản lý KV Cache phân tầng và kỹ thuật mới
vLLM giờ đây hỗ trợ giảm tải KV cache xuống đĩa cứng, giúp xử lý các ngữ cảnh cực dài mà không bị giới hạn bởi bộ nhớ GPU. Bản phát hành cũng giới thiệu một bố cục CPU chuẩn hóa cho phép hoạt động song song hóa (parallelism-agnostic offload) linh hoạt hơn.
Giao diện Rust và gRPC mạnh mẽ
Frontend Rust có thêm các khả năng mới như renderer độc lập, suy luận ảnh đa phương thức qua gRPC, định tuyến rank theo luồng dữ liệu song song, và kiểm soát vòng đời cho các tác vụ học tăng cường (RL). Các lược đồ protobuf cũng đã được xuất bản lên Buf Registry, giúp các nhà phát triển dễ dàng tích hợp hơn.
Mở rộng hỗ trợ phần cứng và hệ sinh thái
vLLM v0.28.0 không chỉ tập trung vào phần mềm mà còn mở rộng đáng kể khả năng tương thích phần cứng.
Hỗ trợ đa nền tảng
- AMD ROCm: Nâng cấp lên torch 2.12/triton 3.7, kích hoạt AITER và FP8 trên các GPU GFX120x, tối ưu kernel sparse-MLA cho gfx950.
- Intel XPU: Bổ sung backend torch linear với GEMM theo khối, hỗ trợ MXFP8 linear weights và thêm wheel XPU vào quy trình phát hành.
- CPU: Bổ sung backend MLA cho phép chạy DeepSeek-V2/V3 trên CPU, hỗ trợ kiến trúc s390x và tối ưu cho AMD thông qua zentorch.
Cải thiện bảo mật
Bản phát hành này cũng vá một lỗ hổng bảo mật từ chối dịch vụ (DoS) liên quan đến việc giả mạo tỷ lệ mẫu âm thanh, vốn có thể vượt qua cơ chế kiểm soát thời lượng giải mã. Các giới hạn về kiến trúc GPU và pixel cũng được thắt chặt hơn.
Kết luận
vLLM v0.28.0 là một bản phát hành mang tính bước ngoặt, khẳng định vị thế của dự án trong việc cung cấp giải pháp suy luận AI hiệu năng cao. Với 76 nhà đóng góp mới và hàng loạt cải tiến kỹ thuật, vLLM tiếp tục là lựa chọn hàng đầu cho các doanh nghiệp và nhà nghiên cứu muốn triển khai các mô hình ngôn ngữ lớn một cách hiệu quả. Người dùng có thể nâng cấp lên phiên bản mới nhất qua pip hoặc Docker để trải nghiệm những cải tiến đáng kể về tốc độ và khả năng mở rộng.


