DFlash 2: Bước tiến mới trong giải mã song song cho AI, tăng tốc độ suy luận lên 3 lần

Công nghệ19 tháng 8, 2026·5 phút đọc

DFlash 2, phiên bản nâng cấp của kỹ thuật giải mã suy đoán DFlash do Inco AI phát triển, giúp tăng thêm hơn 20% sản lượng token cho mỗi lần xác minh với chi phí độ trễ chỉ khoảng 1%. Công nghệ này đã được tích hợp vào các engine suy luận chính như SGLang, vLLM, llama.cpp, mang lại tốc độ suy luận nhanh gấp 2.7-3.4 lần so với giải mã tự hồi quy trên mô hình Qwen3.8-27B.

DFlash 2: Bước tiến mới trong giải mã song song cho AI, tăng tốc độ suy luận lên 3 lần

DFlash 2: Bước tiến mới trong giải mã song song cho AI, tăng tốc độ suy luận lên 3 lần

DFlash 2, phiên bản nâng cấp của kỹ thuật giải mã suy đoán (speculative decoding) do Inco AI phát triển, hứa hẹn mang lại hiệu suất vượt trội cho các hệ thống AI tác nhân (agent). Công nghệ này giúp tăng hơn 20% sản lượng token cho mỗi lần xác minh với chi phí độ trễ chỉ khoảng 1%, đồng thời đã được tích hợp vào các engine suy luận phổ biến như SGLang, vLLM, và llama.cpp.

Khác với các phương pháp trước đây, DFlash 2 tập trung vào hai cải tiến chính: bộ chọn đường dẫn nhẹ (lightweight path selector) giúp chọn ra chuỗi token mạch lạc nhất từ các ứng viên, và tích chập động (dynamic convolution) để giải quyết vấn đề suy giảm độ chính xác ở cuối khối token. Kết quả là tốc độ suy luận trên mô hình Qwen3.8-27B đạt 2,7–3,4 lần so với giải mã tự hồi quy (autoregressive) thông thường.

Bối cảnh: Vì sao suy luận trở thành nút thắt của kỷ nguyên AI tác nhân?

Trong kỷ nguyên AI tác nhân, các mô hình không chỉ trò chuyện mà còn đọc, lập kế hoạch và gọi công cụ trong nhiều giờ, thậm chí nhiều ngày. Chúng tiêu thụ token ở mức độ mà trò chuyện thông thường chưa từng đạt tới. Mỗi token đó đều cần một lần truyền xuôi (forward pass) qua toàn bộ mô hình, tạo ra áp lực khổng lồ lên hạ tầng suy luận.

Giải mã suy đoán (speculative decoding) đã trở thành một phần cốt lõi của ngăn xếp suy luận hiện đại. Một mô hình nhỏ (draft model) dự đoán một khối token, sau đó mô hình chính (target model) xác minh toàn bộ khối trong một lần truyền duy nhất. Dự đoán tốt sẽ biến một lần truyền thành nhiều token; dự đoán sai sẽ bị loại bỏ.

DFlash, ra mắt vào tháng 1, đã tạo ra bước đột phá khi cho phép dự đoán toàn bộ khối token song song thay vì tuần tự từng token một. NVIDIA đo được hiệu suất tăng 15 lần trên GPU Blackwell, Google ghi nhận 3 lần token mỗi giây trên TPU. Đến nay, hệ sinh thái đã có hơn 3,5 triệu lượt tải xuống trên Hugging Face.

Cải tiến 1: Bộ chọn đường dẫn – Kỹ thuật chọn token thông minh hơn

DFlash dự đoán mỗi vị trí một cách độc lập và song song, nhưng các token này có thể không mạch lạc với nhau, dẫn đến khối bị cắt ngắn khi xác minh. Các phương pháp gần đây như Domino và DSpark sử dụng các đầu tuần tự để viết lại phân phối từ vựng, nhưng cách này tốn kém.

Nghiên cứu của Inco AI cho thấy một hướng đi khác: ngay cả khi lựa chọn hàng đầu sai, token đúng thường nằm trong top 16 ứng viên với xác suất lên tới 99,5%. Vì vậy, DFlash 2 giữ lại top 16 ứng viên tại mỗi vị trí và sử dụng một bộ chọn để:

  • Tính điểm cho mọi cặp liền kề (bilinear attention trọng số thấp)
  • Tìm ra một đường đi mạch lạc xuyên qua các ứng viên
  • Chỉ cần thêm 2 triệu tham số và 0,6% độ trễ chu kỳ

Kết quả: DFlash 2 vượt trội hơn DSpark tới 0,34 token ở T=0 và 0,47 token ở T=1, với số tham số ít hơn khoảng 40 lần và độ trễ thấp hơn 16 lần.

Cải tiến 2: Tích chập động – Giải quyết bài toán suy giảm hậu tố

Một vấn đề khác được phát hiện là suy giảm hậu tố (suffix decay): độ chính xác của dự đoán giảm dần về cuối khối token. Ngay cả với một "nhà tiên tri" hoàn hảo, độ chính xác vẫn giảm từ 99,5% ở vị trí đầu xuống 87,8% ở vị trí cuối.

Nguyên nhân được xác định là do mô hình nền (backbone) quá nhỏ để duy trì các phụ thuộc dài hạn. Tuy nhiên, thay vì thêm 10 lớp Transformer tốn kém (tăng 15,2% độ trễ), Inco AI đã chèn các tích chập động hai chạm (two-tap dynamic convolution) trước và sau mỗi lớp attention và feed-forward:

  • Chỉ thêm 16,5 triệu tham số (3%) và 0,7% độ trễ chu kỳ
  • Gần bằng hiệu quả của việc thêm 10 lớp Transformer
  • Attention trong các lớp 4 và 5 giảm từ 9,4% xuống 0,5% cho công việc nội bộ, giải phóng tài nguyên để đọc ngữ cảnh

Kết quả và triển khai

DFlash 2 đã được tích hợp vào các engine chính:

  • SGLang: pip install "sglang[all] @ git+https://github.com/sgl-project/sglang.git#subdirectory=python"
  • vLLM: thông qua pull request #52816
  • llama.cpp: PR #27342 trên GitHub
  • oMLX: bản dựng sẵn cho Apple Silicon

Các benchmark trên mô hình Qwen3.5-4B cho thấy DFlash 2 có độ dài chấp nhận trung bình (acceptance length) 5.97 token, vượt trội so với MTP (4.54), DFlash (4.92) và DSpark (5.49). Trên các mô hình lớn hơn:

  • Qwen3.8-27B: nhanh gấp 2,7–3,4 lần giải mã tự hồi quy
  • Muse Glimmer: nhanh gấp 3,1–4,6 lần

Kết luận và triển vọng

"Một tác nhân AI viết trong một buổi chiều những gì chatbot viết trong một tháng, và giải mã nằm dưới mỗi token đó. DFlash 2 giải mã với tốc độ gần 3 lần so với giải mã tự hồi quy, với một phần ba chi phí tính toán cho mỗi token, và đầu ra không đổi."

Trong 7 tháng, DFlash đã từ bài nghiên cứu trở thành tiêu chuẩn ngành với hơn 3,5 triệu lượt tải. DFlash 2 hiện có sẵn hai drafters trên Hugging Face, hứa hẹn mở ra kỷ nguyên suy luận nhanh hơn, rẻ hơn cho các ứng dụng AI tác nhân quy mô lớn — một xu hướng quan trọng mà các kỹ sư AI tại Việt Nam cũng đang theo dõi sát sao để tối ưu chi phí vận hành.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗