DFlash 2: Bước tiến mới trong giải mã song song cho AI, tăng tốc độ suy luận lên 3 lần
DFlash 2, phiên bản nâng cấp của kỹ thuật giải mã suy đoán DFlash do Inco AI phát triển, giúp tăng thêm hơn 20% sản lượng token cho mỗi lần xác minh với chi phí độ trễ chỉ khoảng 1%. Công nghệ này đã được tích hợp vào các engine suy luận chính như SGLang, vLLM, llama.cpp, mang lại tốc độ suy luận nhanh gấp 2.7-3.4 lần so với giải mã tự hồi quy trên mô hình Qwen3.8-27B.

DFlash 2: Bước tiến mới trong giải mã song song cho AI, tăng tốc độ suy luận lên 3 lần
DFlash 2, phiên bản nâng cấp của kỹ thuật giải mã suy đoán (speculative decoding) do Inco AI phát triển, hứa hẹn mang lại hiệu suất vượt trội cho các hệ thống AI tác nhân (agent). Công nghệ này giúp tăng hơn 20% sản lượng token cho mỗi lần xác minh với chi phí độ trễ chỉ khoảng 1%, đồng thời đã được tích hợp vào các engine suy luận phổ biến như SGLang, vLLM, và llama.cpp.
Khác với các phương pháp trước đây, DFlash 2 tập trung vào hai cải tiến chính: bộ chọn đường dẫn nhẹ (lightweight path selector) giúp chọn ra chuỗi token mạch lạc nhất từ các ứng viên, và tích chập động (dynamic convolution) để giải quyết vấn đề suy giảm độ chính xác ở cuối khối token. Kết quả là tốc độ suy luận trên mô hình Qwen3.8-27B đạt 2,7–3,4 lần so với giải mã tự hồi quy (autoregressive) thông thường.
Bối cảnh: Vì sao suy luận trở thành nút thắt của kỷ nguyên AI tác nhân?
Trong kỷ nguyên AI tác nhân, các mô hình không chỉ trò chuyện mà còn đọc, lập kế hoạch và gọi công cụ trong nhiều giờ, thậm chí nhiều ngày. Chúng tiêu thụ token ở mức độ mà trò chuyện thông thường chưa từng đạt tới. Mỗi token đó đều cần một lần truyền xuôi (forward pass) qua toàn bộ mô hình, tạo ra áp lực khổng lồ lên hạ tầng suy luận.
Giải mã suy đoán (speculative decoding) đã trở thành một phần cốt lõi của ngăn xếp suy luận hiện đại. Một mô hình nhỏ (draft model) dự đoán một khối token, sau đó mô hình chính (target model) xác minh toàn bộ khối trong một lần truyền duy nhất. Dự đoán tốt sẽ biến một lần truyền thành nhiều token; dự đoán sai sẽ bị loại bỏ.
DFlash, ra mắt vào tháng 1, đã tạo ra bước đột phá khi cho phép dự đoán toàn bộ khối token song song thay vì tuần tự từng token một. NVIDIA đo được hiệu suất tăng 15 lần trên GPU Blackwell, Google ghi nhận 3 lần token mỗi giây trên TPU. Đến nay, hệ sinh thái đã có hơn 3,5 triệu lượt tải xuống trên Hugging Face.
Cải tiến 1: Bộ chọn đường dẫn – Kỹ thuật chọn token thông minh hơn
DFlash dự đoán mỗi vị trí một cách độc lập và song song, nhưng các token này có thể không mạch lạc với nhau, dẫn đến khối bị cắt ngắn khi xác minh. Các phương pháp gần đây như Domino và DSpark sử dụng các đầu tuần tự để viết lại phân phối từ vựng, nhưng cách này tốn kém.
Nghiên cứu của Inco AI cho thấy một hướng đi khác: ngay cả khi lựa chọn hàng đầu sai, token đúng thường nằm trong top 16 ứng viên với xác suất lên tới 99,5%. Vì vậy, DFlash 2 giữ lại top 16 ứng viên tại mỗi vị trí và sử dụng một bộ chọn để:
- Tính điểm cho mọi cặp liền kề (bilinear attention trọng số thấp)
- Tìm ra một đường đi mạch lạc xuyên qua các ứng viên
- Chỉ cần thêm 2 triệu tham số và 0,6% độ trễ chu kỳ
Kết quả: DFlash 2 vượt trội hơn DSpark tới 0,34 token ở T=0 và 0,47 token ở T=1, với số tham số ít hơn khoảng 40 lần và độ trễ thấp hơn 16 lần.
Cải tiến 2: Tích chập động – Giải quyết bài toán suy giảm hậu tố
Một vấn đề khác được phát hiện là suy giảm hậu tố (suffix decay): độ chính xác của dự đoán giảm dần về cuối khối token. Ngay cả với một "nhà tiên tri" hoàn hảo, độ chính xác vẫn giảm từ 99,5% ở vị trí đầu xuống 87,8% ở vị trí cuối.
Nguyên nhân được xác định là do mô hình nền (backbone) quá nhỏ để duy trì các phụ thuộc dài hạn. Tuy nhiên, thay vì thêm 10 lớp Transformer tốn kém (tăng 15,2% độ trễ), Inco AI đã chèn các tích chập động hai chạm (two-tap dynamic convolution) trước và sau mỗi lớp attention và feed-forward:
- Chỉ thêm 16,5 triệu tham số (3%) và 0,7% độ trễ chu kỳ
- Gần bằng hiệu quả của việc thêm 10 lớp Transformer
- Attention trong các lớp 4 và 5 giảm từ 9,4% xuống 0,5% cho công việc nội bộ, giải phóng tài nguyên để đọc ngữ cảnh
Kết quả và triển khai
DFlash 2 đã được tích hợp vào các engine chính:
- SGLang:
pip install "sglang[all] @ git+https://github.com/sgl-project/sglang.git#subdirectory=python" - vLLM: thông qua pull request #52816
- llama.cpp: PR #27342 trên GitHub
- oMLX: bản dựng sẵn cho Apple Silicon
Các benchmark trên mô hình Qwen3.5-4B cho thấy DFlash 2 có độ dài chấp nhận trung bình (acceptance length) 5.97 token, vượt trội so với MTP (4.54), DFlash (4.92) và DSpark (5.49). Trên các mô hình lớn hơn:
- Qwen3.8-27B: nhanh gấp 2,7–3,4 lần giải mã tự hồi quy
- Muse Glimmer: nhanh gấp 3,1–4,6 lần
Kết luận và triển vọng
"Một tác nhân AI viết trong một buổi chiều những gì chatbot viết trong một tháng, và giải mã nằm dưới mỗi token đó. DFlash 2 giải mã với tốc độ gần 3 lần so với giải mã tự hồi quy, với một phần ba chi phí tính toán cho mỗi token, và đầu ra không đổi."
Trong 7 tháng, DFlash đã từ bài nghiên cứu trở thành tiêu chuẩn ngành với hơn 3,5 triệu lượt tải. DFlash 2 hiện có sẵn hai drafters trên Hugging Face, hứa hẹn mở ra kỷ nguyên suy luận nhanh hơn, rẻ hơn cho các ứng dụng AI tác nhân quy mô lớn — một xu hướng quan trọng mà các kỹ sư AI tại Việt Nam cũng đang theo dõi sát sao để tối ưu chi phí vận hành.
Bài viết liên quan

Công nghệ
Anthropic Từ Chối Hỗ Trợ AGENTS.md: Bước Lùi Trong Tiêu Chuẩn Hóa Công Cụ AI Coding?
19 tháng 8, 2026

Công nghệ
CHAP: Giao thức mới giúp con người và AI làm việc chung một cách minh bạch, có thể kiểm chứng
19 tháng 8, 2026

Công nghệ
SvelteKit 3 tạo áp lực lớn lên Next.js với cách tiếp cận đột phá cho RPC
19 tháng 8, 2026