ShapeLearn ra mắt bộ model Qwen 3.8 27B lượng tử hóa, chạy mượt trên GPU 13 GB VRAM

Công nghệ18 tháng 9, 2026·6 phút đọc

ByteShape công bố bộ model ShapeLearn đầy đủ cho Qwen 3.8 27B, đạt 99,63% chất lượng bản gốc BF16 chỉ với 13,1 GB VRAM. Năm phiên bản model đều nằm trên đường biên chất lượng - tốc độ trên cả sáu dòng GPU thử nghiệm, nhờ kết hợp lượng tử hóa và kỹ thuật giải mã suy đoán MTP/DFlash2.

ShapeLearn ra mắt bộ model Qwen 3.8 27B lượng tử hóa, chạy mượt trên GPU 13 GB VRAM

ShapeLearn ra mắt bộ model Qwen 3.8 27B lượng tử hóa, chạy mượt trên GPU 13 GB VRAM

ByteShape vừa công bố bộ model ShapeLearn đầy đủ dành cho Qwen 3.8 27B — dòng mô hình ngôn ngữ lớn mà nhiều lập trình viên Việt Nam đang quan tâm nhờ khả năng suy luận và lập trình mạnh mẽ. Điểm đáng chú ý nhất: phiên bản GPU-5 (IQ4_XS, 3,84 bpw) đạt 99,63% điểm benchmark so với bản gốc BF16, trong khi chỉ chiếm 13,1 GB VRAM — nghĩa là có thể chạy ngon lành trên những chiếc card đồ họa phổ thông như RTX 4080 hay thậm chí RTX 3090.

Đường biên chất lượng và tốc độ trên RTX Pro 6000Đường biên chất lượng và tốc độ trên RTX Pro 6000

Bối cảnh: Từ ShapeLearn-Lite đến bản đầy đủ

ByteShape cho biết họ từng khá "nóng vội". Qwen 3.8 27B ra mắt ngày 14/8/2026, chỉ bốn ngày sau — ngày 18/8 — nhóm đã phát hành bộ GGUF đầu tiên mang tên ShapeLearn-Lite. Bộ này được sản xuất với ngân sách tối ưu hóa nhỏ hơn nhiều, ít kiểm tra hơn và chờ đợi ít hơn.

Đến nay, phiên bản ShapeLearn đầy đủ đã hoàn thiện và được đánh giá song song với Lite cùng các bộ lượng tử hóa cạnh tranh từ AtomicChat, Bartowski, ISTA-DASLab và Unsloth Dynamic v3.

Theo nhóm phát triển, kết quả khá bất ngờ theo hướng tích cực:

  • ShapeLearn-Lite trụ vững tốt hơn nhiều so với thứ hạng KLD của nó gợi ý.
  • ShapeLearn đầy đủ thậm chí còn tốt hơn nữa, với cả năm model đều nằm trên đường biên chất lượng - tốc độ đo được.
  • Riêng model Lite-1 tuy có chỉ số KLD thấp hơn đối thủ nhưng điểm benchmark lại cao hơn hẳn.

Khuyến nghị mặc định: GPU-5

ByteShape khuyến nghị dùng GPU-5 làm lựa chọn mặc định ở mọi cấu hình đủ chỗ chứa:

  • Đạt 99,63% điểm tổng hợp của BF16
  • Dung lượng 13,1 GB, phù hợp với nhiều GPU consumer phổ biến
  • Tốc độ 90,4 token/giây trên RTX Pro 6000

Nếu bộ nhớ eo hẹp, GPU-4 (IQ3_S, 3,23 bpw) là phương án dự phòng rất cạnh tranh:

  • Đạt 98,72% điểm BF16
  • Chỉ chiếm 11,0 GB thay vì 13,1 GB
  • Nhanh hơn GPU-5 một chút

So sánh chất lượng và tốc độ trên RTX 5090So sánh chất lượng và tốc độ trên RTX 5090

Hiệu năng trên các dòng GPU phổ biến

Trên RTX 5090 (32 GB), GPU-5 cho tốc độ 93,7 token/giây — vẫn là lựa chọn mặc định. Trên các card 24 GB:

  • RTX 4090: GPU-5 đạt 59,2 tok/s
  • RTX 3090: GPU-5 đạt 45,8 tok/s, còn GPU-4 đạt 49,5 tok/s — chuyển sang model lớn hơn mất khoảng 7,5% tốc độ nhưng điểm chất lượng tăng từ 98,72% lên 99,63%.

Với các GPU 16 GB như RTX 4080RTX 5060 Ti, cả năm model vẫn chạy được, nhưng cần cân nhắc chừa dung lượng cho context chứ không chỉ trọng số model. Cụ thể:

  • RTX 4080: GPU-4 đạt 52,4 tok/s, GPU-5 đạt 45,7 tok/s
  • RTX 5060 Ti: GPU-4 đạt 33,1 tok/s, GPU-5 đạt 29,1 tok/s

Giải mã suy đoán giúp tăng tốc mạnh

ByteShape cũng đánh giá hai phương pháp giải mã suy đoán (speculative decoding):

  • MTP (Multi-Token Prediction) với 3 token nháp, trọng số nhúng thêm khoảng 250 MB
  • DFlash2 với 7 token nháp, cần model nháp riêng khoảng 1,1 GB

Kết quả với cả năm model ShapeLearn trên sáu GPU:

  • DFlash2 đạt tốc độ gấp 1,34 - 2,10 lần so với dự đoán token tiếp theo (NTP) thông thường
  • MTP đạt tốc độ gấp 1,28 - 1,66 lần

So sánh chất lượng và tốc độ trên RTX 4090So sánh chất lượng và tốc độ trên RTX 4090

Đánh đổi quan trọng: DFlash2 nhanh hơn nhưng tốn thêm khoảng 1,1 GB VRAM và hiện không hỗ trợ đầu vào hình ảnh trên llama.cpp. Trong khi đó, MTP chỉ thêm 250 MB và vẫn hỗ trợ đa phương thức. Nếu bạn cần tác vụ đa phương thức hoặc VRAM hạn chế, hãy chọn MTP; nếu muốn tốc độ tối đa cho văn bản thuần, hãy chọn DFlash2.

Cách chạy nhanh với llama.cpp

ByteShape cung cấp sẵn lệnh khởi chạy. Với MTP nhúng (hỗ trợ ảnh):

llama-server \
-hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
--mmproj-auto \
--spec-type draft-mtp --spec-draft-n-max 3

Với DFlash2 (nhanh nhất, chỉ văn bản, cần llama.cpp b10658 trở lên):

llama-server \
-hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \
-hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \
--spec-type draft-dflash --spec-draft-n-max 7 \
--no-mmproj

Lưu ý cho người dùng tại Việt Nam: để chạy model này mượt, bạn nên có GPU tối thiểu 16 GB VRAM và RAM hệ thống từ 32 GB trở lên. Nếu dùng dịch vụ thuê GPU đám mây, hãy chọn cấu hình RTX 4090 hoặc RTX 5090 để có trải nghiệm tốt nhất.

KLD không phải là bảng xếp hạng hiệu năng

Một điểm kỹ thuật đáng chú ý: ByteShape khẳng định KLD (KL Divergence) — thước đo độ lệch phân phối token của model lượng tử hóa so với bản gốc — không đủ để xếp hạng hiệu năng tác vụ.

Ví dụ cụ thể: model UD-IQ3_S của Unsloth có KLD thấp hơn khoảng 20% so với Lite-1 cùng kích thước (0,028759 so với 0,035875), nhưng điểm benchmark tổng hợp lại thấp hơn — 95,55% so với 97,33% của BF16.

"Điểm mấu chốt không phải là KLD vô dụng. Mà là xếp hạng độ trung thực không phải là xếp hạng hiệu năng tác vụ."

ByteShape cho biết họ đo KLD trên tập dữ liệu khoảng 5 triệu token gồm cặp prompt - response từ nhiều benchmark, bao gồm cả tác vụ ngữ cảnh dài và tác vụ agentic. Nhóm cũng thay đổi cách tính KLD cho sát với mục đích đo lường hơn: chỉ tính trên token phản hồi, chỉ xét các token có khả năng được lấy mẫu (top-20, top-40, top-60), và mỗi cặp prompt - response được chấm điểm riêng biệt.

Kết luận

ShapeLearn-Lite đã làm đúng vai trò của nó: đưa Qwen 3.8 27B lượng tử hóa lên các GPU 12 - 24 GB một cách nhanh chóng, và trụ vững tốt hơn dự đoán từ chỉ số KLD.

Phiên bản ShapeLearn đầy đủ tiến xa hơn nữa, góp mặt năm model nằm trên đường biên chất lượng - tốc độ trên cả sáu dòng GPU thử nghiệm. Với người dùng Việt Nam đang tìm cách chạy các mô hình ngôn ngữ lớn cục bộ, đây rõ ràng là một lựa chọn đáng cân nhắc — đặc biệt khi bạn chỉ có một chiếc GPU tầm trung trong tay.

ByteShape kết luận khá thẳng thắn: "Chúng tôi từng nóng vội. Lần này, mọi chuyện diễn ra khá tốt đẹp."

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗