Benchmark Qwen3.8 27B: Lượng tử hóa 4-bit vẫn tốt, 1-bit sụp đổ hoàn toàn

08 tháng 9, 2026·4 phút đọc

Một bài benchmark chi tiết trên model Qwen3.8 27B cho thấy lượng tử hóa 4-bit (Q4_K_M) gần như không làm giảm chất lượng so với bản gốc BF16, trong khi bản 2-bit chỉ giảm nhẹ. Tuy nhiên, chất lượng sụp đổ hoàn toàn ở mức 1-bit, khiến model hoạt động gần như đoán ngẫu nhiên trên các bài kiểm tra phức tạp. Bài viết cũng chỉ ra rằng chi phí chạy benchmark trên GPU đám mây khá đắt đỏ.

Benchmark Qwen3.8 27B: Lượng tử hóa 4-bit vẫn tốt, 1-bit sụp đổ hoàn toàn

Benchmark Qwen3.8 27B: Lượng tử hóa 4-bit vẫn tốt, 1-bit sụp đổ hoàn toàn

Một bài benchmark chi tiết vừa được công bố cho thấy phiên bản lượng tử hóa 4-bit (Q4_K_M) của model Qwen3.8 27B gần như không có sự khác biệt về chất lượng so với bản gốc BF16, trong khi bản 2-bit chỉ giảm nhẹ ở một số tác vụ. Tuy nhiên, chất lượng sụp đổ hoàn toàn ở mức 1-bit, khiến model hoạt động gần như đoán ngẫu nhiên trên các bài kiểm tra phức tạp. Kết quả này mang lại thông tin hữu ích cho những ai muốn chạy model AI lớn trên phần cứng phổ thông với ngân sách hạn chế.

Bối cảnh và mục đích bài test

Model Qwen3.8 27B ở dạng đầy đủ BF16 nặng tới 55 GB, vượt xa khả năng của phần cứng tiêu dùng thông thường. Tuy nhiên, thông qua kỹ thuật lượng tử hóa (quantization), người dùng có thể nén model xuống nhiều mức dung lượng khác nhau để chạy trên GPU có VRAM thấp hơn. Bài viết trên blog của Quesma đã kiểm tra 4 mức lượng tử hóa khác nhau:

  • Q8_0 (8-bit): 29 GB
  • Q4_K_M (4-bit): 17 GB
  • UD-Q2_K_XL (2-bit): 10.7 GB
  • UD-IQ1_S (1-bit): 6.2 GB

Nhiều người dùng trên Reddit phàn nàn rằng mọi phiên bản lượng tử hóa, kể cả 8-bit, đều cho kết quả tệ hơn so với bản gốc, khiến model "cảm giác ngu đi". Bài benchmark này được thực hiện để kiểm chứng xem những lời phàn nàn đó có căn cứ hay không. Tác giả đã sử dụng các benchmark phổ biến như GPQA Diamond (kiến thức khoa học), IFBench (làm theo chỉ dẫn) và Terminal-Bench 2.1 (lập trình agentic).

Kết quả: 4-bit gần như không khác biệt

Kết quả đo trên GPQA DiamondIFBench cho thấy, ngoài nhiễu thống kê nhỏ, chất lượng của model Q4_K_M gần như tương đương với bản BF16 đầy đủ. Ngay cả bản 2-bit UD-Q2_K_XL (dưới 11 GB) cũng chỉ giảm nhẹ ở bài GPQA, còn với IFBench thì không có sự thay đổi nào đáng kể.

Điều thú vị là mức độ suy luận (reasoning effort) ảnh hưởng rất lớn đến điểm số, đặc biệt ở GPQA Diamond. Với mức xhigh (mặc định), model cần khoảng 8.000 token suy luận để đạt kết quả tốt nhất.

Trên Terminal-Bench 2.1 (đánh giá khả năng lập trình), kết quả cũng gây bất ngờ khi Q4_K_M đạt điểm tương đương BF16. Bản 2-bit có sụt giảm nhẹ nhưng vẫn ở mức tương đương các model thương mại như Opus 4.7 hay Gemini 3.1 Pro — không phải trình độ tiên tiến nhất nhưng cũng không hề vô dụng.

![Biểu đồ so sánh độ chính xác giữa các mức lượng tử hóa](/ _astro/hf_unsloth_qwen38_27b_choices.OSlYkgGR_2lHFg.webp)

Vách đá 1-bit: Sụp đổ hoàn toàn

Khác với những mức lượng tử hóa nêu trên, chất lượng model giảm xuống vách đá ở mức 1-bit. Các model 1-bit như UD-IQ1_S hay UD-IQ1_M đạt điểm gần như hoặc dưới mức đoán ngẫu nhiên trên GPQA Diamond. Điều tệ hơn là khi tăng mức suy luận lên xhigh, model thường "suy luận" cho đến khi cạn kiệt token rồi trả về kết quả trống, khiến điểm số còn thấp hơn cả mức low.

Điều này cho thấy tổn thương do lượng tử hóa gây ra là phi tuyến tính: đầu tiên gần như không có thay đổi đáng đo lường, sau đó là suy giảm nhẹ, và cuối cùng là sụp đổ hoàn toàn. Unsloth (đơn vị cung cấp bản lượng tử hóa) từng quảng cáo rằng bản 1-bit "giữ lại khoảng 72% độ chính xác top-1", nhưng bài test cho thấy 28% bị mất đi này thực sự rất quan trọng đối với các tác vụ phức tạp.

Chi phí benchmark và cấu hình phần cứng

Chạy các benchmark này không hề rẻ. Tác giả đã tiêu tốn khoảng 3.000 USD cho GPU trên Modal, với chi phí lớn nhất thuộc về Terminal-Bench 2.1 (2.308 USD). GPQA + IFBench chỉ tốn 663 USD cho tất cả các phiên bản.

Kết luận của bài viết khá tích cực: người dùng nên chọn bản model tốt nhất có thể vừa trong bộ nhớ GPU, và Q4_K_M (17 GB) là lựa chọn cân bằng tối ưu khi không cảm nhận được sự khác biệt so với bản gốc. Đối với các tác vụ đơn giản hơn, bản UD-Q2_K_XL 2-bit (chỉ 10.7 GB) hoàn toàn có thể sử dụng được.

Lời khuyên cho người dùng Việt Nam

Với việc GPU RTX 4090 (24 GB) ngày càng phổ biến trong cộng đồng AI tại Việt Nam, kết quả này là tin tốt: bạn có thể chạy một model 27B mạnh mẽ với chất lượng gần như không đổi chỉ với 17 GB VRAM, vẫn còn dư khoảng 64k token context. Tuy nhiên, cần lưu ý rằng mức lượng tử hóa càng thấp thì dung lượng càng nhỏ nhưng chất lượng suy giảm rất nhanh ở mức dưới 2-bit. Vì vậy, hãy cân nhắc kỹ giữa nhu cầu bộ nhớ và chất lượng đầu ra khi triển khai model trên phần cứng cá nhân.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗