Chạy Qwen3.8 27B local: Số liệu thực tế từ Mac Studio của tôi

Phần mềm28 tháng 8, 2026·15 phút đọc

Bài viết chia sẻ trải nghiệm và kết quả benchmark chi tiết khi chạy mô hình Qwen3.8 27B hoàn toàn local trên Mac Studio M3 Ultra. Dù tốc độ tạo token chậm hơn một nửa so với phiên bản tiền nhiệm, mô hình mới này lại dùng ít token hơn nhiều, giúp thời gian hoàn thành câu trả lời gần như tương đương. Bài viết cũng phân tích các mức lượng tử hóa (quantization) khác nhau, yêu cầu phần cứng và những lưu ý quan trọng khi chạy mô hình này trên máy cá nhân.

Chạy Qwen3.8 27B local: Số liệu thực tế từ Mac Studio của tôi

Chạy Qwen3.8 27B ngay trên máy tính của bạn: Kết quả đo đạc thực tế từ Mac Studio

Trong 10 ngày qua, tôi đã âm thầm sử dụng Qwen3.8 27B trên chiếc Mac Studio của mình như một trợ lý nền. Nó tóm tắt các nguồn RSS thành bản tin buổi sáng, đặt tên và phân loại các file PDF tôi scan, và xử lý mọi công việc tóm tắt khác. Công việc nhàm chán - và đó chính là điểm hấp dẫn: đây là mô hình local đầu tiên tôi tin tưởng để mặc kệ nó làm việc.

Tuần trước, mô hình này bỗng xuất hiện khắp nơi trên r/LocalLLaMA. Các biểu đồ benchmark tràn ngập nguồn tin của tôi, và tôi nhận ra mình đang sở hữu thứ mà hầu hết các bài viết đó thiếu: một cỗ máy có thể chạy nó thực sự tốt, và thời gian để đo đạc.

Vậy là tôi đã benchmark nó. Năm lần chạy có tính giờ cho mỗi mô hình, cùng một prompt, cùng một máy, cộng thêm một thí nghiệm lượng tử hóa 1-bit khiến tôi bất ngờ đến hai lần. Dưới đây là tất cả những gì tôi đo được, và ý nghĩa của chúng đối với phần cứng bạn cần để tự chạy mô hình này.

Tóm tắt nhanh

  • Qwen3.8 27B (bản Q4_K_M, 17GB) tạo ra khoảng 14 token/s trên Mac Studio M3 Ultra của tôi qua Ollama. Phiên bản tiền nhiệm qwen3.6:27b đạt khoảng 28.6 token/s trên cùng máy.
  • Tuy vậy, mô hình mới trả lời cùng một prompt chỉ bằng khoảng một phần ba số token, nên thời gian thực tế để hoàn thành một câu trả lời gần như là hòa.
  • Bản lượng tử hóa 1-bit (6.7GB) chạy ở tốc độ 27 token/s trong llama.cpp và trả lời đúng các câu hỏi thực tế, nhưng không thể đưa ra quyết định cuối cùng.
  • Bạn cần llama.cpp từ vài tuần gần đây. Các bản cũ sẽ lỗi với thông báo unknown model architecture: 'qwen35'.
  • Máy 32GB RAM có thể chạy thoải mái bản Q4. 16GB thì chạy được bản Q2. Bảng RAM dưới đây có số liệu cho từng mức lượng tử hóa.

Qwen3.8 27B là gì?

Qwen3.8-27B là mô hình dense với 27.3 tỷ tham số, sử dụng thiết kế hybrid attention (kiến trúc này trong file GGUF được đánh dấu là qwen35, điều này sẽ quan trọng về sau). Mô hình đa phương thức, có khả năng hiểu hình ảnh và video, sở hữu cửa sổ ngữ cảnh gốc lên tới 262,144 token, và được phát hành dưới giấy phép Apache 2.0. Theo công bố chính thức, mô hình đạt 61.7 điểm trên SWE-bench Pro và 89.2 trên GPQA Diamond - những con số mà một năm trước chỉ có ở các phòng thí nghiệm hàng đầu.

Phản ứng của cộng đồng đã bỏ qua bảng benchmark này. Thứ làm mọi người sôi sục là những gì họ làm với mô hình trong tuần đầu tiên: một nhóm đã tích hợp nó vào quy trình code của họ như một giải pháp thay thế cho API trả phí và báo cáo rằng nó đáp ứng tốt. Các bài kiểm tra OCR cho thấy chất lượng vượt trội so với một số dịch vụ đám mây thương mại. Câu nói được upvote nhiều nhất mà tôi nhớ nhất: "đây là mô hình local đầu tiên có cảm giác không chỉ là một món đồ chơi."

Đóng góp của tôi là một phép đo mà hầu hết các biểu đồ đó đều thiếu: mô hình này thực sự hoạt động ra sao trên chip Apple silicon bạn có thể mua ngay hôm nay.

Số liệu của tôi: So sánh 3.8 và 3.6 trên cùng một máy

Máy làm việc hàng ngày của tôi là Mac Studio M3 Ultra với 256GB bộ nhớ hợp nhất - cũng chính là cỗ máy tôi dùng trong bài hướng dẫn DeepSeek V4 Flash. Tôi đã chạy năm lần tạo văn bản có tính giờ cho mỗi mô hình qua ollama run --verbose, với các prompt kỹ thuật đa dạng, câu trả lời khoảng 200-500 từ, và lấy trung bình số liệu. Cả hai mô hình đều là bản Q4_K_M mặc định của Ollama, cả hai chiếm gần như chính xác 17GB trên ổ đĩa.

Tiêu chíqwen3.6:27bqwen3.8:27b
Tốc độ tạo văn bản (trung bình 5 lần chạy)28.6 token/s14.0 token/s
Tốc độ xử lý prompt95.0 token/s93.1 token/s
Độ lệch giữa các lần chạy28.5-28.8 (cực kỳ ổn định)13.2-15.4
Số token dùng cho mỗi câu trả lời1,950-3,340890-1,090

Con số quan trọng nhất đầu tiên: mô hình mới tạo văn bản với tốc độ chỉ bằng một nửa so với người tiền nhiệm. Cùng số tham số, cùng kích thước lượng tử hóa, cùng một máy. Kiến trúc hybrid attention là mới, và các kernel Metal trong Ollama rõ ràng chưa theo kịp. Tôi kỳ vọng khoảng cách này sẽ thu hẹp khi các runtime trưởng thành hơn; điều tương tự đã xảy ra với các kiến trúc mới lạ khác.

Tuy nhiên, điều này thực ra không làm tôi mất thêm thời gian. Qwen3.8 trả lời cùng một prompt chỉ với khoảng 1,000 token trong khi 3.6 dài dòng qua 2,000-3,300 token. Phép tính đơn giản: 2,058 token ở tốc độ 28.6 token/s là 72 giây, còn 955 token ở 14.2 token/s là 67 giây. Chậm hơn mỗi token, nhưng nhanh hơn mỗi câu trả lời.

Trong lúc tạo văn bản, CPU gần như không hoạt động, bởi vì trên chip Apple silicon, quá trình suy luận chạy trên GPU thông qua Metal. Ảnh bìa của bài viết này là chính khoảnh khắc đó, được chụp bằng macmon giữa lúc tạo văn bản: GPU ở mức 100% tiêu thụ 63.95W, CPU chỉ dùng 6W, câu trả lời vẫn đang được phát trực tuyến.

Đồ thị sử dụng GPU 100% và công suất tiêu thụ trong lúc chạy Qwen3.8Đồ thị sử dụng GPU 100% và công suất tiêu thụ trong lúc chạy Qwen3.8

Ứng dụng Stats trên thanh menu cũng kể một câu chuyện tương tự từ góc độ giao diện: tất cả 60 lõi GPU đều ở 100%, tổng công suất hệ thống chạm tới 291W.

Thí nghiệm 1-bit: "Tổn thương não", được đo đạc

Bài viết về Qwen3.8 được upvote nhiều nhất trong tuần tôn vinh bản lượng tử hóa 1-bit của Unsloth - một file nặng 6.7GB mà người đăng vui vẻ gọi là "bản lượng tử tổn thương não". Một mô hình 27B nằm gọn trong bộ nhớ của một mô hình 7B. Tôi phải thử nó.

Nó chạy được, và nhanh:

  • 309 token/s xử lý prompt, 27.2 token/s tạo văn bản. Gần gấp đôi tốc độ Q4 của tôi, trong khi chiếm chưa tới 8GB RAM.

Sau đó tôi đặt câu hỏi. Khả năng ghi nhớ sự kiện thực sự tốt: nó biết Canberra là thủ đô của Úc và giải thích chính xác sự thỏa hiệp Sydney-Melbourne đằng sau điều đó. Nhưng khi tôi yêu cầu một lệnh bash ngắn, nó đưa ra một lệnh hoạt động tốt và sau đó không thể ngừng tự kiểm tra lại chính mình, đốt cháy 400 token để xoay vòng qua các lựa chọn thay thế mà không bao giờ quyết định được câu trả lời cuối cùng.

Điều này khớp với những gì chính Unsloth nói: tài liệu về lượng tử hóa của họ nói thẳng rằng 1-bit không nên được dùng cho các tác vụ agentic hoặc gọi công cụ, và các bài kiểm tra phân kỳ của họ cho thấy độ chính xác trên các tác vụ dài sụp đổ ở mức 1-bit trong khi kiến thức tổng quát vẫn sống sót. Mức tối thiểu được họ công bố để gọi công cụ là bản Q2_K_XL khoảng 9.8GB.

Từ kinh nghiệm của tôi: bản lượng tử 1-bit là một trò ảo thuật nhưng dạy ra một bài học thật. Lượng tử hóa không làm mô hình suy giảm đều. Sự thật sống sót, khả năng quyết đoán chết đi. Nếu trường hợp sử dụng của bạn là "trả lời các câu đố nhanh trên một chiếc máy yếu", nó thực sự hiệu quả. Nếu là bất cứ điều gì mang tính agentic, hãy trả thêm 3GB cho bản Q2.

Mỗi mức lượng tử hóa cần bao nhiêu RAM?

Unsloth công bố toàn bộ thang GGUF, vì vậy đây là phiên bản thực tế. Hãy tính cả kích thước file cộng thêm vài GB cho ngữ cảnh và bộ chiếu hình ảnh.

Mức lượng tử hóaKích thước fileRAM tối thiểu khả dĩLoại máy có thể chạy
UD-IQ1_M (1-bit)6.7GB16GBBất kỳ mini PC hiện đại nào
UD-Q2_K_XL9.8GB16GBBất kỳ mini PC hiện đại nào
UD-Q4_K_XL / Q4_K_M16-17.6GB32GBMini PC tầm trung
UD-Q6_K22GB32GB (chật) / 48GBCấu hình RAM cao
Q8_029GB48-64GBStrix Halo, Mac unified memory
BF1654.7GB96GB+Strix Halo 128GB, Mac Studio

Ở mức 32GB, các máy như GEEKOM A6 với Ryzen 7 6800H và 32GB hoặc GMKtec M6 Ultra với DDR5 có thể chạy bản Q4 giống như các benchmark của tôi ở trên, chỉ chậm hơn: hãy nghĩ đến tốc độ một chữ số token mỗi giây khi suy luận bằng CPU thay vì 14 token/s. Tốc độ đó phù hợp với các công việc nền như của tôi; nó sẽ thử thách sự kiên nhẫn của bạn trong các cuộc trò chuyện tương tác.

So sánh hiệu năng Qwen3.6 và Qwen3.8 trên OllamaSo sánh hiệu năng Qwen3.6 và Qwen3.8 trên Ollama

Nếu bạn muốn chạy mô hình với tốc độ thực sự nhanh mà không cần mua Apple, mục tiêu được cộng đồng đồng thuận là nền tảng AMD Strix Halo. Dự án strix-halo-guide đã đo bản Q4_K_M chính thức ở tốc độ 20.4 token/s tạo văn bản và 292 token/s xử lý prompt trên Ryzen AI Max+ 395, kèm theo các file CSV thô. GMKtec EVO-X2 với 64GB là lựa chọn giá trị để vào nền tảng này ở mức $1,999, và các cấu hình 128GB như BOSGAME M5 mở ra khả năng dùng các bản Q8 và BF16 trong bảng, cũng như các mô hình lớn hơn nhiều. Tôi đã đề cập toàn bộ quyết định nền tảng này trong bài viết về mini PC tốt nhất cho LLM local.

Một lời cảnh báo từ thị trường hiện tại: giá RAM vẫn đang bị đẩy lên cao. Một bộ 64GB DDR5 SODIMM hiện có giá $750-870. Nếu bạn mua một mini PC để chạy LLM local, việc mua nó với RAM đã được lắp sẵn hiện rẻ hơn so với tự nâng cấp sau này - điều ngược lại với mọi bản năng tôi đã xây dựng qua hai mươi năm mua máy tính.

Chủ sở hữu GPU có cách mở rộng khác: các báo cáo từ cộng đồng cho thấy một thiết lập hai RTX 3090 đạt khoảng 60 token/s và một RTX 5090 đạt 75-140 token/s tùy thuộc vào runtime, với các card 16GB chạy được bản IQ4 với KV cache được lượng tử hóa.

Cách chạy nó (và cú vấp khiến tôi mất 20 phút)

Ollama là con đường ngắn nhất. Trang mô hình là ollama.com/library/qwen3.8:

# tải về bản Q4_K_M mặc định, 17GB
ollama pull qwen3.8:27b
# --verbose để in các số liệu token/s bạn thấy trong ảnh chụp màn hình
# --think=false để bỏ qua phần suy luận mở đầu khi cần câu trả lời nhanh
ollama run qwen3.8:27b --verbose --think=false "prompt của bạn"

Chạy với --verbose và mọi câu trả lời sẽ kết thúc với một khối số liệu như thế này:

Kết quả benchmark 1-bit với llama-benchKết quả benchmark 1-bit với llama-bench

Bạn sẽ cần Ollama 0.32.12 hoặc mới hơn; siêu dữ liệu của mô hình khai báo đây là phiên bản tối thiểu.

Đối với llama.cpp, đây là cú vấp. Bản llama.cpp qua Homebrew của tôi đã cũ vài tuần, và nó thẳng thừng từ chối file:

llama_model_load: error loading model: unknown model architecture: 'qwen35'

Kiến trúc hybrid cần các kernel hiện tại. brew update && brew upgrade llama.cpp đã khắc phục điều đó, và yêu cầu về phiên bản tương tự cũng áp dụng cho bất kỳ frontend nào dựa trên llama.cpp (LM Studio, Jan, koboldcpp): nếu Qwen3.8 không tải được, hãy cập nhật runtime trước khi debug bất cứ thứ gì khác.

# tải một bản lượng tử từ repo GGUF của Unsloth, sau đó:
llama-bench -m Qwen3.8-27B-UD-IQ1_M.gguf     # kiểm tra tốc độ
llama-cli -m Qwen3.8-27B-UD-IQ1_M.gguf -p "prompt của bạn" -st

Nó thực sự làm gì cho tôi cả ngày?

Các con số benchmark không quan trọng bằng những gì mô hình đã làm kể từ khi tôi tải nó về: công việc nền không mấy hào nhoáng mà trước đây hoặc không bao giờ được thực hiện, hoặc bị rò rỉ lên cloud API.

  • Bản tin buổi sáng: một tác vụ launchd thu thập các mục RSS chưa đọc của tôi qua đêm và yêu cầu qwen3.8 nén chúng thành một bản tóm tắt duy nhất để tôi đọc cùng cà phê. Ngữ cảnh 262k token có nghĩa là cả tuần nguồn cấp dữ liệu vừa vặn trong một prompt.
  • Sắp xếp bản scan: thư giấy được scan, và mô hình đọc văn bản của từng PDF rồi đặt tên lại theo quy ước YYYY-MM-nhà cung cấp-nội dung của tôi. Khả năng thị giác cho phép nó xử lý các bản scan mà OCR làm hỏng.
  • Và khi một chủ đề trên diễn đàn dài tới 400 bình luận, nó được dán vào và tóm tắt với các quan điểm được gán tên. Việc nghiên cứu cho bài viết này đã tạo ra một vài bản tóm tắt như vậy, cảm giác thật thú vị.

Không một việc nào trong số này quan tâm đến token mỗi giây. Yêu cầu là một mô hình đủ thông minh để không xếp lá thư bảo hiểm vào thư mục hóa đơn nhà hàng, phần cứng tôi đã sở hữu, và không có gì rời khỏi nhà. Đó mới là lời chào hàng thực sự cho các mô hình local trong năm 2026, và nó cũng chính là lập luận tôi đưa ra trong bài viết về phong trào tự lưu trữ: ngay cả những phụ thuộc đám mây nhỏ cũng đáng để thay thế.

FAQ

Tôi có thể chạy Qwen3.8 27B trên 16GB RAM không? Có, ở mức lượng tử hóa 1-bit hoặc 2-bit (file 6.7-9.8GB). Bản 2-bit là mức lượng tử nhỏ nhất mà Unsloth coi là có thể sử dụng để gọi công cụ. Chất lượng Q4 cần 32GB.

Nó có tốt hơn Gemma 4 không? Khác nhau về hình dạng. Gemma 4 bản 26B-A4B là một MoE thưa thớt, tạo văn bản nhanh hơn nhiều trên cùng phần cứng. Qwen3.8 27B là mô hình dense, chậm hơn mỗi token, và cộng đồng hiện đánh giá nó vượt trội hơn trong các tác vụ code và agentic. Đối với một trợ lý nền, tôi sẽ chọn Qwen3.8; đối với chat tương tác trên phần cứng khiêm tốn, Gemma 4 vẫn là lựa chọn hợp lý.

Tại sao nó cũng chậm hơn qwen3.6 trên máy của tôi? Kiến trúc hybrid attention là mới và các kernel runtime (Ollama Metal, llama.cpp Vulkan/CUDA) chưa được tối ưu hóa hoàn toàn cho nó. Hãy kỳ vọng khoảng cách sẽ thu hẹp với các bản cập nhật. Một phần an ủi: nó dùng ít token hơn nhiều cho mỗi câu trả lời, nên độ trễ hoàn thành câu trả lời gần hơn nhiều so với những gì khoảng cách token/s gợi ý.

Khả năng thị giác có hoạt động local không? Có. Bản dựng Ollama đi kèm bộ chiếu hình ảnh (khoảng 460 triệu tham số) và nhập ảnh hoạt động ngay lập tức. Hỗ trợ hiểu video trong các runtime local vẫn còn chưa hoàn thiện.

Còn Qwen3.8-Flash-Next thì sao? Nó đã phát hành trọng số khi tôi đang viết bài này: một MoE 180B, khoảng 110GB ở mức Q4. Đây là một cấp phần cứng hoàn toàn khác: bạn cần bộ nhớ hợp nhất lớp 128GB, tức là một chiếc máy Strix Halo giá $3,500+ hoặc một chiếc Mac lớn. Nếu những tuyên bố về kiến trúc "thân thiện với local một cách đáng ngạc nhiên" được giữ vững, đó sẽ là chủ đề cho một bài viết sau.

Tài nguyên tham khảo

  • Unsloth GGUF quants: mọi kích thước từ 6.2GB đến 54.7GB.
  • Tài liệu lượng tử hóa của Unsloth: giải thích vì sao 1-bit phá vỡ khả năng gọi công cụ.
  • Thread r/LocalLLaMA đã khởi đầu tuần của tôi: các báo cáo thực tế từ cộng đồng.

Chúc bạn đo đạc vui vẻ! 📊

GEEKOM A6 với Ryzen 7 6800H và 32GB RAM - một lựa chọn phần cứng để chạy Qwen3.8GEEKOM A6 với Ryzen 7 6800H và 32GB RAM - một lựa chọn phần cứng để chạy Qwen3.8

Cập nhật lần cuối: Tháng 8 năm 2026

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗