Qwen 3.8 27B: Mô hình mã nguồn mở xuất sắc nhưng mặc định 'suy nghĩ' quá mức

16 tháng 8, 2026·5 phút đọc

Qwen 3.8 27B, mô hình ngôn ngữ mã nguồn mở mới từ Alibaba, gây ấn tượng với khả năng xử lý hình ảnh, viết mã và gọi công cụ mạnh mẽ ngay trên laptop, nhưng lại mặc định bật cơ chế suy luận ở mức 'xhigh' khiến tốc độ trở nên cực kỳ chậm. Bài viết này phân tích sâu về sức mạnh, những điểm ấn tượng và hạn chế hiệu năng của mô hình, cùng các mẹo tối ưu để sử dụng hiệu quả.

Qwen 3.8 27B: Mô hình mã nguồn mở xuất sắc nhưng mặc định 'suy nghĩ' quá mức

Sự kiện nổi bật nhất trong tuần qua là sự ra mắt của Qwen 3.8 27B – một mô hình ngôn ngữ mã nguồn mở (giấy phép Apache 2) có khả năng hiểu hình ảnh (vision-capable), sở hữu 27B tham số. Như cái tên của bài viết gốc, mô hình này xuất sắc nhưng lại có một "tật" rất khó chịu: nó mặc định suy nghĩ quá mức cho mọi vấn đề, dù là đơn giản nhất, dẫn đến thời gian phản hồi cực kỳ lâu.

Bài viết này sẽ đi sâu vào đánh giá hiệu năng của Qwen 3.8 27B trên các thiết bị phần cứng tiêu dùng, khám phá khả năng lập trình, gọi công cụ và phân tích hình ảnh của nó, đồng thời chỉ ra những hạn chế về tốc độ và các mẹo để khai thác tối đa mô hình 17GB thú vị này.

Qwen 3.8 27B: Kích thước nhỏ, sức mạnh lớn

Với kích thước 27B tham số, Qwen 3.8 27B là một lựa chọn tuyệt vời cho những ai muốn chạy một mô hình ngôn ngữ mạnh mẽ trực tiếp trên laptop hoặc PC có cấu hình tốt. So với phiên bản tiền nhiệm Qwen 3.6 27B, phiên bản mới này được Alibaba cho biết đã có bước nhảy vọt về hiệu năng, thậm chí còn vượt qua cả mô hình đóng gói mạnh nhất của họ vài tháng trước, Qwen 3.7-Plus.

Đây là một tín hiệu cho thấy các mô hình mã nguồn mở cỡ trung đang ngày càng bắt kịp các đối thủ lớn hơn rất nhiều về cả chi phí lẫn khả năng.

"Cơn ác mộng" mang tên reasoning_effort

Điểm trừ lớn nhất của Qwen 3.8 27B nằm ở cài đặt mặc định: reasoning_effort (mức độ suy luận) được đặt ở giá trị cao nhất là xhigh. Điều này gần như cùng lúc trở thành một đặc điểm gây cười và gây bực bội.

  • Thời gian xử lý lâu: Ngay cả với một yêu cầu vẽ một hình tròn đơn giản, mô hình cũng dành ra hàng ngàn token để "suy nghĩ" và cuối cùng đưa ra một kết quả "quá đẹp" không ai yêu cầu.
  • Tốn bộ nhớ ngữ cảnh: Với ngữ cảnh tối đa lên tới 262,144 token, việc mặc định suy nghĩ lung tung sẽ tiêu tốn hết 8,192 token ngữ cảnh mặc định của LM Studio và gây ra lỗi.

Thử nghiệm thực tế trên một chiếc MacBook Pro, việc tạo một file SVG về chú bồ nông đi xe đạp mất tới 21 phút với 22,276 token dành riêng cho việc suy luận.

"Đây là file SVG về bồ nông đẹp nhất mà tôi từng tạo được trên một mô hình chạy local. Nhưng liệu có đáng để chờ 21 phút không? Chắc chắn là không."

Sức mạnh thực sự: Lập trình và hiểu hình ảnh

Bỏ qua cài đặt mặc định "suy nghĩ quá mức", khi người dùng chủ động tắt chức năng reasoning, tốc độ được cải thiện đáng kể. Một yêu cầu vẽ bồ nông đi xe đạp chỉ mất khoảng 137 giây (2 phút).

Điểm sáng giá nhất của Qwen 3.8 27B là khả năng làm việc nghiêm túc:

  • Lập trình viên nhỏ gọn: Qwen 3.8 27B có thể viết code, gọi công cụ thành thạo. Nó đã tự động hóa việc tạo ra một công cụ HTML để hiển thị bounding box dựa trên một prompt đầy đủ.
  • Hiểu hình ảnh (Vision): Mô hình thể hiện xuất sắc việc xác định vị trí các đối tượng trong ảnh (ví dụ như bồ nông) và trả về tọa độ chính xác.
  • Chạy Agent: Thử nghiệm ban đầu cho thấy nó có thể chạy một vòng lặp tác nhân lập trình (coding agent) với công cụ Pi, cho kết quả rất khả quan. Đặc biệt, nó có thể đọc file transcript JSONL và tự viết script Python để chuyển đổi sang Markdown, cho ra đời một công cụ thực sự hữu dụng.

Việc cần biết về hiệu năng và cách tối ưu

Nhược điểm lớn nhất của mô hình này là tốc độ kém ấn tượng. Trên cả MacBook Pro M5 Max lẫn NVIDIA DGX Spark, tốc độ chỉ đạt khoảng 15-30 token/giây, khiến nó khó có thể trở thành lựa chọn hàng ngày so với các API mạnh mẽ như GPT-4.5 hay Claude.

Tuy nhiên, cộng đồng đã nhanh chóng tìm ra cách tăng tốc:

  • Multi-Token Prediction (MTP): Đây là một tính năng được tích hợp sẵn trong mô hình. Bằng cách sử dụng cờ --spec-type draft-mtp khi chạy với llama-server, người dùng đã cải thiện hiệu suất lên tới 72% so với cấu hình mặc định trong LM Studio.

Kết luận: Một cột mốc quan trọng cho AI mở

Bất chấp vấn đề về hiệu năng, những gì Qwen 3.8 27B mang lại thực sự là một phép màu. Một file nặng chỉ vỏn vẹn 17GB có thể chạy trên laptop cá nhân với đầy đủ khả năng: hiểu ảnh, viết mã, gọi công cụ và có ngữ cảnh dài.

  • Đây là tương lai: Một năm trước, những khả năng này chỉ có ở các mô hình đắt tiền nhất. Ngày nay, nó nằm gọn trong một chiếc máy tính xách tay.
  • Hy vọng về tối ưu: Kỷ nguyên của các mô hình 17GB "chạy nhanh như sóng" có lẽ sẽ sớm đến trong vài tuần nữa, vì cộng đồng đang nỗ lực tối ưu đáng kể.

Qwen 3.8 27B chứng minh một điều: Bạn không cần chi hàng trăm triệu đồng cho phần cứng trung tâm dữ liệu để sở hữu một mô hình AI có năng lực vượt trội. Các mô hình cỡ trung đang phát triển với tốc độ chóng mặt, và đây chắc chắn là một phiên bản đáng để thử nghiệm ngay hôm nay.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗