Qwen3.8-27B-FP8: Mô hình AI mã nguồn mở mạnh nhất của Alibaba với khả năng suy luận, đa phương thức và tác tử vượt trội
Qwen3.8-27B-FP8 là phiên bản lượng tử hóa FP8 của mô hình Qwen3.8-27B, mang đến hiệu năng vượt trội về lập trình, tác tử AI và hiểu đa phương thức (ảnh/video). Mô hình hỗ trợ ngữ cảnh lên tới 1 triệu token, tư duy linh hoạt và tương thích rộng rãi với các framework phổ biến như vLLM, SGLang, TokenSpeed.

Qwen3.8-27B-FP8: Siêu phẩm mã nguồn mở của Alibaba tái định nghĩa chuẩn mực AI
Qwen Team vừa chính thức giới thiệu Qwen3.8, thế hệ mô hình ngôn ngữ lớn mã nguồn mở mạnh nhất đến nay của Alibaba, cùng với phiên bản lượng tử hóa Qwen3.8-27B-FP8 được tối ưu cho triển khai thực tế. Đây là mô hình dạng dense (không sử dụng MoE) với 27 tỷ tham số, tích hợp khả năng hiểu ảnh và video một cách tự nhiên, cùng cơ chế điều khiển tư duy linh hoạt — một bước tiến lớn cho cộng đồng AI toàn cầu và cả các nhà phát triển tại Việt Nam.
Điểm nổi bật chính của Qwen3.8-27B
Hiệu năng vượt trội ở nhiều lĩnh vực
Qwen3.8-27B được xây dựng dựa trên nền tảng kiến trúc của Qwen3.5 nhưng mang lại những cải tiến đáng kể về khả năng lập trình (coding), công việc chuyên môn, nghiên cứu và đặc biệt là các tác vụ agentic dài hạn. Theo bảng benchmark được công bố, mô hình này vượt trội so với các đối thủ cùng phân khúc như Qwen3.6-27B, Qwen3.7-Plus trên hầu hết các bài kiểm tra:
- Terminal Bench 2.1 (tác tử lập trình): đạt 73.0 điểm, vượt xa Qwen3.6-27B (63.4) và gần bằng Opus4.6 Max (78.2)
- SWE-bench Pro (lập trình tác tử): 61.7 điểm, dẫn đầu so với các đối thủ
- LiveCodeBench v6: 90.3 điểm, ấn tượng ở mảng lập trình cạnh tranh
- CoWorkBench (tác vụ văn phòng dài hạn): 70.7 điểm, cao nhất trong nhóm so sánh
Kiến trúc kỹ thuật tiên tiến
Qwen3.8-27B sử dụng kiến trúc Causal Language Model kết hợp Vision Encoder với những thông số đáng chú ý:
- 27 tỷ tham số, hidden dimension 5120, 64 lớp
- Sự kết hợp độc đáo giữa Gated DeltaNet (linear attention) và Gated Attention (full attention)
- Hỗ trợ Multi-Token Prediction (MTP) giúp tăng tốc độ suy luận
- Ngữ cảnh lên đến 262,144 token nguyên bản, có thể mở rộng tới 1 triệu token với kỹ thuật RoPE scaling (YaRN)
Khả năng đa phương thức mạnh mẽ
Khác với nhiều mô hình chỉ tập trung vào văn bản, Qwen3.8-27B là mô hình vision-language thực thụ, hiểu được cả ảnh và video:
- OSWorld-Verified (sử dụng máy tính): 84.3 điểm — cao hơn cả Opus4.6 Max (72.7)
- AndroidWorld (tác vụ di động): 81.9 điểm, dẫn đầu bảng xếp hạng
- MathVision: 90.0 điểm (không CI) và 94.6 (có CI) — vượt trội trong giải toán trực quan
- Hỗ trợ phân tích video dài tới hàng giờ với khả năng lấy mẫu khung hình tùy chỉnh
Trải nghiệm triển khai linh hoạt
Tương thích rộng rãi với framework phổ biến
Phiên bản FP8 được lượng tử hóa với block size 128, giúp giảm đáng kể dung lượng bộ nhớ mà vẫn duy trì hiệu năng gần như nguyên vẹn so với bản gốc. Người dùng có thể dễ dàng triển khai với:
- vLLM — framework phổ biến nhất hiện nay
- SGLang — tối ưu cho production workloads
- TokenSpeed — giải pháp mới từ Qwen Team
- Hugging Face Transformers — cho mục đích nghiên cứu và thử nghiệm
Điều khiển tư duy linh hoạt (Flexible Thinking Control)
Một điểm đáng chú ý của Qwen3.8 là khả năng kiểm soát độ sâu suy luận thông qua tham số reasoning_effort với 3 mức: xhigh (mặc định), medium, low. Điều này giúp doanh nghiệp tối ưu giữa chi phí và chất lượng phản hồi.
Ngoài ra, tính năng preserve_thinking (giữ lại chuỗi suy luận của các lượt trò chuyện trước) được bật mặc định, giúp duy trì tính nhất quán trong các tác vụ agentic phức tạp.
Hướng dẫn sử dụng nhanh
Với API Chat Completions, bạn có thể bắt đầu ngay:
from openai import OpenAI
# Cấu hình bằng biến môi trường
client = OpenAI()
messages = [{"role": "user", "content": "Viết hàm Python để merge hai danh sách liên kết đã sắp xếp."}]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-27B-FP8",
messages=messages,
reasoning_effort="xhigh", # xhigh, medium, hoặc low
stream=True,
)
Khi sử dụng chế độ Instruct (không tư duy), bạn có thể tắt thinking mode:
chat_response = client.chat.completions.create(
model="Qwen/Qwen3.8-27B-FP8",
messages=messages,
temperature=0.7,
top_p=0.8,
presence_penalty=1.5,
extra_body={
"top_k": 20,
"chat_template_kwargs": {"enable_thinking": False},
},
)
Lời khuyên cho nhà phát triển Việt Nam
Với việc Qwen3.8-27B-FP8 có kích thước chỉ ~28GB ở định dạng FP8, các doanh nghiệp và nhà phát triển tại Việt Nam hoàn toàn có thể triển khai mô hình này trên các máy chủ có GPU 32GB như A100 hoặc thậm chí RTX 4090 trong môi trường thử nghiệm. Điều này mở ra cơ hội lớn cho việc xây dựng các ứng dụng AI nội bộ, đặc biệt trong các lĩnh vực như:
- Chatbot hỗ trợ lập trình tùy chỉnh theo ngữ cảnh doanh nghiệp
- Trợ lý ảo đa phương thức xử lý hóa đơn, tài liệu scan, video giám sát
- Tự động hóa quy trình làm việc với khả năng tác tử dài hạn
Mô hình hiện đã có trên Hugging Face với hơn 123,000 lượt tải trong tháng qua. Dịch vụ API chính thức từ Qwen Cloud sẽ sớm ra mắt với nhiều tính năng sản xuất như ngữ cảnh mặc định 1M token và các công cụ tích hợp sẵn.
"Qwen3.8 không chỉ là một bản nâng cấp thông thường — nó đại diện cho một chuẩn mực mới cho các mô hình mã nguồn mở, đặc biệt khi kết hợp sức mạnh suy luận với khả năng hiểu thế giới thực qua hình ảnh và video." — Đánh giá từ cộng đồng Hacker News
