Qwen 3.8-Flash-Next ra mắt ngày mai: Mô hình 125B tham số với kiến trúc MoE siêu nhẹ
Alibaba chuẩn bị phát hành Qwen 3.8-Flash-Next, mô hình ngôn ngữ lớn 125B tham số sử dụng kiến trúc MoE chỉ kích hoạt 6B tham số mỗi token, hứa hẹn mang lại hiệu suất cao với chi phí vận hành thấp. Mô hình được công bố trên ModelScope và sẽ chính thức ra mắt vào ngày mai, mở ra hướng tiếp cận mới cho việc triển khai AI quy mô lớn trên phần cứng phổ thông.

Qwen 3.8-Flash-Next: Mô hình 125B tham số "siêu nhẹ" của Alibaba ra mắt ngày mai
Alibaba vừa công bố trên ModelScope rằng Qwen 3.8-Flash-Next sẽ chính thức được phát hành vào ngày mai. Đây là mô hình ngôn ngữ lớn thuộc dòng Qwen 3.8, sở hữu tổng cộng 125B tham số nhưng chỉ kích hoạt 6B tham số cho mỗi token nhờ kiến trúc Mixture of Experts (MoE) hiện đại. Điều này giúp mô hình đạt hiệu suất vượt trội trong khi vẫn duy trì chi phí suy luận (inference) cực kỳ thấp, mở ra khả năng triển khai ngay cả trên những hệ thống phần cứng tầm trung.
Bước đột phá về kiến trúc MoE
Thay vì kích hoạt toàn bộ tham số như các mô hình dense truyền thống, Qwen 3.8-Flash-Next sử dụng cơ chế routing thông minh — mỗi token đầu vào chỉ cần "đánh thức" 6B tham số trong tổng số 125B chuyên gia (experts). Phương pháp này đã được chứng minh qua các mô hình như DeepSeek V3 hay Mixtral, nhưng con số tỷ lệ kích hoạt chỉ ~4,8% của Qwen 3.8-Flash-Next đặc biệt ấn tượng, cho thấy Alibaba đã tối ưu sâu về mặt kỹ thuật phân phối tải giữa các "chuyên gia".
Với thiết kế này, doanh nghiệp có thể chạy mô hình trên một node GPU duy nhất (ví dụ: A100 hoặc H100) thay vì phải đầu tư cụm cluster lớn như các mô hình 125B dense (cần khoảng 250GB VRAM chỉ cho trọng số).
Ứng dụng thực tiễn cho thị trường Việt Nam
Việc Qwen 3.8-Flash-Next ra mắt mang ý nghĩa đặc biệt với cộng đồng AI Việt Nam vì:
- Giảm rào cản phần cứng: Với chỉ 6B tham số kích hoạt, các startup và doanh nghiệp vừa tại Việt Nam có thể tự triển khai chatbot, trợ lý ảo hoặc hệ thống hỗ trợ lập trình mà không cần thuê dịch vụ API đắt đỏ.
- Tối ưu chi phí vận hành: Chi phí điện năng và cooling cho việc chạy mô hình giảm mạnh so với mô hình dense cùng quy mô, phù hợp với các bài toán cần chạy inferencing liên tục.
- Khả năng tinh chỉnh đa ngữ: Dòng Qwen nổi tiếng hỗ trợ tốt tiếng Việt, đây sẽ là lựa chọn hấp dẫn để xây dựng các ứng dụng AI xử lý ngôn ngữ bản địa trong lĩnh vực thương mại điện tử, du lịch hay nội dung số.
Phát hành và nguồn tài nguyên
Mô hình hiện đã xuất hiện trên trang chính thức: https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next. Thông tin chi tiết về giấy phép, benchmark, và hướng dẫn triển khai sẽ được cập nhật ngay khi phát hành chính thức vào ngày mai.
Nếu bạn là developer hoặc nhà nghiên cứu đang tìm kiếm mô hình có hiệu năng cao nhưng tiết kiệm tài nguyên, đây chắc chắn là bản phát hành đáng theo dõi nhất trong tuần này. Lehuy.net sẽ tiếp tục cập nhật những đánh giá chuyên sâu về chất lượng sinh văn bản, tốc độ suy luận và khả năng tương thích với các framework phổ biến như Llama.cpp hay vLLM sau khi mô hình chính thức được mở.