Qwen3.8-27B: Mô hình mã nguồn mở 27 tỷ tham số chạy local, đánh bại cả Claude Opus trong benchmark

18 tháng 8, 2026·7 phút đọc

Qwen3.8-27B của Alibaba vừa gây chấn động cộng đồng AI khi mô hình chỉ 27 tỷ tham số này đạt điểm số ngang bằng các mô hình proprietary đắt tiền như GPT-5.6 Luna hay thậm chí vượt Claude Opus 4.8 trong một số bài test. Với khả năng chạy local trên phần cứng tiêu dùng phổ thông, mô hình Apache 2.0 này hứa hẹn thay đổi cuộc chơi cho các nhà phát triển và doanh nghiệp đang muốn kiểm soát dữ liệu của mình.

Qwen3.8-27B: Mô hình mã nguồn mở 27 tỷ tham số chạy local, đánh bại cả Claude Opus trong benchmark

Qwen3.8-27B: Mô hình mã nguồn mở 27 tỷ tham số chạy local, đánh bại cả Claude Opus trong benchmark

Trong vài ngày qua, sự kiện lớn nhất trong giới công nghệ AI không đến từ OpenAI, Anthropic hay Google, mà đến từ Alibaba với mô hình Qwen3.8-27B. Đây là mô hình ngôn ngữ lớn đa phương thức (multimodal) mã nguồn mở được phát hành dưới giấy phép Apache 2.0, gây sốc với khả năng chạy trên phần cứng tiêu dùng thông thường mà vẫn đạt được hiệu năng ngang bằng các mô hình độc quyền đắt tiền.

Với chỉ 27 tỷ tham số, mô hình này đạt điểm số 52 trên Intelligence Index của Artificial Analysis — ngang bằng với GPT-5.6 Luna (mô hình tầm trung của OpenAI) — đồng thời vượt qua cả Claude Opus 4.8 trong một số bài kiểm tra lập trình và tác vụ tự động hóa, mở ra kỷ nguyên mới cho việc chạy AI "trong tầm tay".

Điểm cân bằng hoàn hảo giữa khả năng và kích thước

Qwen3.8-27B không phải là một mô hình nhỏ thông thường. Nó sở hữu khả năng hiểu hình ảnh và video, ngữ cảnh lên tới 262.144 token, hỗ trợ lập trình, và đặc biệt là các quy trình agentic (tác vụ tự động hóa nhiều bước).

Điểm ấn tượng nhất nằm ở phần cứng: ở độ chính xác 16-bit, mô hình cần khoảng 56GB GPU memory, trong khi bản FP8 cần 28GB. Nhưng với kỹ thuật lượng tử hóa 4-bit, mô hình chỉ còn khoảng 17GB — chạy được trên laptop gaming cao cấp hoặc PC bàn làm việc mạnh.

Kết quả benchmark của Alibaba trong ngày đầu ra mắt khiến cộng đồng phải chú ý:

  • 61.7 điểm trên SWE-bench Pro
  • 90.3 điểm trên LiveCodeBench v6
  • 70.7 điểm trên CoWorkBench (benchmark văn phòng)
  • 84.3 điểm trên OSWorld-Verified

Theo bảng so sánh của Alibaba, mô hình 27B này thậm chí vượt Claude Opus 4.6 Max ở SWE-bench Pro và LiveCodeBench, dù vẫn thua ở Terminal-Bench, GPQA Diamond và Humanity’s Last Exam.

Một số đánh giá của Alibaba là nội bộ, và các bộ benchmark không giống nhau hoàn toàn, vì vậy con số này khó có thể khẳng định mô hình nào thắng tuyệt đối.

Kết quả từ bên thứ ba cho thấy sức mạnh thực sự

Cuộc trò chuyện thay đổi vào thứ Hai khi kết quả từ bên thứ ba bắt đầu xuất hiện. Tổ chức benchmark Artificial Analysis chấm Qwen3.8-27B đạt 52 điểm trên Intelligence Index — tổng hợp từ 9 bài kiểm tra về lập trình, khoa học, suy luận và các tác vụ chuyên môn. Đáng chú ý, đây là điểm số mà GPT-5.6 Luna của OpenAI đang được chấm ở mức reasoning tối đa — một dịch vụ chỉ có qua cloud.

"Đây là lần đầu tiên một mô hình local đạt được khả năng ngang tầm frontier. Chúng tôi không nghĩ tốc độ tiến bộ này lại đến sớm đến vậy." — Cline, tác nhân lập trình mã nguồn mở, chia sẻ trên X.

Trong khi đó, trên Agentic Index (đo hiệu năng của mô hình trên các tác vụ tự động hóa), Qwen3.8-27B đạt 51 điểm, vượt qua Claude Opus 4.8 — mô hình frontier mà Anthropic mới phát hành chưa đầy ba tháng trước.

Nhà phát triển Sero nhận xét: "Một mô hình chạy trên phần cứng 3.000 USD đang đánh bại mọi thứ từ 4 tháng trước, kể cả Opus. Khoảng cách giàu nghèo trong AI coi như bị xóa bỏ."

Joshua Lochner, nhà phát triển nổi tiếng với việc đưa mô hình ML vào trình duyệt, đã chạy thử Qwen3.8-27B với các kernel WebGPU tùy chỉnh và thốt lên: "Thật là một thời đại để sống!"

Sức hút khi nén nhỏ: chạy được trên máy tính cá nhân

Simon Willison, nhà phát triển và nhà văn về AI, đã thử nghiệm bản lượng tử hóa Q4_K_M khoảng 17GB trên MacBook Pro M5 Max và Nvidia DGX Spark. Kết quả: mô hình có thể viết code, hiểu hình ảnh và vận hành một vòng lặp coding-agent thông qua framework Pi agent.

Trong một thí nghiệm, mô hình tự tìm hiểu codebase để giải thích cách xác thực hoạt động; trong một thí nghiệm khác, nó viết và kiểm tra một tiện ích Python chuyển đổi transcript từ JSONL sang Markdown.

"Việc một file 17GB có thể làm tất cả những điều này trên máy tính ở nhà của tôi quả là một phép màu." — Simon Willison

Phản ứng đã phản ánh rõ qua con số: 3 triệu lượt tải trên Hugging Face chỉ sau ba ngày. Các bản lượng tử hóa khác nhau nhanh chóng xuất hiện cho các công cụ inference cục bộ. Cộng đồng LocalLLaMA trên Reddit đã tạo một megathread riêng để tổng hợp benchmark, cấu hình và so sánh — một người dùng mô tả mô hình này là "một con quái vật hoàn toàn khác biệt" khi chạy game được tạo ngay tại chỗ.

Vấn đề "suy nghĩ quá nhiều" (Overthinking)

Tuy nhiên, đằng sau sự phấn khích đó là một lưu ý quan trọng: mô hình "mua" chất lượng bằng cách suy nghĩ rất nhiều.

Artificial Analysis cho biết mô hình này đã tạo ra 160 triệu token output trong quá trình kiểm tra Intelligence Index, so với mức trung bình 43 triệu token của các mô hình mã nguồn mở tương đương.

Willison gặp phải phiên bản cực đoan của hành vi này vì mặc định Qwen sử dụng mức reasoning xhigh. Một yêu cầu tạo hình SVG về một con bồ nông lái xe đạp mất 21 phút và hơn 22.000 token suy luận trước khi đưa ra kết quả. Ông khuyến nghị nên bắt đầu với mức reasoning thấp hoặc tắt để sử dụng thông thường.

Nhà đầu tư Tomasz Tunguz trong một thí nghiệm 9 tác vụ với DeepSeek V4 Flash cho thấy: khi bật reasoning, Qwen vượt trội về chất lượng nhưng chậm hơn khoảng 30 lần và đắt hơn 4,5 lần. Ông cảnh báo chín tác vụ là chưa đủ để đưa ra kết luận.

Phần mềm inference có thể thu hẹp khoảng cách này. Qwen3.8-27B hỗ trợ Multi-Token Prediction (MTP), và Willison ghi nhận cải thiện hiệu năng khoảng 72% trên DGX Spark sau khi bật MTP qua llama.cpp — dù vẫn chỉ đạt 15–30 token mỗi giây, thấp hơn nhiều so với các mô hình cloud.

Ý nghĩa đối với doanh nghiệp

Đối với doanh nghiệp, câu hỏi quan trọng không phải là mô hình 27B có "đánh bại" Claude hay GPT hay không, mà là: một mô hình đủ nhỏ để chạy trong hạ tầng của chính tổ chức có thể xử lý đủ khối lượng công việc lập trình, phân tích tài liệu, thị giác máy tính và tác vụ agent để thay thế các cuộc gọi API cho những loại nhiệm vụ có ý nghĩa hay không.

Với giấy phép Apache 2.0, doanh nghiệp có thể kiểm tra, sửa đổi và lưu trữ mô hình ngay trong hệ thống riêng của mình — không còn lo ngại dữ liệu rời khỏi máy. Alibaba đã tài liệu hóa khả năng tương thích với các framework phổ biến như vLLM, SGLang và TokenSpeed. Một phiên bản Qwen Cloud quản lý với ngữ cảnh mặc định 1 triệu token dự kiến ra mắt sau đó.

Dữ liệu từ Hugging Face do Business Insider tổng hợp cho thấy xu hướng sử dụng thực tế lệch hẳn về các mô hình nhỏ hơn, dù các mô hình frontier khổng lồ vẫn thống trị các tiêu đề tin tức. Các mô hình trên 70 tỷ tham số chỉ chiếm một phần nhỏ trong tổng số lượt tải năm 2026 — và chiến lược phát hành đa kích thước của Alibaba đang tận dụng đúng xu hướng này.

Kết luận

Qwen3.8-27B vẫn cần thêm sự xác nhận độc lập cho các điểm benchmark của mình, hành vi suy luận mặc định vẫn kém hiệu quả, và không một bảng xếp hạng nào đủ để khẳng định sự tương đương với frontier. Nhưng chỉ sau ba ngày phát hành, các nhà phát triển không còn phản ứng dựa trên bảng benchmark của Alibaba nữa.

Họ đang phản ứng với trải nghiệm thực tế: đặt một file tương đối nhỏ lên phần cứng mà họ kiểm soát, và quan sát nó thực hiện những tác vụ mà cách đây không lâu dường như chỉ thuộc về các hệ thống độc quyền lớn nhất. Với các nhà phát triển, người dùng AI chuyên sâu — và kể cả các doanh nghiệp — đó mới chính là benchmark quan trọng nhất.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗