Chạy mô hình 104GB Qwen3.8-Flash-Next trên Mac chỉ với 48GB RAM: Thành tựu từ slotstream
slotstream, một công cụ mã nguồn mở mới, cho phép chạy mô hình Qwen3.8-Flash-Next 4-bit nặng 104GB trên Mac có RAM thấp (tối thiểu 16GB) nhờ kỹ thuật expert-offloading và SSD-streaming. Với tốc độ giải mã khoảng 12 token/giây trên Mac 48GB, công cụ này mở ra khả năng chạy các mô hình ngôn ngữ lớn (LLM) khổng lồ trên phần cứng tiêu dùng thông thường, sử dụng MLX và Swift. Công cụ hỗ trợ chế độ tự động tối ưu bộ nhớ, dễ cài đặt và có kế hoạch bổ sung mô-đun MTP cho giải mã suy đoán (speculative decoding).

Chạy thành công mô hình 125B tham số trên Mac 48GB: Kỳ tích từ kỹ thuật SSD-streaming của slotstream
slotstream là một dự án mã nguồn mở đầy tham vọng, vừa được giới thiệu trên Hacker News, cho phép chạy mô hình ngôn ngữ lớn Qwen3.8-Flash-Next (phiên bản 4-bit, dung lượng lên tới 104GB) trên những chiếc Mac có bộ nhớ hạn chế, bắt đầu từ 16GB. Thay vì nạp toàn bộ mô hình vào RAM, slotstream thông minh chỉ tải các "expert" cần thiết vào bộ nhớ và stream phần còn lại trực tiếp từ ổ cứng SSD, mang lại hiệu năng khoảng 12 token/giây trên máy Mac 48GB.
Đây là một bước tiến quan trọng, giúp dân công nghệ Việt Nam và thế giới có thể chạy các mô hình mạnh mẽ nhất hiện nay mà không cần đầu tư vào những cỗ máy trạm đắt tiền. Toàn bộ hệ thống được viết bằng Swift, tận dụng tối đa khả năng của Apple Silicon và framework MLX, hứa hẹn một trải nghiệm liền mạch, "thuần Mac" cho những ai đam mê AI.
"Kỳ diệu" đến từ đâu? Bí mật của Expert-Offloading và SSD-Streaming
Điểm cốt lõi của slotstream nằm ở việc hiểu rõ kiến trúc của mô hình Qwen3.8-Flash-Next. Phần lớn dung lượng của mô hình (khoảng 68GB) nằm ở các expert được định tuyến (routed experts) - với 512 expert mỗi lớp nhưng chỉ 10 expert được kích hoạt cho mỗi token. slotstream tận dụng điều này một cách triệt để:
- Chỉ đọc expert cần thiết: Thay vì tải toàn bộ 512 expert, slotstream chỉ đọc từ SSD những expert được yêu cầu cho bước tính toán hiện tại vào một bộ đệm (cache) dùng chung.
- Giữ phần "lõi" trong RAM: Phần xử lý tổng hợp (dense trunk) chỉ nặng 3.8GB và luôn được giữ trong bộ nhớ, đảm bảo độ ổn định.
- Tối ưu bảng n-gram: Bảng n-gram 32GB khác được stream trực tiếp, chỉ tải các phần cần thiết.
Cách tiếp cận này cho phép slotstream hoạt động với cấu hình bộ nhớ tối thiểu chỉ 8.1GB, nhưng để đạt hiệu năng khả dụng, một chiếc Mac 16GB sẽ cho tốc độ ước tính khoảng 5 token/giây.
Việc sử dụng hàm
preadđể đọc các expert vào các slot cache dùng chung cho cả 48 lớp là một thiết kế thông minh. Các lớp "nóng" có thể mượn slot của các lớp "nguội", giúp quản lý bộ nhớ linh hoạt và hiệu quả hơn nhiều so với việc cấp phát tĩnh cho từng lớp.
Tính năng nổi bật: Tự động tối ưu, dễ dàng sử dụng
Một trong những điểm mạnh nhất của slotstream là khả năng tự động quan sát và tối ưu tài nguyên máy. Người dùng chỉ cần chạy lệnh slotstream doctor để xem bản kế hoạch bộ nhớ mà công cụ khuyến nghị cho máy của mình.
Cơ chế hoạt động thông minh:
- Tự động xác định kích thước bộ nhớ tối ưu, thường là 33GB trên các máy Mac 48GB trở lên - điểm mà tốc độ đạt mức bão hòa (plateau).
- Trong quá trình chạy, công cụ liên tục kiểm tra và có thể thu nhỏ bộ nhớ cache khi hệ thống đang áp lực, rồi mở rộng trở lại khi mọi thứ ổn định.
- Kết quả đầu ra là byte-identical (giống hệt nhau) ngay cả khi thay đổi kích thước cahe, đảm bảo tính nhất quán.
Việc cài đặt cũng vô cùng đơn giản với một lệnh curl. Người dùng có thể tương tác với mô hình thông qua các endpoint tương thích với Ollama và OpenAI SDK, mang lại trải nghiệm quen thuộc.
curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh
Sau khi cài đặt, bạn có thể sử dụng ngay với các lệnh quen thuộc:
curl localhost:11434/api/chat -d '{
"model": "qwen3.8-flash-next:4bit",
"messages": [{"role": "user", "content": "Xin chào"}]
}'
Hiệu năng và những điểm cần lưu ý
Hiệu năng đã đo đạc được trên Mac M5 Pro 48GB:
- Tốc độ giải mã: ~12 token/giây (warm decode).
- Thời gian khởi động: ~3 giây để có token đầu tiên.
- Bộ nhớ đỉnh: 32GB (tự động cân chỉnh).
Những điểm hạn chế hiện tại:
- Khởi động chậm với prompt dài: Với 8,000 token, thời gian prefill có thể mất tới ~70 giây.
- Phụ thuộc vào tốc độ SSD: Máy Mac có SSD chậm hơn sẽ cho tốc độ thấp hơn.
- Chỉ hoạt động trên Apple Silicon và macOS 14+.
Mặc dù vậy, các tác giả đã rất minh bạch khi cung cấp bộ kiểm thử (Tools/verify.sh với 81 bài kiểm tra) và tài liệu chi tiết về phương pháp đo đạc (MEASUREMENTS.md), cho thấy dự án có chất lượng kỹ thuật cao.
Tương lai của việc chạy LLM trên phần cứng phổ thông
Dự án slotstream này mang một ý nghĩa vô cùng lớn đối với cộng đồng AI, đặc biệt là những người dùng tại Việt Nam, nơi chi phí phần cứng là một rào cản lớn. Việc có thể chạy một mô hình 125B tham số trên một chiếc MacBook thông thường có thể coi là một cuộc cách mạng, giúp "dân chủ hóa" khả năng truy cập vào các mô hình AI mạnh nhất.
Nhóm phát triển đã có kế hoạch phát triển tiếp theo, bao gồm việc triển khai mô-đun MTP (Multi-Token Prediction) để hỗ trợ giải mã suy đoán (speculative decoding), hứa hẹn sẽ còn tăng tốc đáng kể. slotstream chắc chắn là một dự án đáng để cộng đồng công nghệ Việt Nam quan tâm và thử nghiệm, mở ra một kỷ nguyên mới cho việc chạy AI trên phần cứng cá nhân.