Cụm 7 vi điều khiển ESP32-S3 chạy mô hình ngôn ngữ 1,58-bit (BitNet)
Dự án mã nguồn mở ESP32s3-LLM-Cluster triển khai mô hình ngôn ngữ 0,5B tham số theo kiến trúc BitNet 1,58-bit trên cụm 7 chip ESP32-S3, chia tầng xử lý qua bus SPI Daisy-Chain. Đây là minh chứng cho thấy suy luận LLM hoàn toàn có thể chạy trên phần cứng vi điều khiển giá rẻ nếu kết hợp lượng tử hóa cực thấp với kiến trúc phân tán.

Cụm 7 chip ESP32-S3 cùng chạy mô hình ngôn ngữ 1,58-bit
Sơ đồ kiến trúc cụm ESP32-S3 chạy mô hình BitNet
Khi hầu hết các mô hình ngôn ngữ lớn vẫn đòi hỏi GPU vài chục GB VRAM, một dự án mã nguồn mở trên GitHub đang đi theo hướng ngược lại: chia nhỏ mô hình 0,5 tỷ tham số và chạy nó trên cụm 7 vi điều khiển ESP32-S3. Điểm nhấn kỹ thuật nằm ở chỗ mô hình được lượng tử hóa xuống mức 1,58-bit (BitNet) – tức mỗi trọng số chỉ còn ba trạng thái là -1, 0 và 1 – kết hợp truyền dữ liệu qua SPI Daisy-Chain tốc độ cao.
Kiến trúc: một master, sáu compute node
Dự án ESP32s3-LLM-Cluster vận hành theo mô hình suy luận đường ống phân tán (distributed pipeline inference). Trong đó:
- Master node đảm nhiệm tách từ bằng BPE Tokenizer, tra bảng embedding INT4 (khoảng 14MB lưu trong bộ nhớ Flash), chuẩn hóa RMS Norm cuối cùng, chạy LM Head và lấy mẫu tham lam (greedy sampling) để sinh token tiếp theo.
- Sáu compute node còn lại mỗi node gánh 4 khối Transformer (tổng cộng 24 tầng), thực thi attention 1,58-bit với Q, K, V, O projection và RoPE, cùng MLP 1,58-bit (Gate, Up, Down projection). KV Cache được giữ trong PSRAM.
- Các node trao đổi vector trạng thái ẩn FP32 với nhau qua hai kênh SPI: master phát cho node 1, node 1 chuyển tiếp cho node 2, đến node 6 rồi quay ngược kết quả về master.
Cách bố trí này biến mỗi chip thành một "mắt xích" trong dây chuyền tính toán. Vì mô hình đã bị cắt nhỏ theo tầng, dung lượng Flash và RAM hạn hẹp của ESP32-S3 không còn là rào cản tuyệt đối như khi chạy nguyên mô hình trên một chip.
Vì sao 1,58-bit lại quan trọng?
Lượng tử hóa ternary của BitNet là mấu chốt giúp dự án khả thi. Thay vì lưu trọng số dạng FP16 hay INT8, mỗi tham số chỉ cần khoảng 1,58 bit, nhờ đó kích thước mô hình co lại hàng chục lần. Phép nhân ma trận cũng được thay bằng phép cộng và phép chọn giá trị, có thể tăng tốc bằng bảng tra cứu (LUT) và các đoạn hợp ngữ tối ưu MAC cho layer 1,58-bit.
Đây là minh chứng thực nghiệm cho luận điểm: với đúng kỹ thuật lượng tử hóa, mô hình ngôn ngữ không còn là đặc quyền của trung tâm dữ liệu.
Cấu trúc kho mã nguồn
Kho mã nguồn chia thành ba phần rõ ràng:
master_board/– firmware ESP-IDF cho master, gồm trình điều phối, tokenizer, tra embedding INT4, LM Head và driver SPI hai kênh.node_firmware/– firmware cho các node tính toán, gồmbitlinear.cpp, hợp ngữbitlinear_forward.S, attention Qwen kèm RoPE và KV-Cache, cùnglut_table.cpp.python_tools/– bộ công cụ phía PC để huấn luyện nhận biết lượng tử hóa (qat_158.py), cắt tỉa từ vựng xuống 32K token, đóng gói embedding INT4 và tạo các file.binnạp thẳng vào chip.
Ngoài ra dự án còn có workflow.md hướng dẫn từng bước nạp firmware, chuẩn bị mô hình và đấu dây, cùng các script flash_*.bat để nạp đa luồng cho nhiều chip cùng lúc. Giấy phép phát hành là MIT.
Góc nhìn cho người làm IoT tại Việt Nam
Với cộng đồng nhúng và IoT Việt Nam, dự án này đáng chú ý ở hai điểm. Thứ nhất, ESP32-S3 là dòng chip phổ biến, giá rẻ và dễ mua, nên một cụm 7 chip vẫn rẻ hơn nhiều so với một GPU. Thứ hai, bài toán tối ưu ở đây – cắt tỉa từ vựng, đóng gói trọng số INT4, viết hàm tính toán bằng hợp ngữ – là kỹ năng chuyển trực tiếp sang các sản phẩm edge AI như trợ lý giọng nói ngoại tuyến, thiết bị công nghiệp cần suy luận tại chỗ mà không gửi dữ liệu lên đám mây.
Tuy vậy, cần đặt kỳ vọng đúng mức: mô hình 0,5B chạy trên vi điều khiển sẽ không thể so về chất lượng với các LLM hàng chục tỷ tham số. Giá trị của dự án nằm ở khía cạnh nghiên cứu hệ thống – chứng minh rằng kiến trúc phân tán và lượng tử hóa cực thấp có thể mở đường cho LLM chạy trên thiết bị biên.
Bài viết liên quan

Công nghệ
AMD chi 8,2 tỷ USD để sở hữu World Labs: Canh bạc vào AI không gian của Fei-Fei Li
28 tháng 9, 2026
Công nghệ
Starship của SpaceX lần đầu bay vào quỹ đạo, triển khai thế hệ Starlink mới
28 tháng 9, 2026
Phần cứng
Nvidia có thể đón tin vui tại Trung Quốc giữa lúc lo ngại về ảnh hưởng tới chính sách AI của Mỹ
28 tháng 9, 2026