LittleBit: Nén mô hình ngôn ngữ lớn xuống dưới 1 bit mỗi trọng số
Samsung Labs công bố LittleBit, phương pháp lượng tử hóa cho phép nén mô hình ngôn ngữ lớn xuống mức cực thấp từ 1.0 đến 0.1 bit mỗi trọng số mà vẫn giữ nguyên kiến trúc khi suy luận. Phiên bản LittleBit-2 (ICML 2026) bổ sung kỹ thuật căn chỉnh hình học tiềm ẩn nhằm nâng cao chất lượng khởi tạo.

LittleBit: Nén mô hình ngôn ngữ lớn xuống dưới 1 bit mỗi trọng số
Nhóm nghiên cứu tại Samsung Labs vừa công bố LittleBit, một phương pháp lượng tử hóa cực thấp cho phép nén các mô hình ngôn ngữ lớn (LLM) xuống mức dưới 1 bit cho mỗi trọng số. Kỹ thuật này hứa hẹn giảm mạnh chi phí lưu trữ và bộ nhớ khi triển khai AI, đồng thời vẫn giữ nguyên kiến trúc mô hình gốc ở giai đoạn suy luận.
Đây là kết quả được công bố tại NeurIPS 2025, với phiên bản nâng cấp LittleBit-2 dự kiến trình bày tại ICML 2026. Mã nguồn chính thức đã được mở trên GitHub.
LittleBit - NeurIPS 2025
Nguyên lý hoạt động
LittleBit tiếp cận bài toán nén theo hướng phân rã nhân tử tiềm ẩn (latent factorization). Cụ thể, mỗi ma trận trọng số dày đặc được tách thành các nhân tử hạng thấp, sau đó nhị phân hóa các nhân tử này, rồi khôi phục thông tin độ lớn bằng các hệ số vô hướng nhẹ được học trong quá trình huấn luyện.
Cách làm này cho phép đạt mức nén cực đoan, bao gồm cả thiết lập 0.1 bit mỗi trọng số, mà vẫn bảo toàn kiến trúc mô hình ban đầu khi suy luận. Nói cách khác, mô hình sau khi nén có thể chạy trên cùng một luồng suy luận như mô hình gốc, không cần thay đổi cấu trúc.
Phiên bản LittleBit-2 giải quyết vấn đề lệch hình học tiềm ẩn trong giai đoạn khởi tạo. Phương pháp áp dụng Internal Latent Rotation kết hợp Joint Iterative Quantization (Joint-ITQ) để căn chỉnh các nhân tử tiềm ẩn từ phân rã SVD với siêu khối nhị phân trước khi bước vào huấn luyện nhận biết lượng tử hóa (QAT). Đáng chú ý, LittleBit-2 chỉ thay đổi khởi tạo và không tạo thêm chi phí tính toán khi suy luận.
LittleBit-2 - ICML 2026
Điểm nổi bật
- Nén dưới 1 bit: Được thiết kế cho dải từ 1.0 đến 0.1 bit mỗi trọng số.
- LittleBit-2 tùy chọn: Kích hoạt khởi tạo Joint-ITQ bằng cờ
--use_itqđể căn chỉnh hình học tiềm ẩn tốt hơn. - Không thay đổi khi suy luận: LittleBit-2 chỉ can thiệp vào khởi tạo, lớp phân rã đã triển khai vẫn giữ nguyên.
- Thân thiện với QAT: Hỗ trợ huấn luyện nhận biết lượng tử hóa với SmoothSign và phân rã dư (residual factorization) tùy chọn.
Mô hình được hỗ trợ
Mã nguồn hiện hỗ trợ nhiều dòng mô hình phổ biến:
- OPT
- Llama, Llama 2 và Llama 3
- Phi-4
- Qwen2.5 và QwQ
- Gemma 2 và Gemma 3
- Qwen3
Việc hỗ trợ cả Llama, Qwen lẫn Gemma cho thấy phương pháp có thể áp dụng rộng rãi, không phụ thuộc vào một kiến trúc mô hình cụ thể.
Cài đặt và sử dụng
Dự án khuyến nghị Python 3.12 và sử dụng PyTorch 2.8.0 với CUDA 12.4. Người dùng cần cài đặt CUDA toolkit, PyTorch và các phụ thuộc qua requirements.txt.
Lưu ý quan trọng: để tái lập kết quả trong bài báo, cần dùng transformers 4.51.x. Các bản transformers mới hơn có thể thay đổi nội bộ mô hình hoặc hành vi đánh giá.
Để huấn luyện, người dùng chạy module main với các tham số như --model_id, --dataset, --eff_bit, --quant_func SmoothSign và --residual True. Mặc định, LittleBitLinear dùng khởi tạo SVD gốc; muốn bật LittleBit-2, chỉ cần thêm --use_itq True. Hỗ trợ cả huấn luyện trên một GPU lẫn đa GPU thông qua DeepSpeed.
Để đánh giá, script eval.py cho phép đo perplexity trên các tập như wikitext2, c4, đồng thời chạy các bài kiểm tra zero-shot gồm boolq, piqa, hellaswag, winogrande, arc_easy, arc_challenge và openbookqa.
Ý nghĩa với cộng đồng AI
Nén mô hình xuống dưới 1 bit mỗi trọng số là một bước tiến đáng kể trong bối cảnh các LLM ngày càng lớn và tốn kém tài nguyên. Với các nhà phát triển tại Việt Nam, những kỹ thuật như LittleBit có thể giúp triển khai mô hình trên phần cứng hạn chế, giảm chi phí máy chủ và mở đường cho các ứng dụng AI chạy cục bộ.
Đáng chú ý, việc LittleBit-2 không tạo thêm chi phí suy luận nghĩa là lợi ích về chất lượng không phải đánh đổi bằng hiệu năng. Đây là yếu tố quan trọng với các hệ thống cần độ trễ thấp.
Mã nguồn được phát hành theo giấy phép CC BY-NC 4.0, tức cho phép sử dụng cho mục đích phi thương mại. Các nhóm muốn ứng dụng vào sản phẩm thương mại sẽ cần cân nhắc kỹ điều kiện giấy phép.