Phá vỡ giới hạn 1,58-bit cho mô hình ngôn ngữ lớn ternary

Phần cứng16 tháng 9, 2026·4 phút đọc

Các nhà nghiên cứu tại Intel đã công bố phương pháp BITCOS, một cách lưu trữ mới cho mô hình ngôn ngữ lớn ternary giúp giảm dung lượng xuống còn 1,485 bit mỗi trọng số. Bằng cách khai thác thực tế rằng các giá trị bằng 0 chiếm tới 51,5% trọng số, phương pháp này cải thiện tốc độ suy luận lên tới 1,18 lần trên CPU và 1,27 lần trên GPU.

Phá vỡ giới hạn 1,58-bit cho mô hình ngôn ngữ lớn ternary

Phá vỡ giới hạn 1,58-bit cho mô hình ngôn ngữ lớn ternary

Các nhà nghiên cứu thuộc Intel vừa công bố một phương pháp lưu trữ mới mang tên BITCOS, cho phép nén các mô hình ngôn ngữ lớn (LLM) dạng ternary xuống dưới ngưỡng lý thuyết 1,58 bit mỗi trọng số. Kết quả đo đạc trên 29 mô hình thực tế cho thấy phương pháp này tiết kiệm dung lượng hơn định dạng phổ biến hiện nay, đồng thời tăng tốc độ suy luận đáng kể trên cả CPU lẫn GPU.

Ternary LLM là gì và vì sao ngưỡng 1,58-bit lại quan trọng?

Mô hình ngôn ngữ lớn ternary lưu mỗi trọng số dưới một trong ba ký hiệu: -1, 0 hoặc +1. Về mặt lý thuyết thông tin, mỗi trọng số như vậy chỉ cần log₂3 ≈ 1,585 bit để biểu diễn, vì có ba giá trị khả dĩ với xác suất như nhau.

Tuy nhiên, trong thực tế triển khai, các định dạng đóng gói phổ biến thường gom năm trọng số ternary vào một byte. Do nhóm dữ liệu phải có kích thước là lũy thừa của hai, con số này bị làm tròn lên thành 1,625 bit mỗi trọng số. Đây là một sự lãng phí đáng kể khi xét trên quy mô hàng tỷ tham số của một mô hình ngôn ngữ lớn.

Phát hiện then chốt: số 0 chiếm hơn một nửa trọng số

Nhóm nghiên cứu đã tiến hành đo phân bố ký hiệu thực tế trên 29 mô hình ternary khác nhau và phát hiện một điều bất ngờ: giá trị 0 chiếm tới 51,5% tổng số trọng số trong một số mô hình.

Điều này có nghĩa là giả định ba ký hiệu có xác suất bằng nhau — vốn là cơ sở của ngưỡng 1,585 bit — không phản ánh đúng thực tế. Nếu tận dụng được đặc điểm phân bố lệch này, ta có thể nén dữ liệu hiệu quả hơn nhiều so với cách đóng gói truyền thống.

BITCOS: bố cục thích ứng theo phân bố

Từ quan sát trên, nhóm tác giả đề xuất BITCOS — một bố cục lưu trữ thích ứng với phân bố dữ liệu, gồm hai thành phần chính:

  • Bitmap hiện diện dày đặc: đánh dấu vị trí nào có trọng số khác 0
  • Vector dấu được nén gọn: chỉ lưu dấu của các trọng số thực sự xuất hiện

Công thức chi phí lưu trữ của BITCOS là 2 - z bit mỗi trọng số, trong đó z là tỷ lệ trọng số bằng 0. Với những mô hình có độ thưa cao, chi phí này giảm xuống đáng kể.

Kết quả thực nghiệm cho thấy:

  • BITCOS lưu trữ gọn hơn định dạng năm-trít trong 26 trên 29 mô hình được thử nghiệm
  • Trên mô hình thưa nhất, chi phí chỉ còn 1,485 bit mỗi trọng số — thấp hơn cả ngưỡng lý thuyết 1,585 bit

Tối ưu hóa cho phần cứng hiện đại

Một điểm mạnh của BITCOS là khả năng giải nén hiệu quả trên các bộ xử lý hiện đại. Nhóm nghiên cứu đã xây dựng các chuỗi giải nén tối ưu cho các nền tảng:

  • AVX-512 trên CPU Intel
  • AVX2 trên các CPU phổ thông hơn
  • GPU Intel Xe2 ở cả dạng tích hợp lẫn rời

Khi so sánh với các nhân nhân ma trận-vector (matrix-vector multiplication) ternary đạt chuẩn sản xuất hiện nay, với mật độ số 0 mà các mô hình thực tế thể hiện, mức cải thiện đạt tới 1,28 lần.

Kết quả suy luận đầu-cuối trên năm nền tảng

Nhóm tác giả cũng trình diễn kết quả suy luận LLM đầu-cuối trên 5 nền tảng khác nhau, bao gồm CPU máy khách và máy chủ, cùng GPU Xe2 tích hợp và rời. Kết quả đáng chú ý:

  • CPU: thông lượng giải mã tăng tối đa 1,18 lần
  • GPU: thông lượng giải mã tăng tối đa 1,27 lần

Đây là một ví dụ điển hình cho thấy việc hiểu rõ đặc tính dữ liệu thực tế có thể mang lại lợi ích vượt xa các giới hạn lý thuyết được đặt ra trong điều kiện giả định lý tưởng.

Ý nghĩa đối với cộng đồng AI và triển khai thực tế

Với các kỹ sư và nhà phát triển tại Việt Nam đang quan tâm đến việc triển khai LLM trên hạ tầng hạn chế, những tiến bộ như BITCOS có ý nghĩa thiết thực. Việc nén mô hình xuống dưới 1,5 bit mỗi trọng số đồng nghĩa với:

  • Tiết kiệm bộ nhớ: có thể chạy mô hình lớn hơn trên cùng một lượng RAM hoặc VRAM
  • Tăng tốc độ: giải mã nhanh hơn giúp cải thiện trải nghiệm người dùng trong các ứng dụng thời gian thực
  • Giảm chi phí hạ tầng: ít tài nguyên hơn cho cùng một khối lượng công việc

Bài báo được đăng trên arXiv với mã arXiv:2609.16338, thuộc chuyên mục Trí tuệ nhân tạo (cs.AI) và Học máy (cs.LG), do Evangelos Georganas, Alexander Heinecke và Pradeep Dubey thực hiện.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗