FreeToken: Cỗ máy suy luận AI mở khóa hiệu năng MoE trên phần cứng tiêu dùng

29 tháng 8, 2026·3 phút đọc

Các nhà nghiên cứu từ UC Berkeley và MIT đã phát triển FreeToken, một công cụ suy luận mã nguồn mở giúp tăng cường hiệu quả sử dụng các mô hình Mixture-of-Experts trên phần cứng thông thường. Bằng cách triển khai chính sách lập lịch động và tối ưu hóa quản lý trọng số, FreeToken cải thiện tốc độ giải mã và hiệu suất thực thi trong các ứng dụng AI biên, thúc đẩy các hệ thống suy luận tự lưu trữ.

FreeToken: Cỗ máy suy luận AI mở khóa hiệu năng MoE trên phần cứng tiêu dùng

Các nhà nghiên cứu từ UC BerkeleyMIT vừa giới thiệu FreeToken, một công cụ suy luận mã nguồn mở được thiết kế để giúp các mô hình Mixture-of-Experts (MoE) hoạt động mượt mà trên phần cứng tiêu dùng phổ thông — thay vì chỉ dành riêng cho các máy chủ AI đắt tiền. Đây được xem là một bước tiến quan trọng trong việc đưa các mô hình ngôn ngữ lớn (LLM) từ "mây" xuống các thiết bị cá nhân, mở ra nhiều khả năng cho các ứng dụng AI tại biên.

Khác với các mô hình một khối (dense model) truyền thống, các kiến trúc MoE sử dụng hàng chục đến hàng trăm "chuyên gia" (expert), nhưng chỉ kích hoạt một phần nhỏ trong số đó cho mỗi token đầu vào. Điều này giúp giảm chi phí tính toán về lý thuyết, nhưng cũng tạo ra thách thức lớn: toàn bộ trọng số của mô hình vẫn cần được tải vào bộ nhớ, khiến việc chạy chúng trên một GPU hoặc CPU có dung lượng RAM hạn chế trở nên cực kỳ khó khăn.

Giải pháp từ FreeToken: Lập lịch động và quản lý trọng số thông minh

Điểm mấu chốt của FreeToken nằm ở chính sách lập lịch động (dynamic scheduling). Thay vì cố định tải toàn bộ các chuyên gia vào bộ nhớ, FreeToken theo dõi hành vi của mô hình trong thời gian thực và dự đoán "chuyên gia" nào sẽ được sử dụng tiếp theo. Dựa trên dự đoán này, hệ thống chỉ tải các trọng số cần thiết lên bộ nhớ đệm, đồng thời giải phóng những phần không còn dùng nữa.

  • Chính sách lập lịch động: Giúp giảm đáng kể lượng bộ nhớ tiêu thụ, đặc biệt với các mô hình có số lượng chuyên gia lớn.
  • Tối ưu hóa quản lý trọng số: Sử dụng các thuật toán dự đoán để tải trước (prefetch) các phần trọng số sắp cần, giảm thời gian chờ đợi (latency).
  • Hiệu quả trên CPU: Nhóm nghiên cứu cho biết FreeToken có thể đạt tốc độ giải mã ổn định ngay cả trên các CPU đa nhân phổ thông, thay vì phụ thuộc hoàn toàn vào GPU.

"FreeToken cho phép chạy các mô hình MoE có hàng trăm tỷ tham số trên một chiếc máy tính cá nhân, qua đó biến những suy luận phức tạp trở thành một tác vụ có thể tự lưu trữ (self-hosted) ngay tại nhà," các tác giả chia sẻ trong bài viết kỹ thuật của mình.

Tác động tiềm năng đối với cộng đồng AI tại Việt Nam

Đối với cộng đồng AI Việt Nam, FreeToken mang đến một hướng đi được chờ đợi từ lâu: giảm chi phí hạ tầng. Thay vì phải thuê GPU đám mây với giá đắt đỏ, các kỹ sư, nhà phát triển hay các công ty startup nhỏ có thể triển khai các mô hình suy luận mạnh mẽ ngay trên máy trạm của mình. Điều này đặc biệt quan trọng trong bối cảnh nhu cầu về các hệ thống AI cá nhân hóa, bảo mật dữ liệu (không gửi dữ liệu lên mây) đang tăng cao.

Việc tối ưu hóa cho phần cứng thông thường cũng mở ra cơ hội phát triển các ứng dụng AI "đám mây riêng" (private cloud) hoặc các thiết bị IoT thông minh với năng lực xử lý ngôn ngữ tự nhiên ngay tại điểm cuối. Đây có thể là nền tảng cho nhiều sản phẩm mới trong lĩnh vực giáo dục, y tế thông minh hay chăm sóc khách hàng tự động trong nước.

Với việc là một dự án mã nguồn mở, FreeToken hứa hẹn sẽ sớm nhận được sự đóng góp từ cộng đồng toàn cầu, giúp hoàn thiện thêm khả năng tương thích với nhiều kiến trúc phần cứng khác nhau và các framework phổ biến như PyTorch hay Hugging Face.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗