PrismML và tham vọng đưa LLM khổng lồ lên máy tính cá nhân
Phòng thí nghiệm AI PrismML vừa phát hành Bonsai 2 27B, mô hình nén từ Qwen3.8 27B của Alibaba xuống chỉ còn 5,9 GB nhưng vẫn giữ 98% hiệu năng gốc. Công nghệ trọng số ternary của startup này hứa hẹn mở ra kỷ nguyên AI chạy trực tiếp trên PC và smartphone.

Nếu bạn chưa từng nghe đến cái tên PrismML, có lẽ đã đến lúc nên để mắt tới. Không phải vì startup này gọi được số vốn khổng lồ — họ mới chỉ có vòng hạt giống 22,25 triệu USD — mà vì đội ngũ kỹ sư tài năng đứng sau và công nghệ có tiềm năng thay đổi cả ngành.
PrismML đang đặt cược vào một giả thuyết trái ngược với xu hướng chung: các mô hình ngôn ngữ lớn (LLM) có khả năng suy luận tốt không nhất thiết phải có kích thước khổng lồ. Thay vào đó, họ đang nén các mô hình suy luận xuống kích thước đủ nhỏ để chạy trên máy tính cá nhân và thậm chí cả smartphone.
Bonsai 2 27B: Nhỏ hơn 10 lần, giữ 98% hiệu năng
Hôm thứ Năm vừa qua, PrismML đã phát hành Bonsai 2 27B, phiên bản mới nhất trong dòng mô hình của mình. Cụ thể, họ nén Qwen3.8 27B — một mô hình mã nguồn mở phổ biến của Alibaba — từ kích thước gốc xuống chỉ còn 5,9 GB.
Đây là mức giảm dung lượng bộ nhớ từ 9 đến 10 lần so với bản gốc. Mô hình này đủ nhỏ để chạy trên một chiếc PC thông thường và có thể cả trên những mẫu smartphone cao cấp.
Điều đáng chú ý là hiệu năng gần như không bị đánh đổi. Theo PrismML, Bonsai 2 đạt 98% điểm benchmark tổng hợp so với Qwen gốc. Đây là bước cải thiện rõ rệt so với phiên bản Bonsai đầu tiên ra mắt hồi tháng 3, vốn chỉ đạt mức 95%.
Hiện mô hình Bonsai đầu tiên đã được tải về hơn 11 triệu lượt, và các mô hình nhỏ hơn của PrismML cũng cán mốc 2,6 triệu lượt tải — theo số liệu từ công ty.
Đội ngũ đứng sau và nhà đầu tư
PrismML được thành lập bởi một nhóm nhà nghiên cứu từ Caltech và do Babak Hassibi — giáo sư Caltech, chuyên gia về công nghệ nén dữ liệu — lãnh đạo. Startup này còn có sự tham gia cố vấn của Ion Stoica, đồng sáng lập Databricks và Giám đốc Phòng thí nghiệm Sky Computing nổi tiếng của Đại học Berkeley — nơi đã khai sinh nhiều công nghệ và startup như Letta hay SGLang.
Về phía nhà đầu tư, PrismML nhận được hậu thuẫn từ Khosla Ventures, Cerberus Capital và Caltech. Hiện có tin đồn startup đang đàm phán với Apple, dù CEO Hassibi từ chối bình luận về thông tin này.
Bí quyết nằm ở trọng số ternary
PrismML không phải công ty duy nhất theo đuổi công nghệ nén LLM — Multiverse Computing của Tây Ban Nha cũng là một cái tên đáng chú ý với số vốn gọi được khá lớn. Nhưng Hassibi khẳng định công nghệ của họ khác biệt ở chỗ mô hình gần như không mất đi hiệu năng so với bản gốc.
Bí quyết nằm ở cách xử lý trọng số (weights) — về cơ bản là thông tin mà mô hình học và lưu trữ trong quá trình huấn luyện. Thông thường, mỗi trọng số cần 16 bit để biểu diễn. Cách tiếp cận của PrismML sử dụng trọng số ternary, đơn giản hóa xuống chỉ còn ba giá trị: +1, −1 hoặc 0.
Với các giá trị cần lưu trữ nhỏ hơn nhiều cho mỗi trọng số, mô hình chiếm dung lượng ít hơn đáng kể.
Hassibi thừa nhận việc nén gần như luôn có một số tác động nhất định. Tuy nhiên, ông cho rằng đạt được mức tương đương hoàn hảo 100% trên benchmark thực chất mang tính học thuật. Bởi vì bản thân các LLM nguyên bản cũng không chính xác tuyệt đối, và các benchmark cũng không phản ánh hoàn hảo các tác vụ thực tế — nên mức giảm 2% khó có thể ảnh hưởng đáng kể đến trải nghiệm sử dụng thật.
Tham vọng tiếp theo: Mô hình hàng trăm tỷ tham số
Mục tiêu tiếp theo của startup là áp dụng kỹ thuật nén này cho những mô hình lớn hơn nữa. Hassibi chia sẻ với TechCrunch rằng các mô hình sắp ra mắt, dự kiến trong vài tháng tới, sẽ nằm trong dải vài trăm tỷ tham số.
Điểm thú vị là theo ông, mô hình càng lớn thì việc nén càng dễ giữ được trí tuệ. Khi kích thước mô hình tăng lên, có nhiều dư địa hơn để nén mà không đánh mất năng lực suy luận. Điều này đồng nghĩa với việc các mô hình khổng lồ có thể dễ dàng đạt mức tương đương 100% hơn so với các mô hình nhỏ.
Ý nghĩa với người dùng Việt Nam
Với Stoica, sức hấp dẫn của công nghệ này nằm ở khả năng đưa các mô hình tiên tiến chạy trực tiếp trên thiết bị người dùng:
Bạn sẽ có trí tuệ nhân tạo ngay trong tầm tay, và nó miễn phí vì chạy trên thiết bị bạn đã mua. Nó cũng riêng tư, vì bạn không cần gửi dữ liệu lên cloud.
Điều này đặc biệt có ý nghĩa với người dùng Việt Nam, khi mà chi phí gọi API các mô hình lớn và lo ngại về quyền riêng tư dữ liệu vẫn là rào cản lớn. Nếu xu hướng nén mô hình tiếp tục tiến bộ, chúng ta có thể sớm thấy các trợ lý AI mạnh mẽ chạy offline ngay trên laptop hay điện thoại — không cần kết nối internet, không tốn phí thuê bao, và dữ liệu cá nhân không rời khỏi thiết bị.
Đây có thể là bước ngoặt đưa AI từ mô hình tập trung trên cloud sang kỷ nguyên AI phân tán tại thiết bị, nơi mọi người đều sở hữu trí tuệ nhân tạo riêng của mình.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Zoox mất giới hạn 100 robotaxi tại Nevada: Cuộc đua xe tự lái ở Las Vegas nóng lên
17 tháng 9, 2026