Bonsai 2 27B: Nén gần như không mất mát với kích thước nhỏ hơn 9 lần

Công nghệ17 tháng 9, 2026·5 phút đọc

PrismML vừa ra mắt Ternary Bonsai 2 27B, mô hình đa phương thức dựa trên Qwen3.8 27B với trọng số ternary chỉ 1,76 bit hiệu dụng, dung lượng 5,9GB. Mô hình giữ lại 98,2% hiệu năng so với bản full-precision nhưng nhỏ hơn hơn 9 lần, mở ra khả năng chạy AI cấp 27B ngay trên thiết bị cục bộ.

Bonsai 2 27B: Nén gần như không mất mát với kích thước nhỏ hơn 9 lần

PrismML vừa chính thức ra mắt Ternary Bonsai 2 27B, thế hệ mô hình mới nhất trong dòng Bonsai của họ. Đây được xem là bước tiến quan trọng khi lần đầu tiên một mô hình đa phương thức cấp 27B có thể đạt mức nén gần như không mất mát, đồng thời vẫn đảm bảo hiệu năng đủ để chạy mượt trên các thiết bị cục bộ.

Bonsai 2 27B là gì?

Ternary Bonsai 2 27B được xây dựng dựa trên nền tảng Qwen3.8 27B, mang đến khả năng suy luận, lập trình, thị giác máy tính và tác tử (agentic) mạnh mẽ hơn so với thế hệ trước. Điểm khác biệt cốt lõi nằm ở cách nén: mô hình sử dụng trọng số ternary {−1, 0, +1} kết hợp với scaling theo nhóm FP16, đạt mức 1,76 bit hiệu dụng trên mỗi trọng số và tổng dung lượng chỉ 5,9GB.

So với phiên bản full-precision, Bonsai 2 27B nhỏ hơn hơn 9 lần nhưng vẫn giữ được 98,2% hiệu năng tổng hợp trên các bộ benchmark. Đây là con số đáng chú ý, bởi ở ngưỡng này, nén không còn là đánh đổi kỹ thuật mà trở thành yếu tố mở khóa khả năng triển khai.

Mô hình hỗ trợ cửa sổ ngữ cảnh 262K token, nhận đầu vào đa phương thức dạng văn bản và hình ảnh, và được phát hành theo giấy phép Apache 2.0.

Hiệu năng: giữ lại năng lực ở đúng nơi quan trọng

Trên bộ benchmark bao gồm suy luận, toán học, lập trình, tuân thủ chỉ dẫn, thị giác và sử dụng công cụ tác tử, Ternary Bonsai 2 27B đạt 83,9 điểm, tương đương mức giữ lại 98,2% so với Qwen3.8 27B.

Điểm mấu chốt không chỉ nằm ở điểm tổng hợp, mà ở việc năng lực được giữ lại ở đâu.

Các tác vụ như tác tử lập trình, hệ thống dùng công cụ, quy trình đa phương thứctác vụ dài hạn thường rất nhạy cảm với suy giảm mô hình, bởi sai số nhỏ có thể tích lũy qua nhiều bước. Bonsai 2 27B vẫn bảo toàn phần lớn hiệu năng của bản full-precision ở chính những khu vực này, trong khi chỉ chiếm một phần nhỏ bộ nhớ.

So với các giải pháp low-bit khác trên thị trường, Bonsai 2 27B nổi bật như một ngoại lệ về mật độ trí tuệ. Nhiều mô hình low-bit chỉ có thể triển khai được khi phải hy sinh đáng kể năng lực lập trình, thị giác hoặc dùng công cụ. Bonsai 2 27B đẩy biên giới về phía cả năng lực cao hơn lẫn mức tiêu thụ bộ nhớ thấp hơn.

Tốc độ và hiệu quả năng lượng

Về mặt vận hành, Ternary Bonsai 2 27B đạt tới 143 token/giây trên NVIDIA GeForce RTX 509046,8 token/giây trên M5 Max. Trên RTX 4090, mô hình chỉ tiêu thụ 0,714 mWh/token, tức tiết kiệm năng lượng hơn 40% so với một mô hình 8B chạy ở full-precision.

Với trợ lý lập trình, thông lượng cao hơn đồng nghĩa vòng lặp sửa lỗi – gỡ lỗi nhanh hơn. Với tác tử đa phương thức, đó là khả năng lặp nhanh hơn trên ảnh chụp màn hình, tài liệu và các lệnh gọi công cụ. Với quy trình cục bộ riêng tư, hiệu quả năng lượng tốt hơn nghĩa là nhiều suy luận hữu ích hơn trên cùng một thiết bị, thời lượng pin dài hơn và con đường thực tế hơn để các trợ lý AI luôn sẵn sàng ở chế độ nền mà không cần liên tục gọi lên cloud.

Bước tiến so với thế hệ trước

So với Ternary Bonsai 27B ra mắt hai tháng trước, phiên bản Bonsai 2 27B đã thu hẹp khoảng cách giữ lại năng lực so với bản full-precision từ 95% lên hơn 98%. Đây là cải thiện đáng kể, khiến bản phát hành hiện tại gần như "không mất mát" trên thực tế, và càng củng cố quan điểm rằng mô hình low-bit có thể là cách tốt nhất để triển khai AI.

Ý nghĩa của điều này vượt xa suy luận cục bộ. Mô hình low-bit có thể thay đổi kinh tế học và kiến trúc của các hệ thống AI trên mọi tầng: từ thiết bị cá nhân, máy trạm đến trung tâm dữ liệu. Chúng cho phép nhét mô hình lớn hơn vào cùng một dung lượng bộ nhớ, phục vụ nhiều người dùng hơn trên cùng phần cứng, giảm năng lượng mỗi lần suy luận và mở ra các hệ thống lai tự động quyết định phần nào chạy cục bộ, phần nào đẩy lên cloud.

Câu hỏi đặt ra sẽ không còn chỉ là mô hình mạnh đến đâu, mà là bao nhiêu trí tuệ hữu ích có thể được cung cấp trong một ngân sách bộ nhớ, tính toán và năng lượng nhất định.

Nền tảng hỗ trợ và khả năng ứng dụng

Ternary Bonsai 2 27B chạy trên GPU NVIDIA qua CUDA và trên thiết bị Apple (Mac, iPhone, iPad) qua MLX, thông qua các kernel low-bit tùy chỉnh. Trọng số mô hình đã có sẵn theo giấy phép Apache 2.0.

Với Bonsai 2 27B, mô hình cục bộ có thể bắt đầu đảm nhận các công việc tri thức thực sự: vòng lặp tác tử lập trình, quy trình sử dụng máy tính, phân tích tài liệu riêng tư, gỡ lỗi đa phương thức và điều phối lai — nơi mô hình cục bộ xử lý các tác vụ nhạy cảm hoặc tần suất cao, chỉ đẩy lên cloud khi thực sự cần thiết.

PrismML được thành lập bởi đội ngũ các nhà nghiên cứu từ Caltech, với sự hậu thuẫn của Khosla Ventures, Cerberus và Google, cùng hỗ trợ liên tục từ Samsung. Họ đã dành nhiều năm giải quyết một trong những bài toán khó nhất của ngành: nén mạng nơ-ron mà không đánh mất khả năng suy luận.

Chi tiết kỹ thuật đầy đủ về quy trình nén, đánh giá và benchmark có trong whitepaper của công ty. Với người dùng Việt Nam đang quan tâm đến việc chạy AI cục bộ trên máy trạm hoặc thiết bị cá nhân, đây là tín hiệu đáng chú ý: khoảng cách giữa mô hình chạy cloud và mô hình chạy tại chỗ đang ngày càng thu hẹp.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗