LensVLM: Apple nén ngữ cảnh dài thành hình ảnh, chỉ mở rộng trang thực sự liên quan
Apple vừa giới thiệu LensVLM-9B, mô hình ngôn ngữ thị giác có khả năng nén toàn bộ văn bản dài thành ảnh để tiết kiệm ngữ cảnh, sau đó chỉ giải nén những trang thực sự cần thiết. Cách tiếp cận này giúp xử lý tài liệu dài hiệu quả hơn mà vẫn giữ được độ chính xác khi trả lời câu hỏi.

Trong bối cảnh các mô hình ngôn ngữ ngày càng phải xử lý tài liệu dài, việc tiết kiệm "cửa sổ ngữ cảnh" trở thành bài toán tốn kém cả về chi phí lẫn hiệu năng. Apple mới đây đã công bố LensVLM-9B, một mô hình ngôn ngữ thị giác (Vision Language Model - VLM) theo đuổi hướng đi khá mới: biến văn bản thành hình ảnh nén, rồi chỉ giải nén những phần thực sự liên quan khi cần.
Nén văn bản thành ảnh để tiết kiệm ngữ cảnh
Ý tưởng cốt lõi của LensVLM là thay vì đưa toàn bộ văn bản thô vào ngữ cảnh của mô hình, hệ thống sẽ quét các trang tài liệu ở dạng ảnh đã nén. Khi người dùng đặt câu hỏi, mô hình sẽ chủ động xác định trang nào chứa thông tin cần thiết, sau đó dùng các "công cụ học được" (learned tools) để giải nén riêng những trang đó về dạng văn bản đầy đủ.
Cách làm này khác biệt với các phương pháp truyền thống như cắt bớt ngữ cảnh hay tìm kiếm vector (RAG), vốn thường bỏ sót thông tin hoặc gặp khó khăn khi tài liệu có cấu trúc phức tạp như bảng biểu, biểu đồ hay bố cục nhiều cột.
Theo nhóm nghiên cứu, LensVLM hỗ trợ ba mức nén là 5x, 10x và 15x, cho phép người dùng cân đối giữa dung lượng ngữ cảnh và độ chi tiết của thông tin.
Thông số kỹ thuật và cách sử dụng
LensVLM-9B có 9 tỷ tham số, kiểu dữ liệu BF16, được xây dựng dựa trên mô hình nền Qwen/Qwen3.5-9B-Base của Alibaba rồi tinh chỉnh thêm. Mô hình thuộc nhóm tác vụ Image-Text-to-Text (ảnh và văn bản đầu vào, văn bản đầu ra).
Các bước chạy thử khá đơn giản:
- Tải mã nguồn từ kho GitHub
apple-aiml-research/ml-lensvlm - Cài đặt các thư viện phụ thuộc bằng
pip install -r requirements.txt - Chạy demo với mô hình
apple/LensVLM-9B
Với tài liệu tùy chỉnh, người dùng có thể chỉ định tệp văn bản, câu hỏi và mức nén mong muốn. Ví dụ, đặt câu hỏi "Phát hiện chính là gì?" trên một tài liệu với mức nén 10x.
Giấy phép và tính mở
Đáng chú ý, toàn bộ tệp mô hình trong kho này — bao gồm cả phần Apple tinh chỉnh trên Qwen — được phát hành theo Giấy phép Mô hình Nghiên cứu Học máy của Apple (Apple Machine Learning Research Model License). Mã nguồn đi kèm được phân phối riêng theo Giấy phép Mã mẫu của Apple (Apple Sample Code License).
Điều này có nghĩa mô hình chủ yếu hướng tới mục đích nghiên cứu, không phải sử dụng thương mại tự do như một số mô hình mở khác.
Ý nghĩa với người dùng và nhà phát triển Việt Nam
Với các đội ngũ phát triển ứng dụng AI tại Việt Nam — đặc biệt trong lĩnh vực pháp lý, tài chính, y tế hay giáo dục — nơi tài liệu thường dài hàng trăm trang, hướng tiếp cận của LensVLM mở ra một lựa chọn mới để giảm chi phí suy luận mà vẫn giữ chất lượng trả lời.
Tuy nhiên, cần lưu ý rằng mô hình 9 tỷ tham số vẫn đòi hỏi hạ tầng GPU tương đối mạnh để chạy ổn định. Các nhà phát triển Việt Nam có thể cân nhắc lượng tử hóa mô hình hoặc thuê hạ tầng đám mây để thử nghiệm trước khi triển khai thực tế.
Việc nén ngữ cảnh thành ảnh không chỉ là mẹo tiết kiệm bộ nhớ, mà còn là cách để mô hình "nhìn" tài liệu giống con người hơn — lướt qua tổng thể trước, rồi đọc kỹ phần cần thiết.
Hiện LensVLM-9B đã có hơn 200 lượt tải trong tháng gần nhất và được kỳ vọng sẽ thu hút thêm sự quan tâm từ cộng đồng nghiên cứu cũng như các kỹ sư xây dựng hệ thống hỏi đáp tài liệu dài.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Anthropic tuyên bố phòng thí nghiệm sinh học của mình đã tìm ra một phát hiện lớn
23 tháng 9, 2026