LensVLM: Apple nén ngữ cảnh dài thành hình ảnh, chỉ mở rộng trang thực sự liên quan

Công nghệ23 tháng 9, 2026·3 phút đọc

Apple vừa giới thiệu LensVLM-9B, mô hình ngôn ngữ thị giác có khả năng nén toàn bộ văn bản dài thành ảnh để tiết kiệm ngữ cảnh, sau đó chỉ giải nén những trang thực sự cần thiết. Cách tiếp cận này giúp xử lý tài liệu dài hiệu quả hơn mà vẫn giữ được độ chính xác khi trả lời câu hỏi.

LensVLM: Apple nén ngữ cảnh dài thành hình ảnh, chỉ mở rộng trang thực sự liên quan

Trong bối cảnh các mô hình ngôn ngữ ngày càng phải xử lý tài liệu dài, việc tiết kiệm "cửa sổ ngữ cảnh" trở thành bài toán tốn kém cả về chi phí lẫn hiệu năng. Apple mới đây đã công bố LensVLM-9B, một mô hình ngôn ngữ thị giác (Vision Language Model - VLM) theo đuổi hướng đi khá mới: biến văn bản thành hình ảnh nén, rồi chỉ giải nén những phần thực sự liên quan khi cần.

Nén văn bản thành ảnh để tiết kiệm ngữ cảnh

Ý tưởng cốt lõi của LensVLM là thay vì đưa toàn bộ văn bản thô vào ngữ cảnh của mô hình, hệ thống sẽ quét các trang tài liệu ở dạng ảnh đã nén. Khi người dùng đặt câu hỏi, mô hình sẽ chủ động xác định trang nào chứa thông tin cần thiết, sau đó dùng các "công cụ học được" (learned tools) để giải nén riêng những trang đó về dạng văn bản đầy đủ.

Cách làm này khác biệt với các phương pháp truyền thống như cắt bớt ngữ cảnh hay tìm kiếm vector (RAG), vốn thường bỏ sót thông tin hoặc gặp khó khăn khi tài liệu có cấu trúc phức tạp như bảng biểu, biểu đồ hay bố cục nhiều cột.

Theo nhóm nghiên cứu, LensVLM hỗ trợ ba mức nén là 5x, 10x và 15x, cho phép người dùng cân đối giữa dung lượng ngữ cảnh và độ chi tiết của thông tin.

Thông số kỹ thuật và cách sử dụng

LensVLM-9B có 9 tỷ tham số, kiểu dữ liệu BF16, được xây dựng dựa trên mô hình nền Qwen/Qwen3.5-9B-Base của Alibaba rồi tinh chỉnh thêm. Mô hình thuộc nhóm tác vụ Image-Text-to-Text (ảnh và văn bản đầu vào, văn bản đầu ra).

Các bước chạy thử khá đơn giản:

  • Tải mã nguồn từ kho GitHub apple-aiml-research/ml-lensvlm
  • Cài đặt các thư viện phụ thuộc bằng pip install -r requirements.txt
  • Chạy demo với mô hình apple/LensVLM-9B

Với tài liệu tùy chỉnh, người dùng có thể chỉ định tệp văn bản, câu hỏi và mức nén mong muốn. Ví dụ, đặt câu hỏi "Phát hiện chính là gì?" trên một tài liệu với mức nén 10x.

Giấy phép và tính mở

Đáng chú ý, toàn bộ tệp mô hình trong kho này — bao gồm cả phần Apple tinh chỉnh trên Qwen — được phát hành theo Giấy phép Mô hình Nghiên cứu Học máy của Apple (Apple Machine Learning Research Model License). Mã nguồn đi kèm được phân phối riêng theo Giấy phép Mã mẫu của Apple (Apple Sample Code License).

Điều này có nghĩa mô hình chủ yếu hướng tới mục đích nghiên cứu, không phải sử dụng thương mại tự do như một số mô hình mở khác.

Ý nghĩa với người dùng và nhà phát triển Việt Nam

Với các đội ngũ phát triển ứng dụng AI tại Việt Nam — đặc biệt trong lĩnh vực pháp lý, tài chính, y tế hay giáo dục — nơi tài liệu thường dài hàng trăm trang, hướng tiếp cận của LensVLM mở ra một lựa chọn mới để giảm chi phí suy luận mà vẫn giữ chất lượng trả lời.

Tuy nhiên, cần lưu ý rằng mô hình 9 tỷ tham số vẫn đòi hỏi hạ tầng GPU tương đối mạnh để chạy ổn định. Các nhà phát triển Việt Nam có thể cân nhắc lượng tử hóa mô hình hoặc thuê hạ tầng đám mây để thử nghiệm trước khi triển khai thực tế.

Việc nén ngữ cảnh thành ảnh không chỉ là mẹo tiết kiệm bộ nhớ, mà còn là cách để mô hình "nhìn" tài liệu giống con người hơn — lướt qua tổng thể trước, rồi đọc kỹ phần cần thiết.

Hiện LensVLM-9B đã có hơn 200 lượt tải trong tháng gần nhất và được kỳ vọng sẽ thu hút thêm sự quan tâm từ cộng đồng nghiên cứu cũng như các kỹ sư xây dựng hệ thống hỏi đáp tài liệu dài.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗