Google ra mắt EmbeddingGemma 2: Mô hình nhúng đa phương thức chạy trực tiếp trên thiết bị
Google vừa giới thiệu EmbeddingGemma 2, mô hình nhúng đa phương thức nhẹ với 740 triệu tham số, có khả năng ánh xạ văn bản, mã nguồn, hình ảnh, video và âm thanh vào cùng một không gian vector thống nhất. Mô hình được tối ưu cho các tác vụ chạy trên thiết bị, hỗ trợ cửa sổ ngữ cảnh 8K và phát hành theo giấy phép Apache 2.0 cho phép sử dụng thương mại.

Google vừa công bố EmbeddingGemma 2, thế hệ tiếp theo của dòng mô hình nhúng (embedding) nhẹ do hãng phát triển. Điểm đáng chú ý nhất là khả năng đa phương thức: mô hình có thể ánh xạ văn bản, mã nguồn, hình ảnh, video và âm thanh vào một không gian vector thống nhất duy nhất, thay vì phải dùng nhiều mô hình riêng biệt cho từng loại dữ liệu.
Mô hình nhúng đa phương thức của Google
Điểm nổi bật về kiến trúc và thông số
EmbeddingGemma 2 được thiết kế theo hướng tối ưu cho các tác vụ chạy trực tiếp trên thiết bị (on-device), phù hợp với điện thoại, máy tính cá nhân hoặc các thiết bị biên. Các thông số chính bao gồm:
- 740 triệu tham số với thiết kế encoder dạng mô-đun (modular encoders), cho phép xử lý linh hoạt nhiều loại dữ liệu đầu vào
- Kích thước chiều linh hoạt từ 768 đến 128 chiều nhờ kỹ thuật Matryoshka Representation Learning (MRL) — người dùng có thể cắt giảm số chiều để tiết kiệm bộ nhớ mà vẫn giữ được phần lớn chất lượng
- Cửa sổ ngữ cảnh 8K token, gấp 4 lần so với phiên bản EmbeddingGemma chỉ hỗ trợ văn bản trước đó
- Giấy phép Apache 2.0 với điều khoản cho phép sử dụng thương mại
Biểu đồ hiệu năng của mô hình
Vì sao MRL và kích thước chiều linh hoạt lại quan trọng?
Kỹ thuật Matryoshka Representation Learning cho phép mô hình "lồng ghép" thông tin theo nhiều mức độ chi tiết khác nhau. Nói cách khác, 128 chiều đầu tiên của vector đã chứa đựng phần thông tin cốt lõi nhất, các chiều tiếp theo bổ sung thêm độ tinh tế.
Điều này mang lại lợi ích thực tế lớn: nhà phát triển có thể chọn mức 768 chiều khi cần độ chính xác cao, hoặc giảm xuống 128 chiều khi triển khai trên thiết bị có tài nguyên hạn chế. Việc giảm số chiều giúp tiết kiệm đáng kể dung lượng lưu trữ vector và tăng tốc quá trình tìm kiếm tương đồng — vốn là trái tim của các hệ thống tìm kiếm ngữ nghĩa, RAG (Retrieval-Augmented Generation) và gợi ý nội dung.
Việc gom nhiều phương thức vào một không gian nhúng duy nhất giúp đơn giản hóa đáng kể kiến trúc hệ thống, thay vì phải duy trì nhiều chỉ mục vector riêng cho từng loại dữ liệu.
Ý nghĩa với thị trường và người dùng Việt Nam
Với các nhà phát triển và startup công nghệ tại Việt Nam, EmbeddingGemma 2 mở ra nhiều hướng ứng dụng thiết thực:
- Tìm kiếm đa phương thức trên thiết bị: xây dựng tính năng tìm kiếm bằng hình ảnh hoặc video ngay trong ứng dụng di động mà không cần gọi API đám mây, giúp giảm chi phí và tăng quyền riêng tư dữ liệu
- Hệ thống RAG nội bộ: doanh nghiệp có thể triển khai trợ lý AI tra cứu tài liệu, mã nguồn và tài nguyên nội bộ trên hạ tầng riêng, phù hợp với yêu cầu bảo mật dữ liệu
- Giấy phép Apache 2.0 cho phép tích hợp vào sản phẩm thương mại mà không phải lo ngại về ràng buộc pháp lý — một lợi thế so với nhiều mô hình nhúng độc quyền
Minh họa khả năng đa phương thức của mô hình
Bối cảnh cạnh tranh
EmbeddingGemma 2 gia nhập cuộc đua mô hình nhúng ngày càng sôi động, nơi các ông lớn như OpenAI, Cohere và các mô hình mã nguồn mở như BGE, E5 cũng đang cạnh tranh quyết liệt. Việc Google đẩy mạnh yếu tố đa phương thức và chạy trên thiết bị cho thấy định hướng chiến lược rõ ràng: đưa AI đến gần người dùng hơn, giảm phụ thuộc vào hạ tầng đám mây và mở rộng hệ sinh thái Gemma.
Chi tiết về mô hình và cách tải về có thể được xem tại thông báo chính thức của Google Gemma. Trong thời gian tới, câu hỏi đáng quan tâm là liệu chất lượng nhúng của mô hình này có đủ sức cạnh tranh với các giải pháp chuyên biệt chỉ dùng một phương thức hay không — và đó sẽ là yếu tố quyết định mức độ được đón nhận trong cộng đồng phát triển.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
OpenAI ra mắt Decisions API: Phân loại văn bản và hình ảnh nhanh gấp 10 lần
06 tháng 10, 2026