EmbeddingGemma 2: Mô hình nhúng đa phương thức mã nguồn mở chạy trực tiếp trên thiết bị

Công nghệ06 tháng 10, 2026·6 phút đọc

Google DeepMind vừa ra mắt EmbeddingGemma 2, mô hình nhúng đa phương thức mã nguồn mở đầu tiên có khả năng hợp nhất văn bản, hình ảnh, âm thanh và video vào một không gian vector chung. Với 740 triệu tham số và giấy phép Apache 2.0, mô hình này được tối ưu cho suy luận trên thiết bị, mở ra kỷ nguyên tìm kiếm ngữ nghĩa và RAG hoàn toàn ngoại tuyến.

EmbeddingGemma 2: Mô hình nhúng đa phương thức mã nguồn mở chạy trực tiếp trên thiết bị

EmbeddingGemma 2: Mô hình nhúng đa phương thức mã nguồn mở chạy trực tiếp trên thiết bị

Google DeepMind vừa chính thức giới thiệu EmbeddingGemma 2, mô hình nhúng đa phương thức mã nguồn mở đầu tiên có khả năng hợp nhất văn bản, hình ảnh, âm thanh và video vào một không gian vector chung. Với 740 triệu tham số và giấy phép Apache 2.0, đây được xem là bước tiến quan trọng cho các ứng dụng AI chạy trực tiếp trên thiết bị người dùng. Mô hình hứa hẹn mở ra kỷ nguyên tìm kiếm ngữ nghĩa và RAG (Retrieval-Augmented Generation) hoàn toàn ngoại tuyến.

EmbeddingGemma 2 - Mô hình nhúng đa phương thức mã nguồn mởEmbeddingGemma 2 - Mô hình nhúng đa phương thức mã nguồn mở

Từ văn bản đơn thuần đến đa phương thức toàn diện

Năm ngoái, Google DeepMind đã giới thiệu EmbeddingGemma như một giải pháp nhúng văn bản nhẹ, chất lượng cao, giúp các ứng dụng tổ chức, tìm kiếm và kết nối thông tin ngay trên phần cứng tiêu dùng. Phản hồi từ cộng đồng lập trình viên vượt xa mong đợi với hơn 20 triệu lượt tải xuống, được sử dụng để xây dựng các công cụ tìm kiếm thông minh trên thiết bị và các pipeline RAG ưu tiên quyền riêng tư.

Phiên bản thứ hai đánh dấu bước mở rộng vượt khỏi văn bản, thống nhất mã nguồn, hình ảnh, video và âm thanh trong cùng một không gian nhúng. Được xây dựng trên kiến trúc Gemma 4 và phát hành theo giấy phép thương mại Apache 2.0, EmbeddingGemma 2 có thể tìm một đoạn video cụ thể từ ghi chú thoại, hoặc tìm kiếm trong hàng giờ bản ghi âm dựa trên truy vấn văn bản — tất cả được xử lý bởi một mô hình đa phương thức duy nhất.

Những điểm nổi bật về kiến trúc và hiệu năng

EmbeddingGemma 2 được thừa hưởng công nghệ từ dòng Gemini Embedding và mang đến nhiều cải tiến đáng chú ý:

  • Chất lượng hàng đầu trong phân khúc: Đạt điểm số dẫn đầu trong nhóm mô hình nhúng đa phương thức dưới 1 tỷ tham số trên các benchmark như MTEB Code (Massive Text Embedding Benchmark) và MAEB (Massive Audio Embedding Benchmark), đồng thời ngang bằng hoặc vượt trội so với nhiều mô hình lớn hơn ở các tác vụ văn bản, thị giác và âm thanh.

  • Thiết kế module linh hoạt: Chỉ cần tối thiểu 270 triệu tham số cho các tác vụ chỉ văn bản, với bộ mã hóa thị giác (170 triệu) và âm thanh (300 triệu) tùy chọn để hỗ trợ đầy đủ đa phương thức.

  • Tiết kiệm dung lượng lưu trữ: Ứng dụng Matryoshka Representation Learning (MRL) cho phép lập trình viên cắt tỉa vector đầu ra từ 768 chiều xuống còn 512, 256 hoặc 128 chiều, giúp giảm tới 6 lần dung lượng lưu trữ cho cơ sở dữ liệu vector cục bộ.

  • Tối ưu cho hiệu năng trên thiết bị: Khi lượng tử hóa trên Google Pixel 11 Pro, mô hình chỉ cần khoảng 191MB RAM hoạt động cho trọng số văn bản và khoảng 567MB cho toàn bộ mô hình đa phương thức.

  • Cửa sổ ngữ cảnh mở rộng: Hỗ trợ 8.000 token ngữ cảnh (gấp 4 lần EmbeddingGemma 1), có thể xử lý tới 5,5 phút âm thanh, 29 hình ảnh, 58 khung video hoặc kết hợp xen kẽ giữa chúng ngay trên phần cứng cục bộ.

Benchmark văn bản quy mô lớn của EmbeddingGemma 2Benchmark văn bản quy mô lớn của EmbeddingGemma 2

Đột phá về chất lượng cho mã nguồn, thị giác và âm thanh

EmbeddingGemma 2 duy trì hiệu năng văn bản đa ngôn ngữ mạnh mẽ của phiên bản tiền nhiệm, đồng thời đạt mức cải thiện 9,92 điểm về hiệu năng mã nguồn (trên MTEB Code, từ 68,76 lên 78,68). Điều này khiến mô hình đặc biệt phù hợp cho việc lập chỉ mục mã nguồn cục bộ, tìm kiếm ngữ nghĩa mã nguồn và truy xuất cho các agent lập trình.

Đối với hình ảnh, video, tài liệu và âm thanh, mô hình thiết lập tiêu chuẩn mới về chất lượng trên mỗi tham số cho các mô hình dưới 1 tỷ tham số, thậm chí vượt qua một số mô hình chuyên biệt có kích thước gấp đôi.

Benchmark âm thanh quy mô lớn của EmbeddingGemma 2Benchmark âm thanh quy mô lớn của EmbeddingGemma 2

Kích hoạt tìm kiếm ngữ nghĩa hoàn toàn trên thiết bị

EmbeddingGemma 2 mang các khả năng mạnh mẽ trực tiếp đến phần cứng biên. Việc tạo embedding cục bộ giúp đảm bảo quyền riêng tư dữ liệu, giảm độ trễ pipeline và cho phép lập trình viên xây dựng tìm kiếm, truy xuất đa phương thức hoạt động hoàn toàn ngoại tuyến.

Khi kết hợp với các mô hình sinh như Gemma 4, EmbeddingGemma 2 cho phép các pipeline RAG trên thiết bị hiểu được dữ liệu đa phương thức phức tạp. Do cả hai mô hình đều dựa trên Gemma 4 và chia sẻ tokenizer văn bản cùng bộ mã hóa âm thanh, lập trình viên có thể chạy chúng cùng nhau trong một pipeline thống nhất với tổng dung lượng bộ nhớ thấp hơn.

Một số ứng dụng thực tế đáng chú ý:

  • Dùng văn bản hoặc hình ảnh để tìm các kết quả khớp hàng đầu trong thư viện media dựa trên độ tương đồng ngữ nghĩa, thử nghiệm qua Instant Media Search của Google AI Edge Gallery.

  • Xác định các khoảnh khắc cụ thể trong video bằng truy vấn văn bản hoặc âm thanh với Video Moments Finder.

  • Kết hợp EmbeddingGemma 2 cho truy xuất tệp cục bộ với Gemma 4 cho suy luận theo ngữ cảnh qua ứng dụng Foresight.

  • Tạo các engine ra quyết định thời gian thực tận dụng ngữ cảnh đa phương thức cho phân loại, định tuyến và dự đoán thông qua MediaPipe Decision Task API.

Bắt đầu với EmbeddingGemma 2

Google DeepMind đã hợp tác chặt chẽ với nhiều đối tác để đảm bảo EmbeddingGemma 2 hoạt động ngay lập tức trong môi trường phát triển của bạn:

  • Tải mô hình: Trọng số có sẵn trên Hugging Face và Kaggle, với Gemini Enterprise Agent Platform Model Garden sẽ ra mắt sớm.

  • Triển khai trên thiết bị: Phát triển ứng dụng đa nền tảng với Google AI Edge MediaPipe hoặc LiteRT cho tích hợp mô hình tùy chỉnh. Xây dựng cho trình duyệt với transformers.js hoặc WebGPU.

  • Công cụ phát triển yêu thích: Phục vụ mô hình hiệu quả bằng transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama và LMStudio. Lưu trữ vector nhúng với Qdrant.

  • Tinh chỉnh: Theo hướng dẫn của Unsloth để tinh chỉnh EmbeddingGemma 2 cho các trường hợp sử dụng cụ thể.

Đối với cộng đồng lập trình viên Việt Nam, đây là cơ hội đáng chú ý để xây dựng các ứng dụng AI tìm kiếm và truy xuất dữ liệu ngay trên thiết bị, không cần phụ thuộc vào hạ tầng đám mây — đặc biệt hữu ích trong bối cảnh yêu cầu về quyền riêng tư dữ liệu ngày càng được siết chặt theo Nghị định 13 về bảo vệ dữ liệu cá nhân.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗