Google giới thiệu DiffusionGemma: Áp dụng kỹ thuật tạo ảnh để tăng tốc độ tạo văn bản AI lên gấp 4 lần
Google DeepMind vừa công bố mô hình ngôn ngữ thử nghiệm DiffusionGemma, sử dụng kỹ thuật khuếch tán (diffusion) thường thấy trong tạo ảnh để cải thiện hiệu suất. Mô hình này có thể chạy trên phần cứng người dùng với chỉ 18GB RAM và hứa hẹn tăng tốc độ tạo văn bản lên tới 4 lần so với các LLM truyền thống.

Google giới thiệu DiffusionGemma: Áp dụng kỹ thuật tạo ảnh để tăng tốc độ tạo văn bản AI lên gấp 4 lần
Các kỹ sư tại đội ngũ Google DeepMind vừa tung ra một mô hình ngôn ngữ thử nghiệm mới lạ vào tuần này, sử dụng các kỹ thuật ban đầu được phát triển cho các trình tạo ảnh AI nhằm tăng hiệu suất tạo văn bản lên tới 4 lần khi chạy trên phần cứng người tiêu dùng có tài nguyên hạn chế. Mô hình này hoàn toàn miễn phí để tải xuống và bạn có thể chạy nó chỉ với 18 GB DRAM hoặc VRAM.
Mô hình này có mã danh là DiffusionGemma, là thành viên mới nhất trong gia đình các mô hình có trọng số mở (open-weights) của Google. Tuy nhiên, khác với Gemma 4 ra mắt vào mùa xuân năm nay, DiffusionGemma là một mô hình hỗn hợp chuyên gia (Mixture of Experts - MoE) với 26 tỷ tham số, nhưng không thực sự là một mô hình ngôn ngữ lớn (LLM) theo nghĩa truyền thống.
Thay vào đó, nó thực sự gần gũi hơn với các mô hình tạo ảnh như Stable Diffusion hay Flux. Thay vì tạo ra các token (đơn vị ngôn ngữ) từng cái một theo kiểu tự hồi quy (autoregressive), DiffusionGemma có khả năng tạo ra cả một đoạn văn bản chứa nhiều token cùng một lúc.
Quy trình này trông rất giống cách mà một mô hình khuếch tán biến những gì cơ bản là nhiễu tĩnh thành một hình ảnh thông qua một chuỗi các bước khử nhiễu.
Biểu đồ so sánh hiệu suất của DiffusionGemma
Như Google giải thích, DiffusionGemma hoạt động bằng cách trải ra một "khung nền" (canvas) gồm các token ngẫu nhiên, sau đó tinh chỉnh chúng cho đến khi đạt được kết quả đầu ra cuối cùng.
So với các LLM thông thường, vốn bị giới hạn bởi băng thông bộ nhớ và yêu cầu nhiều VRAM, các mô hình khuếch tán là khối lượng công việc chủ yếu dựa trên tính toán (compute-bound). Đây là lý do mà Google đang định vị các mô hình này cho việc triển khai cục bộ (local deployment).
Các LLM hoạt động theo cơ chế tự hồi quy. Trong quá trình tạo token, các tham số hoạt động của mô hình cần được truyền từ bộ nhớ cho mỗi token được tạo ra, khiến băng thông bộ nhớ trở thành nút thắt cổ chai chính.
Trên đám mây (cloud), các nhà cung cấp dịch vụ suy luận (inference) cân bằng giữa tính toán và băng thông bộ nhớ bằng cách xử lý hàng trăm hoặc hàng nghìn yêu cầu song song. Và như bạn có thể đoán, đây không phải là điều mà người dùng trung bình chạy mô hình cục bộ trên máy tính xách tay của mình có thể làm được.
Tuy nhiên, nhiều sản phẩm tiêu dùng, như các card đồ họa cao cấp, có dư thừa sức mạnh xử lý khá lớn, điều mà DiffusionGemma có thể tận dụng để tăng tốc độ đầu ra.
Các mô hình ngôn ngữ khuếch tán không hoàn hảo. Google không phải là đơn vị đầu tiên khám phá công nghệ này. Các mô hình trước đây, như DREAM hay Mercury 2, đã chứng minh sự tăng tốc đáng kể so với LLM thông thường, nhưng thường hoạt động kém hơn trong các điểm chuẩn (benchmark) so với quy mô của chúng.
DiffusionGemma dường như không phải là ngoại lệ. Theo Google, mô hình 26 tỷ tham số này xếp ngay sau Gemma 4 12B trong điểm chuẩn GPQA-Diamond, với lợi thế chính là tốc độ đầu ra, và ngay cả khi đó, nó cũng không ấn tượng như những gì Google quảng cáo.
Biểu đồ cho thấy sự tăng tốc khoảng 2,25 lần của DiffusionGemma so với LLM 12B tham số khi bật tính năng giải mã suy đoán (speculative decode). So với Gemma 4 26B-A4B, mức tăng tốc gần như gấp 4 lần khi chạy trên một Nvidia H100 duy nhất.
DiffusionGemma được phát hành dưới dạng mô hình thử nghiệm thay vì tập trung vào doanh nghiệp, giống như những gì chúng ta thấy với Gemma 4.
Mô hình này có sẵn để tải xuống trên các kho lưu trữ mô hình phổ biến như Hugging Face theo giấy phép Apache 2.0 rất thoải mái. Hỗ trợ đã được hợp nhất vào các công cụ suy luận phổ biến như vLLM, MLX và HF Transformers, với sự hỗ trợ cho Llama.cpp sẽ sớm ra mắt.
Mặc dù suy luận cục bộ chủ yếu là lĩnh vực của những người đam mê AI, nhưng các công ty như Google ngày càng dựa vào công nghệ này để cắt giảm chi phí đám mây liên quan đến dịch vụ AI của họ. Như bạn có thể nhớ, vào tháng 5, Google đã âm thầm bắt đầu tích hợp một LLM nhỏ vào trình duyệt web Chrome của mình.
Bài viết liên quan

Phần mềm
Tấn công Cache Poisoning biến các gói npm TanStack thành mối đe dọa nguy hiểm
12 tháng 5, 2026

Phần mềm
Epic Games giới thiệu Lore: Hệ thống kiểm soát phiên bản mã nguồn mở thế hệ mới
17 tháng 6, 2026

Phần mềm
Shii haa: Ứng dụng biến micro điện thoại thành cảm biến phát hiện nhịp thở
02 tháng 6, 2026
