DiffusionGemma: Đột phá mới của Google với mô hình ngôn ngữ khuếch tán cực nhanh

Công nghệ20 tháng 8, 2026·6 phút đọc

DiffusionGemma, mô hình ngôn ngữ mã nguồn mở mới của Google, sử dụng kỹ thuật khuếch tán rời rạc để tạo văn bản song song 256 token thay vì tuần tự như các mô hình autoregressive truyền thống. Kết quả là tốc độ sinh văn bản lên tới 1.500 token/giây trên một GPU H100, nhanh hơn đáng kể so với các mô hình hiện tại, đồng thời vẫn duy trì chất lượng và khả năng mở rộng đáng kể.

DiffusionGemma: Đột phá mới của Google với mô hình ngôn ngữ khuếch tán cực nhanh

DiffusionGemma: Bước tiến đột phá của Google trong việc tăng tốc độ sinh văn bản của mô hình ngôn ngữ

Trong bối cảnh cuộc đua phát triển trí tuệ nhân tạo ngày càng khốc liệt, Google vừa trình làng DiffusionGemma, một mô hình ngôn ngữ lớn (LLM) thử nghiệm với kiến trúc hoàn toàn mới, hứa hẹn phá vỡ nút thắt tốc độ của các mô hình như GPT hay Gemini. Thay vì tạo ra từng token một cách tuần tự, DiffusionGemma sử dụng cơ chế khuếch tán rời rạc để tinh chỉnh song song một khối 256 token, mở ra một kỷ nguyên mới về hiệu suất suy luận cho AI tạo sinh.

Báo cáo kỹ thuật công bố trên arXiv cho thấy mô hình này được phát triển bằng cách tinh chỉnh mô hình hỗn hợp chuyên gia (MoE) Gemma 4 với 3.8 tỷ tham số kích hoạt trên tổng số 25.2 tỷ tham số. Đáng chú ý, DiffusionGemma chỉ cần chưa đến 10% ngân sách token huấn luyện so với mô hình autoregressive (AR) ban đầu, nhờ một quy trình hai giai đoạn tối ưu. Kết quả là mô hình này đạt tốc độ khoảng 1.500 token mỗi giây trên một GPU NVIDIA H100, nhanh hơn đáng kể so với các phương pháp giải mã đầu cơ (speculative decoding) tiên tiến nhất hiện nay, đồng thời mở ra tiềm năng cho một kiến trúc kết hợp trong tương lai.

Hiệu suất vượt trội nhờ cơ chế "khuếch tán song song"

Kiến trúc cốt lõi của DiffusionGemma giải quyết triệt để nhược điểm lớn nhất của các mô hình ngôn ngữ hiện đại: sự tuần tự bắt buộc trong quá trình sinh văn bản. Các mô hình AR truyền thống như GPT-4, Claude hay Llama phải dự đoán từng token một, dựa trên toàn bộ văn bản đã sinh trước đó, tạo ra một điểm nghẽn tính toán không thể tránh khỏi. DiffusionGemma đảo ngược hoàn toàn logic này bằng cách dự đoán và tinh chỉnh đồng thời một "khối" gồm 256 token trong mỗi lần tiến về phía trước (forward pass).

Quá trình này giống như việc một họa sĩ phác thảo toàn bộ bức tranh trước, sau đó mới tô vẽ chi tiết từng phần, thay vì vẽ từng nét một. Cụ thể, mô hình bắt đầu với một chuỗi token nhiễu ngẫu nhiên và lặp đi lặp lại việc loại bỏ nhiễu trong toàn bộ khối văn bản. Phương pháp này mang lại tốc độ trung bình khoảng 20 token cho mỗi lần suy luận, tăng khả năng xử lý song song trên phần cứng AI chuyên dụng, đặc biệt là GPU.

Chiến lược huấn luyện tiết kiệm và hiệu quả

Một trong những điểm đáng chú ý nhất của DiffusionGemma không nằm ở việc huấn luyện từ đầu mà là chiến lược tinh chỉnh thông minh, tiết kiệm tài nguyên. Các nhà nghiên cứu Google đã chọn mô hình Gemma 4 với kiến trúc hỗn hợp chuyên gia (MoE) làm nền tảng. MoE cho phép chỉ kích hoạt một phần tham số nhất định trong mỗi lần xử lý, giúp mô hình vừa có kích thước lớn để đảm bảo chất lượng, vừa tối ưu chi phí tính toán.

Quy trình huấn luyện được chia thành hai giai đoạn chính:

  • Giai đoạn 1 - Học có giám sát (SFT): Dạy mô hình cách khử nhiễu theo chiều (bidirectional denoising), tức là hiểu được ngữ cảnh từ cả hai phía của câu, thay vì chỉ từ trái sang phải như các mô hình AR.
  • Giai đoạn 2 - Tăng cường và chưng cất: Sử dụng học tăng cường (RL) kết hợp với kỹ thuật chưng cất từ bộ giải mã (sampler distillation) để cải thiện chất lượng đầu ra đồng thời tăng hiệu quả suy luận.

Chính sự kết hợp này là chìa khóa để DiffusionGemma không chỉ đạt tốc độ khổng lồ mà còn duy trì chất lượng văn bản đầu ra ở mức cạnh tranh, thiết lập một "đường biên Pareto" mới cho sự đánh đổi giữa tốc độ sinh và năng lực mô hình.

Giữ nguyên các khả năng cao cấp của Gemma 4

Dù trải qua quá trình tinh chỉnh đặc biệt, DiffusionGemma vẫn không đánh mất những tính năng nổi bật vốn có của mô hình gốc. Mô hình được quảng bá là vẫn hỗ trợ đầy đủ chế độ suy luận tư duy (thinking mode), khả năng xử lý đa phương thức (kết hợp văn bản và hình ảnh) và ngữ cảnh dài. Điều này cho thấy sự linh hoạt của kiến trúc diffusion mới, khi nó có thể kế thừa gần như toàn bộ tri thức và kỹ năng đã được tối ưu trong quá trình huấn luyện trước đó.

Một khám phá khoa học đầy hứa hẹn khác là việc DiffusionGemma vẫn có thể hoạt động như một mô hình autoregressive thông thường sau khi được tinh chỉnh, chỉ với một sự suy giảm hiệu suất nhỏ không đáng kể. Khả năng lai này mở đường cho một kiến trúc hybrid có thể linh hoạt chuyển đổi giữa hai chế độ: tốc độ cao khi cần hay độ chính xác tuyệt đối khi xử lý các tác vụ phức tạp.

Tác động tiềm năng và tương lai của AI tạo sinh

Sự xuất hiện của DiffusionGemma mang ý nghĩa to lớn, không chỉ với giới nghiên cứu mà còn với toàn bộ hệ sinh thái ứng dụng AI. Việc giảm thời gian chờ đợi sinh văn bản từ vài chục giây xuống còn vài phần nghìn giây sẽ biến các ứng dụng thời gian thực như trợ lý ảo đàm thoại, dịch máy tức thời hay viết code hỗ trợ trở nên mượt mà hơn bao giờ hết.

Tuy nhiên, những con số ấn tượng vẫn còn nằm trong phạm vi thử nghiệm. Với việc công bố báo cáo kỹ thuật, các nhà nghiên cứu và kỹ sư trên toàn thế giới, bao gồm cả cộng đồng công nghệ tại Việt Nam, có thể bắt tay vào nghiên cứu, thử nghiệm và phát triển dựa trên mô hình mã nguồn mở này. Sự cởi mở này là chìa khóa để nhanh chóng xác thực và phổ biến công nghệ đột phá, đưa AI tạo sinh đến gần hơn với mọi người dùng.

"DiffusionGemma thiết lập một đường biên Pareto mới cho sự đánh đổi giữa tốc độ sinh văn bản và năng lực mô hình." - Trích báo cáo kỹ thuật DiffusionGemma.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗