Gemini 3.5 Transcribe: Bước đột phá mới của Google trong công nghệ chuyển giọng nói thành văn bản thông minh

Công nghệ27 tháng 8, 2026·5 phút đọc

Google vừa chính thức giới thiệu Gemini 3.5 Transcribe, mô hình chuyển giọng nói thành văn bản (STT) mới nhất với độ chính xác cao, hỗ trợ hơn 85 ngôn ngữ và có khả năng xử lý lỗi phát âm, tiếng ồn lẫn thuật ngữ chuyên ngành. Mô hình này hứa hẹn mang lại trải nghiệm tương tác bằng giọng nói tự nhiên và hiệu quả hơn, đồng thời mở ra nhiều cơ hội mới cho các nhà phát triển trong việc xây dựng ứng dụng AI.

Gemini 3.5 Transcribe: Bước đột phá mới của Google trong công nghệ chuyển giọng nói thành văn bản thông minh

Gemini 3.5 Transcribe: Bước đột phá mới của Google trong công nghệ chuyển giọng nói thành văn bản thông minh

Google vừa chính thức trình làng Gemini 3.5 Transcribe – mô hình chuyển giọng nói thành văn bản (speech-to-text) tiên tiến nhất của hãng, hứa hẹn thay đổi cách chúng ta tương tác với thiết bị bằng giọng nói. Không chỉ dừng lại ở việc phiên âm thô, mô hình này còn có khả năng "làm sạch" lời nói, xử lý ngôn ngữ tự nhiên và hỗ trợ tới hơn 85 ngôn ngữ khác nhau.

Với tỷ lệ lỗi từ (Word Error Rate) chỉ 4.0% ở chế độ phát trực tiếp và 2.6% ở chế độ xử lý tệp ghi âm, Gemini 3.5 Transcribe hứa hẹn mang lại trải nghiệm vượt trội trong các ứng dụng như trợ lý ảo, phiên dịch thời gian thực và phân tích cuộc gọi. Sản phẩm này được kỳ vọng sẽ là nền tảng quan trọng cho các nhà phát triển đang tìm kiếm giải pháp STT thông minh cho sản phẩm của mình.

Điểm mạnh vượt trội so với các mô hình trước đó

Khác với các hệ thống nhận dạng giọng nói truyền thống thường gặp khó khăn với tiếng ồn nền và từ ngữ chuyên ngành phức tạp, Gemini 3.5 Transcribe được thiết kế để hiểu chính xác giọng nói tự nhiên của con người.

Mô hình này vượt trội hơn hẳn so với người tiền nhiệm Chirp 3 trên nhiều phương diện:

  • Tốc độ xử lý nhanh hơn 70% trong việc cho ra bản phiên âm cuối cùng
  • Khả năng hiểu ngữ cảnh tốt hơn, tự động xử lý các câu tự sửa lỗi (ví dụ: "gặp nhau thứ Ba – không, thứ Tư")
  • Lọc bỏ các từ đệm như "ừm", "à" để cho ra văn bản sạch và chuyên nghiệp
  • Nhận diện lên đến 3 người nói trong một đoạn ghi âm (chế độ hỗ trợ hơn 3 người đang trong giai đoạn thử nghiệm)

Mô tả về Gemini 3.5 Transcribe xử lý giọng nóiMô tả về Gemini 3.5 Transcribe xử lý giọng nói

Hỗ trợ đa ngôn ngữ và từ vựng tùy chỉnh

Một trong những điểm mạnh của Gemini 3.5 Transcribe là khả năng tự động nhận diện và phiên âm hơn 85 ngôn ngữ, xử lý tốt các giọng địa phương và phương ngữ khác nhau. Trên chuẩn đánh giá FLEURS, mô hình đạt tỷ lệ lỗi từ 5.50% ở chế độ phát trực tiếp và 5.04% ở chế độ không phát trực tiếp, cải thiện đáng kể so với Chirp 3.

Đặc biệt, nhà phát triển có thể cung cấp từ vựng tùy chỉnh để mô hình nhận diện chính xác các thuật ngữ chuyên ngành, mã bưu chính, ID đơn hàng hay các tên riêng có cách viết đặc biệt – một yêu cầu rất phổ biến trong các ứng dụng doanh nghiệp.

Ứng dụng thực tế trên các sản phẩm của Google

Gemini 3.5 Transcribe không chỉ dừng lại ở API mà còn được tích hợp sâu vào các sản phẩm mà người dùng sử dụng hàng ngày:

  • Rambler trên Android (trong Gboard): chuyển giọng nói thành văn bản đã được định dạng đẹp, tự động lọc từ đệm
  • Gemini app trên macOS: hỗ trợ viết văn bản, tóm tắt file, tạo hình ảnh và tìm kiếm chỉ bằng giọng nói
  • Google Antigravity: kết hợp ngữ cảnh màn hình và lịch sử trò chuyện để tăng độ chính xác khi phiên âm
  • Trình duyệt Chrome: cho phép người dùng "nói để gõ" trong bất kỳ trường văn bản nào

Cơ hội cho các nhà phát triển Việt Nam

Với việc hỗ trợ tốt tiếng Việt, Gemini 3.5 Transcribe mở ra nhiều cơ hội cho cộng đồng phát triển công nghệ tại Việt Nam. Các startup có thể tận dụng mô hình này để xây dựng:

  • Trợ lý ảo tiếng Việt với khả năng hiểu ngữ cảnh và giọng địa phương
  • Hệ thống phiên âm cuộc gọi chăm sóc khách hàng với nhận diện người nói và timestamp từng từ
  • Ứng dụng học ngoại ngữ có khả năng phát hiện và sửa lỗi phát âm

Cách truy cập Gemini 3.5 Transcribe

Hiện tại, mô hình này đang được cung cấp dưới dạng public preview qua:

  • Gemini API trong Google AI Studio cho các nhà phát triển
  • Gemini Enterprise Agent Platform cho các doanh nghiệp
  • Gemini app trên macOS (hỗ trợ tiếng Anh) cho người dùng phổ thông
  • Rambler trên Android tại một số quốc gia và ngôn ngữ nhất định

Ứng dụng Gemini 3.5 Transcribe trong thực tếỨng dụng Gemini 3.5 Transcribe trong thực tế

Tương lai của tương tác bằng giọng nói

Với sự xuất hiện của Gemini 3.5 Transcribe, cuộc đua trong lĩnh vực xử lý giọng nói đang bước vào một giai đoạn mới. Việc kết hợp khả năng phiên âm chính xác với trí tuệ nhân tạo tạo sinh giúp mô hình này không chỉ "nghe" mà còn "hiểu" người dùng, mở ra những khả năng ứng dụng chưa từng có trước đây.

Các nền tảng phát triển lớn như LiveKit, LangChain, Vercel và Pipecat đã nhanh chóng hỗ trợ Gemini 3.5 Transcribe, giúp các lập trình viên có thể dễ dàng xây dựng các ứng dụng tương tác bằng giọng nói hiệu suất cao mà không cần lo lắng về hạ tầng phức tạp.

"Chúng tôi đã xây dựng Gemini 3.5 Transcribe để kết nối liền mạch với quy trình phát triển của bạn, dù bạn đang xây dựng các voice agent, công cụ phụ đề thời gian thực hay hệ thống phân tích cuộc gọi sau khi kết thúc." – Google Gemini Audio Team

Đánh giá từ người dùng về Gemini 3.5 TranscribeĐánh giá từ người dùng về Gemini 3.5 Transcribe

Sự ra đời của Gemini 3.5 Transcribe cho thấy Google vẫn đang tiếp tục đẩy mạnh chiến lược phát triển AI toàn diện, và người dùng Việt Nam hoàn toàn có thể kỳ vọng vào những trải nghiệm giọng nói ngày càng thông minh hơn trong tương lai gần.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗