Google Gemini Audio mới: Tự động loại bỏ 'ừm' và 'à' trong bản phiên âm
Google vừa cập nhật bộ công cụ Gemini Audio với ba mô hình Gemini 3.5 mới, bao gồm Gemini 3.5 Transcribe hoàn toàn mới. Tính năng này giúp phiên âm chính xác hơn 85 ngôn ngữ, tự động nhận diện thuật ngữ chuyên ngành và loại bỏ các từ đệm như 'ừm' và 'à'. Đáng chú ý, bản cập nhật này xuất hiện trong bối cảnh người dùng vẫn đang chờ đợi Gemini 3.5 Pro chính thức ra mắt.

Google vừa âm thầm ra mắt bộ mô hình Gemini Audio mới dựa trên nền tảng Gemini 3.5, mang đến khả năng phiên âm vượt trội với hơn 85 ngôn ngữ và tự động nhận diện thuật ngữ chuyên ngành. Đáng chú ý nhất là mô hình Gemini 3.5 Transcribe — một sản phẩm hoàn toàn mới được thiết kế để thay thế Chirp 3, với khả năng loại bỏ các từ đệm như "ừm", "à" và tự động chỉnh sửa văn bản chỉ bằng giọng nói.
Bản cập nhật này diễn ra trong bối cảnh người dùng vẫn đang "nín thở" chờ đợi Google phát hành Gemini 3.5 Pro — mô hình được hứa hẹn ra mắt từ tháng 6 nhưng đến nay vẫn chưa thấy đâu. Việc Google ưu tiên cải tiến mảng âm thanh thay vì tung ra mô hình tham số lớn cho thấy họ đang đặc biệt chú trọng vào trải nghiệm tương tác bằng giọng nói — một xu hướng đang "nóng" trên toàn cầu, kể cả tại thị trường Việt Nam.
Gemini 3.5 Transcribe: Người trợ lý phiên âm thông minh mới
Theo công bố của Google, Gemini 3.5 Transcribe "đại diện cho một bước tiến lớn so với mô hình phiên âm trước đó, Chirp 3", đặc biệt ở khả năng xử lý đa ngôn ngữ và tỷ lệ lỗi từ ngữ. Mô hình này cho phép người dùng "chỉnh sửa một cách tự nhiên bằng giọng nói của mình" — một tính năng mà dân văn phòng và nhà báo chắc chắn sẽ yêu thích.
Điểm ấn tượng nhất là khả năng tự động "làm sạch" bản phiên âm bằng cách loại bỏ các từ đệm vô nghĩa như "ừm" và "à". Ngoài ra, người dùng còn có thể:
- Cung cấp từ vựng tùy chỉnh để mô hình tự động nhận diện thuật ngữ chuyên ngành, tên riêng, tránh phải sửa tay nhiều lần
- Gán lời nói cho tối đa 3 người trong file ghi âm sẵn — rất hữu ích cho việc ghi chú cuộc họp hoặc phỏng vấn
- Xem timestamp ở cấp độ từng từ (word-level timestamps) để dễ dàng tra cứu ngữ cảnh
Cải tiến cho Live và Live Experimental
Bên cạnh Transcribe, Google cũng nâng cấp hai mô hình Gemini 3.5 Live và Gemini 3.5 Live Experimental — nền tảng công nghệ đằng sau chế độ trò chuyện bằng giọng nói của Gemini.
Gemini 3.5 Live giỏi hơn trong việc xử lý gián đoạn giữa câu, nhận diện ngôn ngữ và xử lý hình ảnh trực tiếp. Trong khi đó, phiên bản Experimental còn mạnh hơn khi có thể "tường thuật từng bước" quá trình suy luận của mình trong thời gian thực.
Điều này đồng nghĩa với việc trợ lý ảo sẽ ít "bối rối" hơn khi có tiếng ồn nền hoặc khi người dùng ngắt lời giữa chừng — một cải thiện lớn về trải nghiệm so với phiên bản trước.
Lịch trình triển khai
Theo thông báo, bản cập nhật Gemini Audio mới bắt đầu được triển khai từ hôm nay với các phạm vi cụ thể:
- macOS: Tất cả người dùng ứng dụng Gemini đều có thể dùng tính năng này bằng tiếng Anh
- Android: Tính năng Rambler dictation được mở tại một số quốc gia và ngôn ngữ chọn lọc
- Nhà phát triển: Có thể trải nghiệm sớm qua bản public preview trong Gemini API trên AI Studio và Antigravity
- Chrome: Google xác nhận sẽ sớm hỗ trợ trình duyệt này
Đối với người dùng Việt Nam, dù hiện tại phiên bản tiếng Việt chưa được liệt kê trong danh sách triển khai đầu tiên, nhưng với cam kết hỗ trợ hơn 85 ngôn ngữ của Google, khả năng cao tiếng Việt sẽ sớm được bổ sung trong các bản cập nhật tiếp theo. Điều này mở ra tiềm năng lớn cho các nhà sáng tạo nội dung, phóng viên, và dân công sở trong nước trong việc tự động hóa quy trình ghi chú và biên tập văn bản.
Google Gemini Audio mới với tính năng loại bỏ từ đệm
Việc Google "âm thầm" cập nhật mảng âm thanh trong khi vẫn chưa chịu phát hành Gemini 3.5 Pro có thể là một chiến lược để "giữ lửa" trong cuộc đua AI với OpenAI và các đối thủ khác. Dù vậy, với những gì Gemini Audio mới mang lại, rõ ràng Google đang đặt cược lớn vào việc biến giọng nói trở thành giao diện tương tác chính với AI — và điều này hứa hẹn sẽ thay đổi cách chúng ta làm việc, ghi chép và sáng tạo nội dung.