Gemini 3.8 Text-to-Speech ra mắt: Tạo giọng nói tùy biến từ câu lệnh ngôn ngữ tự nhiên

Công nghệ23 tháng 9, 2026·7 phút đọc

Google vừa giới thiệu hai mô hình chuyển văn bản thành giọng nói mới là Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS, cho phép tạo giọng nói tùy biến từ đầu hoặc sao chép giọng có sự đồng ý. Hai mô hình này hỗ trợ hơn 100 ngôn ngữ, bao gồm tiếng Việt, và đạt vị trí dẫn đầu trên bảng xếp hạng của Hume AI.

Gemini 3.8 Text-to-Speech ra mắt: Tạo giọng nói tùy biến từ câu lệnh ngôn ngữ tự nhiên

Google vừa chính thức bổ sung hai mô hình chuyển văn bản thành giọng nói (text-to-speech - TTS) mới vào gia đình Gemini, đánh dấu bước chuyển từ các preset giọng nói tĩnh sang một studio sáng tạo động. Đây là bước tiến đáng chú ý trong lĩnh vực AI âm thanh, khi người dùng không chỉ chọn giọng có sẵn mà còn có thể tạo ra những giọng nói hoàn toàn mới theo yêu cầu.

Hai mô hình mới bao gồm Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS, được thiết kế cho các mục đích sử dụng khác nhau nhưng cùng hướng tới việc nâng cao khả năng biểu đạt trong âm thanh do AI tạo ra.

Hai mô hình, hai định hướng

Gemini 3.8 Flash TTS được xây dựng cho việc đạo diễn sáng tạo chuyên sâu và thiết kế nhân vật. Người dùng có thể tạo giọng nói hoàn toàn mới từ đầu bằng câu lệnh ngôn ngữ tự nhiên, phù hợp cho game, sách nói nhập vai, podcast và các phương tiện tương tác. Điểm mạnh của mô hình này là khả năng đạo diễn từng câu thoại với quyền kiểm soát chi tiết về diễn xuất, nhịp điệu, chuyển đổi phương ngữ và các âm thanh đệm trong hội thoại.

Gemini 3.8 Flash-Lite TTS lại hướng tới quy mô lớn với chi phí tối ưu. Mô hình này phù hợp cho lồng tiếng khối lượng lớn, sản xuất nội dung âm thanh và các tác nhân giọng nói (voice agent), với khả năng kiểm soát tinh tế về tông giọng, nhịp điệu và sắc thái biểu cảm.

Gemini Audio - mô hình chuyển văn bản thành giọng nói mới của GoogleGemini Audio - mô hình chuyển văn bản thành giọng nói mới của Google

Cả hai mô hình bổ sung cho gia đình Gemini Audio đang phát triển nhanh chóng, sau các mô hình 3.5 Live Translate, 3.5 Transcribe, 3.8 Live và 3.8 Live Extended Thinking.

Tạo và tùy biến giọng nói của riêng bạn

Điểm nổi bật nhất của bản cập nhật này là khả năng mở rộng từ 30 giọng gốc lên một thư viện gần như vô hạn. Với Gemini 3.8 Flash TTS, người dùng có thể tạo giọng nói riêng bằng cách tùy chỉnh vai trò, giọng điệu và đặc điểm âm thanh trên hơn 100 ngôn ngữ và phương ngữ thông qua câu lệnh ngôn ngữ tự nhiên.

Bạn có thể tạo ra một con rồng phun lửa đầy kịch tính, một người dẫn chuyện lôi cuốn với chất giọng vùng miền đặc trưng, hay một DJ năng lượng cao đến từ Melbourne. Ngoài ra, thư viện còn cung cấp hơn 2.000 giọng nói sẵn sàng sử dụng với độ phủ ngôn ngữ rộng, bao gồm cả các biến thể vùng miền như tiếng Tây Ban Nha Mexico, tiếng Pháp Quebec và tiếng Anh Scotland.

Sao chép giọng nói cũng là một tính năng quan trọng: người dùng có thể tái tạo hồ sơ giọng nói nhất quán chỉ từ một mẫu âm thanh dài 30 giây của chính mình hoặc giọng mà họ có quyền sử dụng. Quá trình này được bảo vệ bằng xác minh đồng ý, watermark SynthID và chứng chỉ C2PA.

Tính năng voice remixing sắp ra mắt sẽ cho phép chọn một giọng từ thư viện và tinh chỉnh âm sắc, cao độ, tốc độ cùng giọng điệu, chẳng hạn như "thêm chút giọng miền Nam nước Mỹ" hay "làm dịu cách thể hiện".

Đánh giá chất lượng của Gemini 3.8 Flash TTS trên các chỉ sốĐánh giá chất lượng của Gemini 3.8 Flash TTS trên các chỉ số

Đạo diễn từng câu thoại

Sau khi chọn được giọng nói, cả hai mô hình đều cho phép kiểm soát chính xác cách từng câu được thể hiện. Người dùng có thể viết chỉ dẫn sân khấu của riêng mình hoặc để Gemini dẫn dắt cách thể hiện bằng các tín hiệu kịch bản tự nhiên — từ một nhân viên chăm sóc khách hàng điềm tĩnh đến một cảnh hồi hộp thì thầm.

Với khả năng tạo nội dung dài, mô hình duy trì chất lượng giọng nói cao, nhịp điệu tự nhiên và âm sắc nhân vật xuyên suốt nhiều giờ âm thanh liên tục với mức trôi giọng tối thiểu — lý tưởng cho podcast và sách nói. Tính năng dàn dựng cảnh hai người nói cho phép đạo diễn các cuộc hội thoại nhiều lượt từ một kịch bản duy nhất, giữ hai giọng tách biệt rõ ràng với nhịp hội thoại tự nhiên.

Đặc biệt, mô hình còn hỗ trợ các âm thanh bộc phát và đệm hội thoại như tiếng cười, tiếng thở dài, cùng những câu đệm thể hiện sự lắng nghe, giúp tạo nhịp hài hước và phản ứng chính xác.

Hiệu suất ấn tượng trên bảng xếp hạng quốc tế

Gemini 3.8 Flash TTS đạt vị trí số 1 tổng thể trên Voice Design Benchmark của Hume AI với điểm số 71.4, đồng thời dẫn đầu về mô hình hóa giọng điệu với 60.8 điểm. Hai mô hình còn chiếm vị trí số 1 và số 2 trên Overall Quality Index của Hume AI.

Đáng chú ý với người dùng Việt Nam, trong các đánh giá ưu tiên của con người trên Voice Arena, Gemini 3.8 Flash và Flash-Lite TTS đều giành vị trí hàng đầu ở các ngôn ngữ chủ chốt toàn cầu, bao gồm tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi.

Với khả năng hỗ trợ hơn 100 ngôn ngữ, các mô hình này trao quyền cho nhà sáng tạo, nhà phát triển và doanh nghiệp xây dựng trải nghiệm giọng nói đa ngôn ngữ chất lượng cao trên toàn cầu.

Bảng đánh giá chất lượng tổng thể của các mô hình Gemini AudioBảng đánh giá chất lượng tổng thể của các mô hình Gemini Audio

An toàn, đồng thuận và minh bạch

Google cho biết đã xây dựng khả năng tạo và sao chép giọng nói với các biện pháp bảo vệ nghiêm ngặt. Với tính năng sao chép giọng, hệ thống yêu cầu xác minh đồng thuận: người dùng phải cung cấp bản ghi âm đồng ý bằng lời từ chủ sở hữu giọng nói khớp với người nói tham chiếu trước khi giọng có thể được tạo.

Ngoài ra, mọi đoạn âm thanh do các mô hình Gemini Audio tạo ra đều được gắn watermark SynthID — một dấu ẩn không thể nhận biết được dệt trực tiếp vào đầu ra âm thanh, giúp phát hiện giọng nói do AI tạo ra để ngăn chặn thông tin sai lệch.

Cách truy cập và thời điểm ra mắt

Từ hôm nay, nhà phát triển có thể trải nghiệm các khả năng tạo giọng nói mới trong Google AI Studio — được xây dựng như một không gian thiết kế giọng nói, nơi bạn có thể tạo nhận dạng giọng nói hoàn toàn mới từ đầu hoặc sao chép giọng của chính mình, sau đó đưa trực tiếp vào trình biên tập kịch bản hai người nói để đạo diễn từng câu.

Gemini 3.8 Flash TTS đang được triển khai từ hôm nay cho nhà phát triển qua Gemini API và Google AI Studio, sắp có cho doanh nghiệp qua API trong Gemini Enterprise, và cho mọi người trong Gemini Notebook.

Gemini 3.8 Flash-Lite TTS cũng đang được triển khai cho nhà phát triển qua Gemini API và Google AI Studio, sắp có cho doanh nghiệp, và cho mọi người trong Google Vids.

Bằng cách sử dụng Gemini API, các nền tảng phát triển như Agora, LiveKit, Pipecat và Vercel cho phép nhà phát triển xây dựng và triển khai trải nghiệm tạo giọng nói hiệu suất cao một cách dễ dàng. Google cũng đang hợp tác với các công ty như Figma, HeyGen, Linguana, Wondercraft, 99.co và Ollang để tích hợp các mô hình TTS mới nhất.

Với người dùng Việt Nam, việc tiếng Việt nằm trong nhóm ngôn ngữ được đánh giá cao nhất mở ra nhiều tiềm năng ứng dụng — từ lồng tiếng nội dung, sản xuất podcast đến xây dựng các tác nhân giọng nói cho doanh nghiệp trong nước.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗