Google ra mắt Gemini 3.8 Live và 3.8 Live Extended Thinking: Bước tiến lớn cho AI hội thoại bằng giọng nói
Google vừa giới thiệu hai mô hình AI hội thoại mới là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, tập trung vào khả năng suy luận gần thời gian thực và tương tác bằng giọng nói tự nhiên hơn. Gemini 3.8 Live Extended Thinking đạt vị trí số 1 trên bảng xếp hạng Speech to Speech Quality Index của Artificial Analysis, trong khi Gemini 3.8 Live nổi bật nhờ chi phí tối ưu và khả năng xử lý hình ảnh theo thời gian thực.

Google vừa chính thức ra mắt hai mô hình AI hội thoại mới mang tên Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, đánh dấu một bước tiến đáng kể trong việc biến giọng nói thành giao diện tương tác chính với trí tuệ nhân tạo. Đây được xem là nỗ lực mới nhất của Google nhằm biến AI từ một công cụ hỏi đáp đơn thuần thành một đối tác trò chuyện thực sự, có khả năng suy luận, quan sát và hành động ngay trong lúc đang nói chuyện với người dùng.
Gemini 3.8 Live ra mắt với khả năng hội thoại tự nhiên
Hai mô hình, hai mục đích khác nhau
Theo Google, hai mô hình này được thiết kế để phục vụ hai nhóm nhu cầu riêng biệt.
Gemini 3.8 Live được tối ưu cho quy mô lớn và hiệu quả chi phí, kết hợp trí tuệ hội thoại với khả năng đối thoại linh hoạt và nhận diện hình ảnh theo thời gian thực. Đây là mô hình phù hợp với các tác vụ thường ngày, nơi tốc độ phản hồi và chi phí vận hành là yếu tố then chốt.
Gemini 3.8 Live Extended Thinking hướng đến các tác vụ phức tạp, đòi hỏi suy luận nhiều bước và mức độ thông minh cao hơn. Điểm đặc biệt là mô hình này có thể vừa suy luận vừa nói, nghĩa là nó không bắt người dùng phải chờ đợi trong im lặng mà vẫn duy trì được dòng hội thoại liên tục.
Những con số ấn tượng trên các bảng xếp hạng
Google công bố một loạt kết quả đánh giá đáng chú ý cho Gemini 3.8 Live Extended Thinking:
- Đạt vị trí số 1 tổng thể trên Speech to Speech Quality Index của Artificial Analysis với điểm số 82,6
- Đạt 68,6% trên bảng xếp hạng τ-Voice về khả năng hoàn thành tác vụ dạng tác tử
- Đạt 35,1% trên τ-Voice-banking của Sierra
- Đạt 97,7% trên Big Bench Audio về năng lực suy luận
Kết quả đánh giá của Gemini 3.8 Live Extended Thinking trên các bảng xếp hạng
Trong khi đó, Gemini 3.8 Live giành vị trí thứ hai trên Speech Agent Arena và được đánh giá cao nhờ mức chi phí cạnh tranh, phù hợp để triển khai ở quy mô lớn. Trên bảng xếp hạng EVA-Bench của ServiceNow — vốn dùng để đánh giá các tác tử giọng nói — cả hai mô hình đều đẩy đường biên Pareto lên mức mới nhờ cân bằng tốt giữa độ chính xác và chất lượng hội thoại.
Khả năng xử lý hình ảnh và đa ngôn ngữ theo thời gian thực
Một trong những nâng cấp đáng chú ý nhất của Gemini 3.8 Live là khả năng xử lý đầu vào hình ảnh gần như tức thời. Mô hình có thể tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ ngay giữa cuộc trò chuyện, đồng thời thực thi các công cụ và lệnh gọi API ở chế độ nền trong lúc vẫn tiếp tục đối thoại.
Điều này có nghĩa là người dùng có thể yêu cầu AI tra cứu dữ liệu, đặt lịch hay thực hiện một tác vụ nào đó, rồi tiếp tục trò chuyện bình thường trong khi hệ thống xử lý xong ở phía sau. Mô hình cũng biết đưa ra những tín hiệu bằng lời như "Để tôi kiểm tra nhé..." để xác nhận yêu cầu một cách tự nhiên, thay vì im lặng chờ xử lý.
Gemini 3.8 Live xử lý tác vụ tác tử trong nền
Google minh họa khả năng này bằng nhiều tình huống thực tế: mô hình hướng dẫn nhân viên mới trong quá trình nhập môn bằng cách dùng ngữ cảnh hình ảnh để trả lời các câu hỏi trực tiếp, chơi cờ vua gần như theo thời gian thực nhờ kết hợp quan sát hình ảnh, suy luận và hội thoại tự nhiên, hay thậm chí biến những bản phác thảo thô kèm phản hồi bằng giọng nói thành các component React hoàn chỉnh.
Tích hợp sâu vào hệ sinh thái Google
Cả hai mô hình đều được triển khai đồng thời trên nhiều nền tảng của Google:
- Gemini 3.8 Live: có mặt trong Gemini API và Google AI Studio dành cho nhà phát triển, bản xem trước riêng tư trên Gemini Enterprise, và Search Live cho mọi người dùng
- Gemini 3.8 Live Extended Thinking: có trong Gemini API và Google AI Studio, bản xem trước riêng tư trên Gemini Enterprise, cùng các tính năng Docs Live, Gmail Live và Keep Live dành cho người đăng ký Google AI Pro và Ultra
Đáng chú ý, trên Google Workspace và Search, các mô hình Live này được kỳ vọng mang lại trải nghiệm cộng tác trực quan hơn, đặc biệt khi xử lý những tác vụ phức tạp. Người dùng Search Live có thể nhận được hỗ trợ xử lý sự cố theo từng bước ngay trong lúc tìm kiếm.
Đối với nhà phát triển và doanh nghiệp, đây là những viên gạch nền tảng để xây dựng các tác tử giọng nói đáng tin cậy, sẵn sàng cho môi trường sản xuất.
Hệ sinh thái nhà phát triển và đối tác
Google cho biết nhiều nền tảng phát triển như Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents đã tích hợp Gemini Live API để giúp lập trình viên xây dựng giao diện điều khiển bằng giọng nói hiệu năng cao. Các nền tảng này đảm nhận phần hạ tầng truyền phát media thời gian thực phức tạp, để nhà phát triển tập trung hoàn toàn vào trải nghiệm người dùng.
Ngoài ra, các công ty như Salesforce, Genspark và Lumeris cũng bày tỏ sự quan tâm đến hai mô hình mới, đánh giá cao độ trễ thấp, tính linh hoạt và khả năng gọi công cụ của chúng.
Bảo mật và minh bạch với SynthID
Một điểm đáng lưu ý về mặt an toàn thông tin: toàn bộ âm thanh do các sản phẩm AI của Google tạo ra đều được gắn watermark SynthID. Đây là dạng watermark không thể nhận biết bằng tai người, được dệt trực tiếp vào đầu ra âm thanh, giúp nội dung do AI tạo ra vẫn có thể bị phát hiện nhằm hạn chế thông tin sai lệch.
Ý nghĩa với người dùng Việt Nam
Với việc hỗ trợ tới 97 ngôn ngữ và khả năng chuyển đổi linh hoạt ngay giữa cuộc trò chuyện, hai mô hình này hứa hẹn sẽ sớm tiếp cận người dùng Việt Nam thông qua ứng dụng Gemini và các dịch vụ Google Workspace. Đối với cộng đồng lập trình viên trong nước, việc Gemini Live API được tích hợp rộng rãi trên các nền tảng như LangChain hay LiveKit mở ra cơ hội xây dựng các sản phẩm tác tử giọng nói tiếng Việt mà không cần tự xây dựng hạ tầng truyền phát phức tạp.
Cuộc đua AI hội thoại bằng giọng nói đang ngày càng nóng, và với Gemini 3.8 Live cùng 3.8 Live Extended Thinking, Google rõ ràng đang muốn khẳng định vị thế dẫn đầu ở phân khúc đòi hỏi sự kết hợp giữa tốc độ, trí tuệ và khả năng hành động trong thời gian thực.


