ElevenLabs ra mắt mô hình giọng nói v4: nhân bản giọng chỉ với 10 giây, hỗ trợ 90 ngôn ngữ
ElevenLabs vừa giới thiệu hai mô hình giọng nói mới là v4 và v4 Turbo, cho phép nhân bản giọng chỉ với 10 giây âm thanh, hỗ trợ hơn 90 ngôn ngữ và tăng cường khả năng kiểm soát biểu cảm. Đây là bước tiến quan trọng trong cuộc đua mô hình giọng nói, khi công ty đang hướng tới IPO và doanh thu đã vượt 600 triệu USD.

ElevenLabs vừa công bố hai mô hình giọng nói mới mang tên ElevenLabs v4 và v4 Turbo, đánh dấu bước tiến mới của startup này trong lĩnh vực chuyển đổi văn bản thành giọng nói và nhân bản giọng nói bằng trí tuệ nhân tạo.
Nhân bản giọng chỉ trong 10 giây
Điểm nhấn đáng chú ý nhất của v4 là khả năng nhân bản giọng nói chỉ với một đoạn âm thanh dài 10 giây. Công ty cho biết họ đã áp dụng một kiến trúc mới cho thế hệ mô hình này, giúp việc kiểm soát trở nên chính xác hơn và quá trình nhân bản diễn ra nhanh hơn đáng kể so với trước.
Khả năng này mở ra nhiều ứng dụng thực tế, từ sản xuất nội dung, lồng tiếng cho video cho đến xây dựng trợ lý ảo có giọng nói tự nhiên. Đối với các nhà sáng tạo nội dung tại Việt Nam, việc nhân bản giọng với dữ liệu đầu vào nhỏ như vậy có thể giúp tiết kiệm đáng kể thời gian và chi phí thu âm.
Kiểm soát biểu cảm linh hoạt hơn
Về khả năng sáng tạo, mô hình v4 xử lý đặc trưng giọng nói (voice identity) tốt hơn khi đọc những đoạn văn bản dài, đồng thời giữ được ngữ cảnh của nội dung để điều chỉnh biểu cảm cho phù hợp.
ElevenLabs đã giới thiệu các thẻ biểu cảm nội tuyến (inline tags) từ phiên bản v3 và tiếp tục mở rộng tính năng này trong v4. Người dùng giờ đây có thể xếp chồng nhiều thẻ và mô hình sẽ tuân theo đúng trình tự đó khi đọc, giúp kiểm soát cảm xúc trong giọng nói một cách chi tiết hơn.
Hỗ trợ hơn 90 ngôn ngữ
Phiên bản trước chỉ hỗ trợ 70 ngôn ngữ, còn v4 đã nâng con số này lên hơn 90 ngôn ngữ. Theo công ty, mức cải thiện chất lượng rõ rệt nhất được ghi nhận ở tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Quan Thoại và tiếng Quảng Đông.
Đáng tiếc là tiếng Việt chưa được nhắc đến trong danh sách này, nhưng với tốc độ mở rộng ngôn ngữ của ElevenLabs, khả năng hỗ trợ tiếng Việt chất lượng cao nhiều khả năng sẽ sớm được cải thiện trong các phiên bản tiếp theo.
Tối ưu cho trợ lý giọng nói
ElevenLabs đã mở rộng mạnh mẽ mảng kinh doanh tổng đài doanh nghiệp trong năm qua, với hơn 55% doanh thu đến từ các công ty lớn. Mô hình mới được thiết kế đặc biệt phù hợp cho các tác nhân giọng nói (voice agents) nhờ độ trễ thấp hơn, cho phép hội thoại diễn ra tự nhiên và liền mạch hơn.
Một điểm kỹ thuật đáng chú ý: v4 có thể bắt đầu tạo âm thanh ngay khi mô hình ngôn ngữ lớn (LLM) phía sau bắt đầu sinh câu trả lời, thay vì phải chờ toàn bộ văn bản hoàn tất. Bên cạnh đó, mô hình còn xử lý linh hoạt các tình huống đối đầu, leo thang căng thẳng và tạm giữ cuộc gọi, giúp giải quyết vấn đề hiệu quả hơn trong bối cảnh chăm sóc khách hàng.
Cuộc đua mô hình giọng nói đang ngày càng nóng khi hàng loạt startup như Cartesia, Deepgram, Fish Audio, Boson và WellSaid Labs đều tung ra các mô hình biểu cảm. Các ông lớn như Google và OpenAI cũng không đứng ngoài cuộc.
Tham vọng tài chính và IPO
ElevenLabs đã huy động được 500 triệu USD hồi đầu năm nay trong vòng gọi vốn do Sequoia dẫn dắt, đưa định giá công ty lên 11 tỷ USD. Hiện đã có tin đồn về một vòng gọi vốn tiếp theo với định giá lên tới 22 tỷ USD.
Doanh thu hàng năm của công ty đã tăng từ khoảng 330 triệu USD đầu năm lên hơn 600 triệu USD. ElevenLabs cũng đang tích cực tuyển dụng nhân sự tại nhiều thị trường như Ấn Độ, châu Âu và Brazil, với tổng số nhân viên vượt 800 người.
Trong một cuộc phỏng vấn gần đây, nhà đồng sáng lập kiêm CEO Mati Staniszewski cho biết công ty đặt mục tiêu IPO trong vài năm tới, nhưng chưa cam kết mốc thời gian cụ thể.

