Meta ra mắt Muse Voice Transcribe: Nhận dạng giọng nói thời gian thực 20+ người nói, giá chỉ 0,18 USD/giờ
Meta chính thức gia nhập thị trường chuyển giọng nói thành văn bản thời gian thực với Muse Voice Transcribe, mô hình kết hợp phiên âm trực tuyến, phát hiện ranh giới câu và nhận diện người nói cho hơn 20 người, với mức giá công khai chỉ 0,18 USD mỗi giờ. Sản phẩm này tạo ra một lựa chọn mới hấp dẫn cho doanh nghiệp nhưng vẫn chưa phải là kỷ lục toàn cầu khi Speechmatics hỗ trợ tối đa 100 người nói.

Meta ra mắt Muse Voice Transcribe: Nhận dạng giọng nói thời gian thực cho 20+ người nói, giá cực rẻ cho doanh nghiệp?
Meta vừa chính thức đặt chân vào thị trường chuyển giọng nói thành văn bản thời gian thực vốn đang ngày càng cạnh tranh khốc liệt. Sản phẩm mới mang tên Muse Voice Transcribe — một mô hình nhận thức âm thanh do Meta Superintelligence Labs phát triển, kết hợp phiên âm trực tuyến (streaming), phát hiện ranh giới câu và nhận diện người nói (speaker diarization) cho hơn 20 người — tất cả chỉ với mức giá API công khai 0,18 USD mỗi giờ xử lý âm thanh.
Đây được xem là một động thái táo bạo khi Meta muốn cạnh tranh trực tiếp với các dịch vụ như Speechmatics, Amazon Transcribe hay AssemblyAI, đồng thời mở ra hướng đi mới cho các nhà phát triển doanh nghiệp đang xây dựng hệ thống họp trực tuyến, phân tích cuộc gọi và trợ lý AI thời gian thực.
Muse xử lý như thế nào trong thời gian thực?
Thông thường, các hệ thống nhận dạng giọng nói truyền thống chỉ trả lời một câu hỏi đơn giản: Nội dung được nói là gì? Trong khi đó, Muse bổ sung thêm một câu hỏi quan trọng không kém: Ai đã nói điều đó? — một khía cạnh mà các hệ thống phiên âm thông thường thường bỏ qua.
Điểm khác biệt này trở nên sống còn khi bản phiên âm được đưa vào các hệ thống AI phía sau. Ví dụ, một trợ lý họp có thể phiên âm chính xác từng câu nhưng vẫn tạo ra hồ sơ doanh nghiệp không đáng tin cậy nếu gán nhầm một lời phê duyệt, cam kết hoặc phản đối cho sai người tham dự. Vấn đề tương tự cũng ảnh hưởng đến hệ thống phân tích chăm sóc khách hàng, quy trình tuân thủ và các AI agent hoạt động trong phòng có nhiều người nói.
Muse giải quyết bài toán này bằng cách tích hợp trực tiếp việc gán người nói vào kiến trúc đa phương thức tự hồi quy (autoregressive). Theo Meta, âm thanh được chia thành các khối 80 mili giây (tương đương 12,5 khối mỗi giây), mỗi khối được biến đổi thành một token mềm. Tại mỗi bước, mô hình sẽ quyết định xem nên tiêu thụ thêm âm thanh hay phát ra văn bản.
Cơ chế này được gọi là "adaptive delay" (độ trễ thích ứng): Muse có thể chờ lâu hơn khi giọng nói không rõ ràng, nhưng sẽ phát ra kết quả sớm hơn khi đã có đủ ngữ cảnh. Meta cho biết học tăng cường (reinforcement learning) kết hợp phần thưởng về tỷ lệ lỗi từ và độ trễ để huấn luyện hành vi này.
Việc gán người nói và phát hiện ranh giới câu trở thành một phần của chuỗi token: token <|start_of_turn|> đánh dấu một lượt nói mới, các token như <|speaker_A|> xác định người nói, cùng với token bắt đầu và kết thúc để xác định ranh giới lời nói. Mô hình được huấn luyện để xử lý đồng thời ASR, diarization và endpointing thay vì vận hành như một quy trình riêng biệt phía sau.
Đáng chú ý, API của Muse cũng cung cấp chế độ diarization như một tùy chọn hoạt động hạng nhất bên cạnh chế độ push-to-talk và endpointing. Nhãn người nói như A, B chỉ có hiệu lực trong một phiên, không phải danh tính xác thực, và API trả về mốc thời gian theo lượt thay vì ở cấp độ từng từ.
20+ người nói là con số ấn tượng, nhưng chưa phải kỷ lục
Dù con số 20+ người nói là rất đáng chú ý, nhưng việc so sánh đòi hỏi sự cẩn trọng vì các nhà cung cấp triển khai diarization theo những cách khác nhau. Hiện tại, Speechmatics đang có tuyên bố rõ ràng nhất về công suất thời gian thực: hệ thống của họ hỗ trợ 50 người nói mặc định và có thể tăng cấu hình lên đến 100 người.
Amazon Transcribe cũng vượt qua con số của Meta khi tài liệu của họ nêu rõ có thể phân biệt tối đa 30 người nói duy nhất, bao gồm cả trong phiên âm trực tuyến (streaming).
Trong khi đó, Soniox chỉ hỗ trợ tối đa 15 người nói mỗi phiên, còn AssemblyAI giới hạn ở mức 10 người nói. Cả hai đều có chung cảnh báo rằng việc gán người nói trực tiếp khó khăn hơn nhiều vì các hệ thống streaming phải đưa ra quyết định với ít ngữ cảnh âm thanh phía trước hơn so với các mô hình xử lý ngoại tuyến.
Điều đó có nghĩa, nếu gọi Muse là kỷ lục toàn cầu mới về số người nói sẽ là không chính xác. Con số cao nhất được ghi nhận một cách tường minh hiện nay vẫn thuộc về Speechmatics với mức tối đa có thể cấu hình lên tới 100 người.
Ngoài ra, trong tài liệu ra mắt, Meta cũng không trình diễn trực tiếp 20 người nói cùng lúc: bản demo chính chỉ sử dụng 8 người nói, trong khi bản ghi âm dài có 11 người tham gia được gán nhãn. Con số 20+ chỉ là tuyên bố về năng lực mô hình chứ chưa được minh chứng cụ thể trong các bản demo công khai.
Mức giá 0,18 USD/giờ: Rẻ hơn nhiều đối thủ có tên tuổi
Theo trang dành cho nhà phát triển của Muse, giá của dịch vụ là 3 USD cho mỗi 1.000 phút, tương đương 0,18 USD/giờ — bằng cho cả phiên âm trực tuyến lẫn phiên âm không trực tuyến. Đáng chú ý, Meta áp dụng mức giá tương tự cho chế độ xử lý không lưu trữ dữ liệu (zero-data-retention). Việc thanh toán dựa trên số âm thanh thực tế được xử lý và làm tròn xuống đến từng giây.
Bảng so sánh dưới đây tổng hợp mức giá công khai của các dịch vụ nổi bật (quy về 1 giờ âm thanh trực tuyến):
- Soniox stt-rt-v5: 0,12 USD — bao gồm diarization tối đa 15 người nói
- Meta Muse Voice Transcribe: 0,18 USD — bao gồm diarization 20+ người nói
- xAI Speech to Text: 0,20 USD — có hỗ trợ diarization, không công bố mức tối đa
- Speechmatics Real-time Standard: 0,24 USD — bao gồm diarization 50 người mặc định, cấu hình lên tới 100
- Qwen3 ASR Flash Realtime: ~0,324 USD (mức quốc tế)
- Deepgram Nova-3 Multilingual: ~0,35 USD cơ bản / ~0,47 USD nếu thêm diarization
- ElevenLabs Scribe v2 Realtime: 0,39 USD trả theo mức sử dụng (PAYG) — không hỗ trợ diarization thời gian thực
- AssemblyAI Universal-3.5 Pro Realtime: 0,45 USD cơ bản / 0,57 USD với diarization
- Amazon Transcribe Streaming: ~0,60 USD (theo ví dụ tại khu vực N. Virginia) — bao gồm diarization tối đa 30 người nói
- OpenAI GPT Live Transcribe: 1,02 USD — diarization không được liệt kê
Rõ ràng, Deepgram và AssemblyAI đều tính phí riêng cho diarization (khoảng 0,12 USD/giờ), khiến chi phí thực tế khi sử dụng tăng lên đáng kể. Nếu tính 1.000 giờ âm thanh, chi phí sử dụng Muse sẽ vào khoảng 180 USD — một con số rất cạnh tranh so với mặt bằng thị trường.
Tuy nhiên, Muse không phải là dịch vụ rẻ nhất tuyệt đối — Soniox hiện vẫn có mức giá thấp hơn. Điểm khác biệt nằm ở chỗ Meta đưa diarization vào gói giá cơ bản, trong khi nhiều đối thủ tính phí riêng cho tính năng này.
Hiệu suất chính xác: Muse dẫn đầu theo chuẩn benchmark
Nếu chỉ có giá rẻ thì chưa đủ thuyết phục. Meta bổ sung dữ liệu điểm chuẩn cho thấy Muse không hy sinh độ chính xác vì giá thành.
Trên AA-WER Streaming Index do Artificial Analysis cung cấp, Muse đạt tỷ lệ lỗi từ (WER) chỉ 3,1% — đứng đầu danh sách, vượt qua Cartesia Ink-2 (3,4%), ElevenLabs Scribe v2 Realtime (3,6%), Qwen3 ASR Flash Realtime (3,7%), GPT Live Transcribe và Grok Speech to Text Streaming (3,9%) cùng Gemini 3.5 Transcribe Live và AssemblyAI U3.5 Realtime Pro (4,0%). Meta nhấn mạnh rằng Muse đã giữ vị trí số một trong đánh giá này kể từ ngày 1/9.
Quan trọng hơn, kết quả diarization của Muse có thể là điểm thuyết phục nhất: Meta công bố tỷ lệ lỗi diarization trung bình 17,5% trên các bộ dữ liệu AMI-IHM, AMI-SDM và VoxConverse — thấp hơn các đối thủ được hiển thị trong biểu đồ.
Tuy nhiên, cần phân biệt rõ giữa hai khái niệm khác nhau: sức chứa người nói và tỷ lệ lỗi diarization. Một nền tảng hỗ trợ 100 người chưa chắc gán đúng người nói giỏi hơn hệ thống hỗ trợ 20 người. Điểm chuẩn của Meta cũng không kiểm tra mọi đối thủ ở mức công suất tối đa họ quảng cáo.
Một số điểm hạn chế cần cân nhắc
Không có sản phẩm nào là hoàn hảo, và Muse cũng vậy. Hiện tại, một số hạn chế mà các nhà phát triển cần biết:
- API chỉ cung cấp mốc thời gian theo lượt, không có mốc thời gian ở cấp độ từng từ
- Không hỗ trợ điểm tin cậy ở cấp độ từ (word-level confidence score), phát hiện sự kiện âm thanh hay nhận diện cảm xúc
- Giới hạn 8 luồng đồng thời cho mỗi tenant ở cấu hình mặc định
- Các phiên thời gian thực giới hạn tối đa 60 phút, sau đó ứng dụng phải kết nối lại
Dù vậy, sự ra mắt của Muse tạo ra một đề xuất giá trị đáng chú ý. Con số 20+ người nói không phá sâu kỷ lục toàn cầu, nhưng có lẽ kỷ lục không phải là thước đo quan trọng nhất. Câu hỏi lớn hơn dành cho các nhà phát triển doanh nghiệp là liệu một dịch vụ có thể giữ được sự gán đúng người nói, văn bản chính xác và các ranh giới lượt hữu dụng trong khi một cuộc trò chuyện phức tạp ngoài đời thực vẫn đang diễn ra.
Với mức giá 0,18 USD/giờ cùng diarization cho 20+ người nói trong một mô hình thời gian thực hiện đang dẫn đầu các chuẩn so sánh về độ chính xác, Muse Voice Transcribe mang đến cho doanh nghiệp một lựa chọn nghiêm túc mới cho hệ thống thông minh cuộc họp, phiên âm trực tiếp và hạ tầng AI giọng nói — đồng thời gây áp lực buộc các đối thủ phải cạnh tranh về độ chính xác theo người nói và tổng chi phí vận hành, thay vì chỉ là khả năng nhận dạng giọng nói cơ bản.