Grok Voice Transcribe 2.0 ra mắt: Chuyển giọng nói thành văn bản chính xác gấp đôi, giá không đổi

Công nghệ18 tháng 9, 2026·5 phút đọc

xAI vừa phát hành Grok Voice Transcribe 2.0, mô hình chuyển giọng nói thành văn bản (speech-to-text) mới với độ chính xác được cho là gấp đôi phiên bản 1.0 nhưng giữ nguyên mức giá. Mô hình đứng đầu bảng xếp hạng Artificial Analysis về độ chính xác trong 32 mô hình streaming, hỗ trợ hàng chục ngôn ngữ và xử lý tốt cả những đoạn ghi âm nhiễu, nhiều người nói.

Grok Voice Transcribe 2.0 ra mắt: Chuyển giọng nói thành văn bản chính xác gấp đôi, giá không đổi

xAI vừa chính thức công bố Grok Voice Transcribe 2.0, phiên bản mới nhất trong dòng mô hình chuyển giọng nói thành văn bản của hãng. Điểm đáng chú ý nhất: độ chính xác được nâng lên gấp đôi so với phiên bản 1.0, nhưng mức giá vẫn giữ nguyên. Đây là bước tiến đáng kể trong cuộc đua mô hình âm thanh, nơi độ chính xác và chi phí luôn là hai yếu tố quyết định.

Xây dựng trên nền tảng của Grok Voice

Grok Voice Transcribe 2.0 được phát triển dựa trên mô hình nền tảng âm thanh (audio foundation model) đứng sau Grok Voice — hệ thống hiện đang vận hành ở quy mô lớn. Theo xAI, Grok Voice mỗi ngày xử lý hàng chục nghìn cuộc gọi chăm sóc khách hàng, chuyển thành văn bản hàng triệu giờ video thuyết minh, và chạy các tác nhân giọng nói (voice agent) trong nhiều sản phẩm thực tế, bao gồm cả trợ lý Grok tích hợp trên xe Tesla.

Mô hình mới được huấn luyện trên một bộ dữ liệu đặc biệt gồm âm thanh trực tiếp, nhiễu và đa ngôn ngữ, được ghi lại trong nhiều môi trường khác nhau, sau đó tinh chỉnh thêm qua quá trình hậu huấn luyện (post-training). Kết quả là một trong những mô hình chuyển văn bản chính xác nhất cho lời nói trong điều kiện thực tế.

Vì sao âm thanh thực tế khó xử lý hơn?

Hầu hết các mô hình chuyển văn bản hiện nay đều làm tốt với âm thanh sạch, chỉ có một người nói. Nhưng âm thanh ngoài đời thực phức tạp hơn nhiều: đường dây điện thoại chập chờn, nhiều giọng nói chồng lên nhau, giọng địa phương, và cả những thông tin như số điện thoại hay địa chỉ email được đọc to.

Grok Voice Transcribe 2.0 được xây dựng để xử lý chính những đoạn âm thanh khó nhất, trong mọi điều kiện và môi trường.

Trên bảng xếp hạng công khai Artificial Analysis, Grok Voice Transcribe 2.0 xếp hạng nhất về độ chính xác trong số 32 mô hình streaming.

Kết quả đo lường thực tế

Bên cạnh các bài kiểm tra công khai, xAI còn đo tỷ lệ lỗi từ (word error rate) trên bốn bộ dữ liệu nội bộ lấy từ lưu lượng sản xuất thực tế:

  • Âm thanh điện thoại từ các cuộc gọi chăm sóc khách hàng
  • Hội thoại với Grok
  • Thông tin đọc bằng lời như mã tài khoản, địa chỉ email
  • Câu lệnh giọng nói ngắn bằng nhiều ngôn ngữ

Grok Voice Transcribe 2.0 cải thiện so với phiên bản 1.0 trên cả bốn bộ dữ liệu, và ở nhóm âm thanh điện thoại, mô hình dẫn đầu mọi mô hình mà xAI đã thử nghiệm.

Đa ngôn ngữ: Cải tiến lớn nhất

Grok Voice Transcribe 2.0 có thể chuyển văn bản cho hàng chục ngôn ngữ, tự động nhận diện ngôn ngữ và xử lý cả những đoạn chuyển ngữ giữa chừng trong cùng một lần chạy. Đây là cải tiến lớn nhất so với phiên bản 1.0.

Với những câu ngắn như khẩu lệnh trong xe hơi, mô hình có rất ít ngữ cảnh để xác định ngôn ngữ. Trên bộ dữ liệu câu ngắn, tỷ lệ lỗi từ đã giảm từ 20,6% xuống còn 6,8% — một mức cải thiện rất đáng kể.

Tương thích ngược và giá cả

Grok Voice Transcribe 2.0 hỗ trợ cấu hình và điều khiển nâng cao. Các tích hợp Speech-to-Text API hiện có sẽ tự động nhận được cải thiện về độ chính xác mà không cần thay đổi mã nguồn.

Về giá, mô hình mới giữ nguyên như phiên bản 1.0:

  • Chuyển văn bản theo lô (batch): 0,10 USD mỗi giờ âm thanh
  • Streaming: 0,20 USD mỗi giờ âm thanh
  • Đã bao gồm phân tách người nói (diarization), mốc thời gian (timestamps) và thuật ngữ chuyên biệt (key terms)

Ứng dụng thực tế: Atlassian Loom

Atlassian Loom, công cụ phổ biến để ghi và chia sẻ video màn hình, nhận thấy Grok Voice Transcribe 2.0 chính xác hơn giải pháp cũ và hiện dùng nó để chuyển văn bản cho mọi video. Bản ghi chính xác mở ra các quy trình AI mới: ghi lại kế hoạch hành động trong Loom, đưa bản ghi vào Cursor, và công cụ này sẽ trực tiếp cập nhật mã nguồn.

Lộ trình và lưu ý cho nhà phát triển

Grok Voice Transcribe 2.0 sẽ sớm trở thành mặc định trong Speech-to-Text API, và phiên bản 1.0 sẽ bị ngừng hỗ trợ (deprecated) trong vài tuần tới. Nếu muốn tiếp tục dùng phiên bản cũ trong giai đoạn chuyển đổi, nhà phát triển cần ghim (pin) mô hình grok-voice-transcribe-1.0.

Với các đội phát triển sản phẩm tại Việt Nam đang xây dựng ứng dụng liên quan đến giọng nói — từ tổng đài chăm sóc khách hàng, ghi chú cuộc họp, đến trợ lý ảo — việc một mô hình mạnh hơn xuất hiện mà không tăng chi phí là tín hiệu đáng cân nhắc. Bài toán lớn nhất vẫn là xử lý tiếng Việt và các giọng địa phương, vốn là thách thức chung của mọi mô hình speech-to-text trên thị trường hiện nay.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗