Microsoft AI tung MAI-Transcribe-2: Nhận dạng giọng nói nhanh, rẻ, chính xác hơn OpenAI, Google và ElevenLabs
Microsoft AI vừa phát hành MAI-Transcribe-2, mô hình nhận dạng giọng nói được tuyên bố là nhanh hơn, chính xác hơn và rẻ hơn so với các đối thủ như OpenAI, Google và ElevenLabs. Với mức giá chỉ 10 cent cho mỗi giờ âm thanh, sản phẩm này là bước đi chiến lược của Microsoft nhằm thay thế dần công nghệ của OpenAI bằng các mô hình tự phát triển, đồng thời mở ra cuộc cạnh tranh mới trên thị trường chuyển giọng nói thành văn bản.

Microsoft AI tung MAI-Transcribe-2: Nhận dạng giọng nói nhanh, rẻ, chính xác hơn OpenAI, Google và ElevenLabs
Ngay sau khi ra mắt phiên bản đầu tiên chỉ 5 tháng trước, Microsoft AI tiếp tục gây sốc khi công bố MAI-Transcribe-2 — mô hình nhận dạng giọng nói mới nhất với tốc độ nhanh hơn 10 lần so với GPT-Transcribe của OpenAI nhưng giá chỉ 10 cent cho mỗi giờ âm thanh. Đây không chỉ là một bản nâng cấp thông thường mà là tuyên chiến trực tiếp với các "ông lớn" trong lĩnh vực AI, đồng thời phơi bày chiến lược đầy tham vọng của Microsoft trong việc tự chủ công nghệ lõi thay vì phụ thuộc vào đối tác OpenAI. Động thái này hứa hẹn sẽ định hình lại cuộc chơi cho thị trường chuyển giọng nói thành văn bản toàn cầu.
MAI-Transcribe-2 mạnh hơn ở những điểm nào?
Điểm nhấn đầu tiên của MAI-Transcribe-2 nằm ở khả năng hỗ trợ 60 ngôn ngữ, tăng đáng kể so với con số 43 ngôn ngữ ở phiên bản MAI-Transcribe-1.5 phát hành hồi tháng 6 và 25 ngôn ngữ ở bản gốc tháng 4. Không chỉ dừng lại ở số lượng, chất lượng xử lý âm thanh "bẩn" từ môi trường thực tế như tiếng ồn nền, bản ghi chất lượng thấp hay nhiều người nói cùng lúc cũng được cải thiện rõ rệt.
Khác biệt lớn nhất mà Microsoft mang tới là việc tích hợp sẵn một loạt tính năng mà trước đây các nhà cung cấp chuyên biệt thường tính phí cao, bao gồm:
- Tách người nói (Speaker diarization): Phân biệt được ai đang nói gì trong bản ghi nhiều người, biến một đoạn hội thoại lộn xộn thành biên bản cuộc họp rõ ràng, dễ sử dụng.
- Dấu thời gian cấp từ (Word-level timestamps): Gắn chính xác mốc thời gian cho từng từ, rất hữu ích cho việc tìm kiếm, chỉnh sửa và ghép nối với video.
- Tùy chỉnh từ khóa (Keyword biasing): Lập trình viên có thể đưa vào danh sách các thuật ngữ chuyên ngành, tên thuốc, mã sản phẩm hay tên nhân viên để mô hình không còn "làm hỏng" những từ vựng đặc thù.
- Tự động nhận dạng ngôn ngữ: Người dùng không cần phải khai báo ngôn ngữ trước khi sử dụng.
Ngoài ra, hai tính năng nổi bật khác nhắm đến các nhu cầu rất cụ thể của doanh nghiệp. Chế độ "verbatim" chuyển ngữ giữ nguyên mọi từ đệm như "ừm", các lần nói lắp, khởi đầu sai — phù hợp với bộ phận tuân thủ và pháp lý. Trong khi đó, chế độ "clean" tự động loại bỏ các yếu tố thừa, tạo ra bản ghi chú và phụ đề dễ đọc.
Đặc biệt, tính năng code switching — chuyển đổi ngôn ngữ giữa chừng câu — được Microsoft nhấn mạnh với các ví dụ điển hình như Hinglish (tiếng Hindi + Anh) và Spanglish (tiếng Tây Ban Nha + Anh). Đây là tín hiệu cho thấy sản phẩm được thiết kế cho các thị trường dịch vụ khách hàng nơi người dùng có thể chuyển ngôn ngữ nhiều lần trong một cuộc gọi.
Phân tích các con số điểm chuẩn: Chiến thắng thật hay chỉ là lời quảng cáo?
Microsoft đưa ra ba tuyên bố về hiệu suất, mỗi tuyên bố dựa trên một bộ tiêu chuẩn khác nhau. Người mua kỹ thuật nên hiểu rõ ý nghĩa cũng như giới hạn của từng phép đo này.
Thứ nhất, mô hình đứng đầu bảng xếp hạng FLEURS với tỷ lệ lỗi từ (WER) trung bình 5,2% trên 60 ngôn ngữ. FLEURS là bộ dữ liệu điểm chuẩn do các nhà nghiên cứu Google công bố năm 2022, dựa trên việc người bản ngữ đọc khoảng 2.000 câu trong 102 ngôn ngữ. Đây là thước đo tiêu chuẩn cho khả năng đa ngôn ngữ vì cho phép so sánh trực tiếp chất lượng giữa các ngôn ngữ khác nhau trên cùng nội dung. Tuy nhiên, điểm yếu của FLEURS là văn bản được đọc, không phải hội thoại tự nhiên. Đáng chú ý, WER trung bình của mô hình thực tế đã tăng so với mức 3,7% của phiên bản 1.5 hồi tháng 6, phản ánh phạm vi phủ sóng rộng hơn với nhiều ngôn ngữ ít tài nguyên — nơi mọi mô hình đều gặp khó khăn hơn.
Thứ hai, trên bảng xếp hạng WER của Artificial Analysis — một tổ chức đánh giá độc lập chuyên kiểm tra các mô hình qua API công khai — MAI-Transcribe-2 đứng thứ hai, vượt qua ElevenLabs. Đáng chú ý hơn, nó được xem là định nghĩa ranh giới tối ưu (Pareto frontier) về độ chính xác và độ trễ, nghĩa là không đối thủ nào đạt độ chính xác cao hơn mà không chậm hơn, và ngược lại.
Thứ ba, về tốc độ thô — con số gây ấn tượng nhất. Theo đánh giá từ Artificial Analysis, MAI-Transcribe-2 nhanh gấp 10 lần GPT-Transcribe của OpenAI, 7 lần Scribe v2 của ElevenLabs và 5 lần Gemini 3.5 Transcribe của Google. Tốc độ này giúp giảm đáng kể chi phí vận hành, là yếu tố cho phép Microsoft đưa ra mức giá siêu rẻ 10 cent mỗi giờ.
Ba phiên bản trong năm tháng: Chiến lược phát hành thần tốc
Tốc độ phát triển sản phẩm có lẽ là câu chuyện đáng chú ý nhất. Chỉ trong 5 tháng, Microsoft AI đã có ba phiên bản MAI-Transcribe:
- MAI-Transcribe-1 (tháng 4): 25 ngôn ngữ, giá $0.36/giờ.
- MAI-Transcribe-1.5 (tháng 6): 43 ngôn ngữ, thêm keyword biasing, xếp thứ ba trên Artificial Analysis.
- MAI-Transcribe-2 (hiện tại): 60 ngôn ngữ, tích hợp diarization, timestamps, code switching, xếp thứ hai, giá $0.10/giờ.
Mỗi lần ra mắt đều mở rộng ngôn ngữ khoảng 40% và bổ sung các tính năng mà đối thủ phải trả thêm phí cao. Nhịp độ này cho thấy một nhóm nghiên cứu đã ổn định kiến trúc và đang tối ưu về dữ liệu — giai đoạn mà các mô hình giọng nói thường cải thiện nhanh và đáng tin cậy.
Đứng sau tốc độ này là triết lý tổ chức được Mustafa Suleyman, CEO Microsoft AI, chia sẻ với The Verge hồi tháng 4. Ông cho rằng sự thành công của phiên bản đầu tiên đến từ "một đội ngũ nhỏ gọn 10 người" được "giải phóng khỏi mọi rào cản hành chính", cùng với một nhóm lớn hơn phụ trách quản lý nhà cung cấp và thu thập dữ liệu. Suleyman cũng tiết lộ mô hình này chạy với "một nửa chi phí GPU so với các mô hình tiên tiến khác", một khoản tiết kiệm lớn cho Microsoft.
Lý do Microsoft liên tục phát triển mô hình riêng bất chấp khoản đầu tư 13 tỷ USD vào OpenAI
Microsoft đã đầu tư hơn 13 tỷ USD vào OpenAI và lưu trữ các mô hình của OpenAI trên khắp Azure, Office và Copilot. Vậy tại sao họ vẫn kiên trì xây dựng mô hình riêng? Câu trả lời bắt đầu từ chữ "độc lập".
Ngay khi Microsoft chiêu mộ Mustafa Suleyman và phần lớn đội ngũ Inflection AI vào tháng 3/2024, CEO Salesforce Marc Benioff đã nhận định đây là tuyên bố về ý định chiến lược. "Microsoft đang tự xây dựng AI của họ và tôi tin họ sẽ không dùng OpenAI trong tương lai. Họ sẽ có các mô hình tiên phong của riêng mình", Benioff phát biểu trên CNBC hồi tháng 1/2025.
Thực tế đã chứng minh nhận định này. Tháng 10/2025, Microsoft và OpenAI tái cấu trúc quan hệ đối tác với điều khoản cho phép Microsoft "độc lập theo đuổi AGI". Đến tháng 4/2026, hai bên tiếp tục sửa đổi, chấm dứt quyền truy cập độc quyền của Microsoft vào các mô hình OpenAI cũng như khoản phí chia sẻ doanh thu. Mỗi lần thỏa thuận được nới lỏng là một loạt mô hình MAI mới ra đời.
Vế thứ hai của câu trả lời nằm ở biên lợi nhuận. Mỗi prompt gửi đến mô hình OpenAI đều phát sinh chi phí, trong khi prompt xử lý trên mô hình tự phát triển và GPU riêng sẽ rẻ hơn đáng kể. Bloomberg đưa tin từ tháng 7 rằng Microsoft đã bắt đầu sử dụng mô hình MAI để trả lời một phần yêu cầu người dùng trong Word và Excel — những sản phẩm trước đây được quảng cáo chạy trên công nghệ OpenAI và Anthropic.
Chuyển giọng nói thành văn bản là mục tiêu thay thế tự nhiên đầu tiên vì bài toán có giới hạn rõ ràng và thước đo mang tính khách quan. Microsoft sở hữu Teams (tạo ra lượng lớn âm thanh cuộc họp), sở hữu Nuance (mảng tài liệu lâm sàng chạy trên nhận dạng giọng nói) và các dịch vụ Azure Speech. Toàn bộ các khối lượng công việc này đều là ứng viên để chuyển sang MAI-Transcribe-2, giúp Microsoft không còn phải trả tiền cho bất kỳ ai khác.
So sánh với OpenAI, Google, ElevenLabs và bài toán chuyên gia
Thông cáo của Microsoft nêu tên bốn đối thủ trực tiếp: GPT-Transcribe và Whisper V3-Large của OpenAI, Gemini 3.5 Transcribe của Google và Scribe v2 của ElevenLabs. Đáng chú ý, họ không nhắc đến Deepgram, AssemblyAI, Speechmatics hay Rev — những công ty chuyên về chuyển giọng nói thành văn bản cho doanh nghiệp suốt một thập kỷ qua.
Cách định vị này một phần mang tính tiếp thị nhưng cũng phản ánh thực tế: các phòng thí nghiệm AI lớn coi nhận dạng giọng nói như một tính năng phụ trong nền tảng lớn hơn, còn mô hình chuyên dụng của Microsoft với tốc độ nhanh hơn 5-10 lần và độ chính xác tương đương là một sự khác biệt thực sự. Tuy nhiên, các công ty chuyên ngành sẽ chịu áp lực giá mạnh nhất. Ở mức $0.10/giờ, Microsoft đang định giá ngang hoặc thấp hơn so với hợp đồng doanh nghiệp dung lượng lớn của họ.
"Vùng an toàn" còn lại của các chuyên gia là chiều sâu về lĩnh vực — từ vựng y khoa, định dạng pháp lý hay tích hợp ngành cụ thể — và tính năng keyword biasing của Microsoft chĩa thẳng vào điểm này.
Đối thủ mà Microsoft cố tình không nhắc đến khi so sánh về độ chính xác là Alibaba, hãng có các mô hình dẫn đầu nhiều bảng xếp hạng độc lập trong năm 2026. Một số công ty Mỹ được cho là đã bắt đầu đánh giá các mô hình Trung Quốc như một lựa chọn rẻ hơn bất chấp lo ngại an ninh. Lời chào hàng ngầm của Microsoft dành cho những khách hàng này rất rõ ràng: độ chính xác tương đương, suy luận nhanh hơn, giá thấp hơn và một nhà cung cấp mà bộ phận tuân thủ của bạn đã tin tưởng.
Những câu hỏi quan trọng trước khi chuyển đổi nhà cung cấp
Dù rất chi tiết về điểm chuẩn, vẫn có một số vấn đề thực tiễn cần được làm rõ:
- Thời hạn ưu đãi: Microsoft gọi mức giá $0.10/giờ là "ưu đãi ra mắt" mà không nói rõ ngày kết thúc hay giá tiêu chuẩn. Bất kỳ ai xây dựng mô hình chi phí nên yêu cầu được xác nhận bằng văn bản.
- Khả năng phát trực tiếp (streaming): Thông báo tập trung vào xử lý hàng loạt và âm thanh dài, không đề cập đến nhận dạng thời gian thực — thứ mà các voice agent và phụ đề trực tiếp yêu cầu.
- Độ chính xác theo từng ngôn ngữ: Mức WER trung bình 5,2% trên 60 ngôn ngữ có thể nghĩa là khoảng 3% cho ngôn ngữ chính nhưng lên tới 12% cho ngôn ngữ ít tài nguyên hơn.
- Chất lượng tách người nói: WER không đo lường khả năng gán đúng người nói. Một bản ghi có thể có WER gần như hoàn hảo nhưng vẫn gán nhầm người nói.
- Xử lý dữ liệu: Không có tuyên bố nào về nơi lưu trữ dữ liệu, thời gian lưu giữ hay việc âm thanh gửi lên Foundry có được dùng để huấn luyện trong tương lai hay không.
Chiến lược mô hình giọng nói hé lộ tham vọng AI rộng lớn hơn
Nhìn xa hơn chi tiết kỹ thuật, một mô hình chiến lược rõ ràng đang dần thành hình. Đơn vị AI của Microsoft hiện đã tung ra các mô hình cho hình ảnh, giọng nói, phiên âm, mã code, lý luận và an ninh mạng. Tại hội nghị Build tháng 6, họ công bố bảy mô hình MAI mới trong một phiên chính. Mỗi mô hình đều tuân theo cùng một nguyên tắc: nhắm vào một phương thức cụ thể, tối ưu mạnh về chi phí suy luận, định giá thấp hơn các phòng thí nghiệm AI lớn, phân phối qua Foundry và âm thầm thay thế trong các sản phẩm của chính mình.
Đây không phải là nỗ lực xây dựng một mô hình duy nhất có thể đánh bại GPT hay Gemini ở mọi thứ. Đây là nỗ lực xây dựng một danh mục các mô hình chuyên biệt để phục vụ hầu hết khối lượng công việc doanh nghiệp của Microsoft mà không phải trả tiền cho bên khác — đồng thời bán năng lực dư thừa với mức giá mà các chuyên gia không thể cạnh tranh.
Suleyman đã dành hai năm để nói về "siêu trí tuệ nhân văn" và trợ lý AI "có trách nhiệm với người dùng". Cách diễn đạt có vẻ cao siêu nhưng cách thực thi lại rất thực dụng. Năm tháng trước, Microsoft tính 36 cent để chuyển một giờ lời nói thành văn bản. Hôm nay, họ tính 10 cent, tích hợp sáu tính năng mà đối thủ bán riêng và tuyên bố đứng đầu điểm chuẩn đa ngôn ngữ của ngành. Tập đoàn đã chi 13 tỷ USD để hiểu giá của AI tiên tiến nhất đã quyết định: tự sở hữu nhà máy còn hơn đi thuê sản phẩm đầu ra — và giờ họ bán sản phẩm đó với giá rẻ hơn cả tiền thuê.
MAI-Transcribe-2 hiện có sẵn trên Microsoft Foundry và MAI Playground.


