Các chuyên gia: AI giọng nói vẫn chưa đạt đến khoảnh khắc ChatGPT của riêng mình
Dù hàng tỷ USD đang đổ vào các startup AI giọng nói, các chuyên gia tại hội nghị HumanX cho rằng công nghệ này vẫn chưa đạt đến bước ngoặt như ChatGPT. Vấn đề lớn nhất nằm ở lớp ngữ cảnh: các mô hình nhận dạng giọng nói thường bỏ sót từ khóa quan trọng, khiến toàn bộ chuỗi xử lý phía sau bị sai lệch.

AI giọng nói vẫn chưa có khoảnh khắc ChatGPT của riêng mình
Tóm tắt nhanh
Hàng tỷ USD đang đổ vào các startup AI giọng nói, từ nhà phát triển mô hình đến dịch vụ chăm sóc khách hàng doanh nghiệp, từ công cụ ghi chú cuộc họp đến ứng dụng đọc chính tả. Nhưng theo các chuyên gia tại hội nghị HumanX, công nghệ này vẫn chưa đạt đến "khoảnh khắc ChatGPT" — bước ngoặt khiến nó thực sự phổ cập và đáng tin cậy. Nút thắt lớn nhất nằm ở lớp ngữ cảnh: nhận dạng giọng nói sai thì mọi bước xử lý phía sau đều hỏng theo.
Kỳ vọng lớn, thực tế còn khoảng cách
Ý tưởng coi giọng nói là giao diện lớn tiếp theo đang có đà rất mạnh. Mỗi tuần lại có một mô hình hay công cụ mới được quảng cáo là "nói chuyện như người thật". Nhưng trên thực tế, điều đó chưa hẳn đã đúng.
Shawn Wen, CTO của nền tảng AI giọng nói doanh nghiệp PolyAI, cho rằng dù các mô hình song công toàn phần (full-duplex — vừa nói vừa nghe cùng lúc) đã ra đời, AI giọng nói vẫn chưa có bước ngoặt của riêng mình.
"Chúng ta đã đạt được cột mốc phát triển mô hình song công toàn phần. Thách thức tiếp theo là làm cho khả năng suy luận diễn ra thật nhanh, để mô hình lấy câu trả lời tức thì và cuộc trò chuyện diễn ra tự nhiên." — Shawn Wen, chia sẻ tại HumanX.
Ông cũng nhấn mạnh rằng các AI agent trong chăm sóc khách hàng không nên nghe máy móc, mà phải tạo đủ niềm tin để người gọi yên tâm rằng vấn đề của họ sẽ được giải quyết.
"Khi giọng nói đã đủ tốt và khách hàng sẵn sàng tương tác trong hai, ba lượt đầu, họ bắt đầu xây dựng niềm tin. Dần dần, họ sẽ cảm thấy có lẽ mình không cần nói chuyện với người thật nữa, miễn là agent giải quyết được vấn đề." — Shawn Wen.
Ghi chú cuộc họp: nhận diện người nói vẫn là bài toán khó
Alex Gay, CMO của Otter — ứng dụng ghi chú cuộc họp — cho rằng nhận diện người nói, nắm bắt ý định và gắn nội dung đó với tri thức của tổ chức là bước then chốt để tự động hóa. Công ty cũng đang phát triển bản sao số (digital twin) có thể đại diện cho người dùng trong các cuộc họp. Với công nghệ này, điều tối quan trọng là giọng nói đầu ra phải truyền tải được cảm xúc giống như đang trò chuyện với người thật.
"Nếu nghĩ về những cuộc họp bạn đang tham dự, những cuộc trò chuyện hay nhất là khi bạn có thể tranh luận, thảo luận chiến lược, và cảm thấy có một mối quan hệ nâng đỡ phía sau. Nếu avatar không làm được điều đó, thì nó chỉ là một chatbot hỏi đáp mà thôi." — Alex Gay.
Hiểu đúng và minh bạch: hai nút thắt của AI giọng nói
Dù các mô hình đã tiến bộ, trợ lý AI vẫn thường không hiểu người dùng, hoặc công cụ ghi chú hiển thị sai bản chép lời hay tóm tắt sai nội dung.
Wen cho rằng các mô hình ASR (nhận dạng giọng nói tự động) thường bỏ sót những từ khóa quan trọng, và chính điều đó phá vỡ khả năng nắm bắt toàn bộ ngữ cảnh.
Gay của Otter đồng tình, đồng thời cho biết công ty vẫn không ngừng cải thiện chất lượng chép lời. Ông cũng nhấn mạnh rằng ngôn ngữ là một lĩnh vực mà các mô hình giọng nói cần cải thiện.
"Với Otter, chép lời chưa bao giờ là điểm kết thúc. Đó chỉ là lớp nền để chúng tôi bắt đầu tạo ra năng suất. Nhưng nếu bản chép lời gốc không đủ chính xác, mọi hành động tiếp theo đều sai lệch. Và ngay khi hệ thống bắt đầu hành động sai, bạn mất niềm tin vào nền tảng. Việc cải thiện mô hình ASR là cực kỳ quan trọng bởi mọi tác động phía sau đều rất lớn." — Alex Gay.
Câu hỏi về tính minh bạch
Với các công cụ giọng nói mới, tính minh bạch cũng là vấn đề đáng bàn. Công cụ cần thông báo rõ cho khách hàng rằng cuộc gọi đang được ghi âm hoặc họ đang nói chuyện với AI.
Otter cho biết muốn xây dựng niềm tin cho những người trong cuộc họp, nên ngay cả khi bot không hiện diện, công ty vẫn tìm cách thông báo cho mọi người trong khung chat rằng cuộc họp đang được ghi lại. Wen của PolyAI cũng nhấn mạnh tầm quan trọng của việc xác lập rõ ràng rằng người dùng đang nói chuyện với AI trong các cuộc gọi doanh nghiệp.
Góc nhìn cho thị trường Việt Nam
Với các doanh nghiệp Việt Nam đang cân nhắc triển khai tổng đài AI hoặc trợ lý ghi chú cuộc họp, bài học từ các chuyên gia này khá rõ ràng:
- Chất lượng nhận dạng giọng nói là nền móng, không phải tính năng phụ. Với tiếng Việt — vốn có nhiều phương ngữ và từ đồng âm — bài toán này còn khó hơn tiếng Anh.
- Đừng đánh giá AI giọng nói qua bản demo. Tiếng nói tự nhiên chỉ là bề mặt; giá trị thật nằm ở khả năng hiểu đúng ngữ cảnh và hành động chính xác.
- Minh bạch với khách hàng là bắt buộc, đặc biệt trong bối cảnh các quy định về bảo vệ dữ liệu cá nhân ngày càng chặt chẽ.
Khoảng cách giữa "nghe hay" và "hiểu đúng" vẫn là rào cản lớn nhất mà AI giọng nói phải vượt qua trước khi thực sự có khoảnh khắc ChatGPT của riêng mình.


