Speko (YC S26) – 'OpenRouter' cho AI giọng nói, tối ưu mô hình STT/LLM/TTS tự động
Speko, startup từ Y Combinator (S26), ra mắt nền tảng định tuyến thông minh cho AI giọng nói, tự động chọn tổ hợp mô hình Speech-to-Text, LLM và Text-to-Speech tối ưu nhất dựa trên tiêu chí chi phí, độ trễ và độ chính xác. Với hơn 21 mô hình đa ngôn ngữ được benchmark công khai, nền tảng này giúp doanh nghiệp Việt Nam và toàn cầu luôn dùng mô hình mới nhất mà không cần tự tích hợp thủ công.

Speko: "Người trung gian" thông minh cho hệ sinh thái AI giọng nói
Việc xây dựng một voice agent chất lượng cao thường đòi hỏi phải "ghép" ba mô hình riêng biệt: một để nhận dạng giọng nói (STT), một để xử lý ngôn ngữ (LLM) và một để tổng hợp tiếng nói (TTS). Mỗi tầng lại có hàng chục nhà cung cấp uy tín và mỗi tháng đều có mô hình mới ra mắt, khiến việc lựa chọn và duy trì một "bộ khung" tối ưu trở thành cơn ác mộng cho các kỹ sư.
Khởi nghiệp từ thực tế đau đớn này, Speko, startup vừa gia nhập Y Combinator (lứa S26), đã tạo ra một giải pháp được ví như "OpenRouter cho AI giọng nói".
Vấn đề: Chọn một lần, dùng mãi mãi
Người sáng lập Speko, anh Bek, chia sẻ rằng hầu hết các đội ngũ kỹ thuật thường đánh giá mô hình một lần, chọn một bộ ba (STT + LLM + TTS) ưng ý nhất rồi "cắm rễ" sử dụng mãi vì việc chuyển đổi nhà cung cấp đồng nghĩa với một dự án tích hợp (integration) mới và những cuộc tranh luận bất tận về số liệu benchmark.
Kết quả là bạn đang vận hành voice agent bằng các mô hình của quý trước, trong khi những lựa chọn tốt hơn và rẻ hơn đã có trên thị trường.
Giải pháp: Biến việc benchmark và định tuyến thành một API
Speko giải quyết bài toán này bằng một bộ định tuyến (router) thông minh. Thay vì tự tay chạy benchmark, bạn chỉ cần gửi yêu cầu với các tiêu chí tối ưu của mình như độ chính xác, độ trễ, chi phí hoặc cân bằng, kèm theo ngôn ngữ và khu vực.
Router của Speko sẽ:
- Lọc các mô hình đã được đo lường phù hợp với ràng buộc của bạn.
- Chạy benchmark trực tiếp và chọn "người chiến thắng".
- Trả về phản hồi kèm header chứa thông tin nhà cung cấp, tên mô hình và điểm số.
Điểm đặc biệt là cổng kết nối (gateway) của họ prefetch các phiên ký kết (session plans), giúp cuộc gọi mới kết nối trực tiếp với nhà cung cấp từ bộ nhớ, không cần chờ vòng lặp điều khiển (control plane) – yếu tố quan trọng để không làm người gọi phải chờ đợi. Cơ chế chuyển đổi dự phòng (failover) cũng chỉ xảy ra trong quá trình kết nối, tự động chuyển sang các mô hình á quân nếu nhà cung cấp chính từ chối.
Không chỉ là một bảng benchmark tĩnh
Điểm nhấn của Speko là sự minh bạch. Toàn bộ quá trình đo lường của họ là công khai, và họ sẵn sàng công bố cả những bảng xếp hạng nơi lựa chọn của họ hoạt động kém hơn đối thủ. Họ cũng tự đào tạo một bộ chấm điểm (scorer) tự động cho độ tự nhiên của giọng nói (TTS) dựa trên hàng nghìn phiếu bầu nghe thử, mang lại kết quả tương đương với sự đồng thuận của các giám khảo con người.
Hạ tầng mở và nguồn mở
Speko không tự huấn luyện hay bán mô hình, đảm bảo sự khách quan. Họ cũng đã mở mã nguồn gateway (Go, MIT) trên GitHub, cho phép các đội ngũ đặt nó như một sidecar ngay trong container của agent, tránh thêm một bước nhảy mạng và hoàn toàn không chia sẻ API key với đám mây của Speko (chế độ BYOK).
Kết luận
Với tốc độ tăng trưởng khoảng 25% mỗi tuần kể từ cuối tháng 6, Speko đang giải quyết một nhu cầu thực sự lớn. Nó không chỉ giúp các startup nhỏ dễ dàng chọn đúng mô hình, mà còn giúp các doanh nghiệp lớn liên tục tối ưu hóa hệ thống của mình mà không biến việc này thành một dự án nghiên cứu (R&D). Đối với thị trường Việt Nam, nơi tiếng Việt là một thách thức lớn cho các mô hình STT/TTS, một nền tảng như Speko có thể là chìa khóa để dễ dàng so sánh và chọn ra mô hình xử lý tiếng Việt tốt nhất mà không cần đội ngũ chuyên gia riêng.