Speko (YC S26): Nền tảng 'OpenRouter cho Voice AI' giúp tối ưu mô hình STT, LLM và TTS
Speko, startup thuộc Y Combinator (S26), vừa ra mắt nền tảng giúp các nhà phát triển tự động chọn và chuyển đổi giữa các mô hình voice AI như STT, LLM và TTS dựa trên tiêu chí độ chính xác, độ trễ hoặc chi phí. Nền tảng này cung cấp hệ thống benchmark công khai và bộ gateway mã nguồn mở, giúp doanh nghiệp tránh việc mắc kẹt với các mô hình cũ kém hiệu quả.
Speko (YC S26): "OpenRouter cho Voice AI" — Tự động tối ưu mô hình STT, LLM và TTS cho doanh nghiệp
Việc xây dựng một voice agent (trợ lý thoại) chuyên nghiệp thường là bài toán ghép ba thành phần: speech-to-text (STT), LLM và text-to-speech (TTS). Mỗi lớp lại có hàng chục nhà cung cấp đáng tin cậy, và mỗi tháng đều có mô hình mới ra mắt. Hầu hết doanh nghiệp chỉ đánh giá một lần, chọn một bộ công nghệ rồi "mắc kẹt" với nó mãi, vì việc chuyển đổi nhà cung cấp đòi hỏi tích hợp lại và tranh luận về số liệu. Kết quả là không ít hệ thống voice AI đang chạy những mô hình của quý trước trong khi đã có lựa chọn tốt hơn và rẻ hơn.
Speko ra đời để giải quyết chính bài toán này. Startup vừa gia nhập kỳ họp YC S26 đã phát triển một nền tảng hoạt động như một "OpenRouter cho Voice AI", tự động tìm kiếm và kết hợp các mô hình STT, LLM, TTS tối ưu dựa trên ràng buộc của bạn, kèm theo lời giải thích rõ ràng vì sao lựa chọn đó là tốt nhất.
Trải nghiệm bốn năm xây voice agent cho thị trường châu Á
Chia sẻ trên Hacker News, nhà sáng lập Bek cho biết trước khi thành lập Speko, anh đã dành bốn năm làm đồng sáng lập kiêm CTO, xây dựng voice agent cho các doanh nghiệp tại châu Á với hơn 10 ngôn ngữ. Quy trình thường lặp lại mỗi khi một mô hình giọng nói mới xuất hiện: thuê người bản xứ đánh giá, benchmark so với hệ thống hiện tại và cập nhật production nếu mô hình mới tốt hơn. Speko đã "đóng gói" quy trình thủ công và tốn kém này thành một API.
Một khách hàng chạy hàng nghìn cuộc gọi mỗi ngày từng chia sẻ: "Chúng tôi chỉ cần vào dashboard này, chuyển model, và hệ thống sẽ tự động làm việc."
Cách thức hoạt động: Gửi tiêu chí, nhận mô hình tối ưu
Bạn gửi một request với các tiêu chí tối ưu hóa như độ chính xác, độ trễ, chi phí hoặc cân bằng, kèm ngôn ngữ và khu vực. Bộ định tuyến của Speko sẽ lọc ra các mô hình đã được đo lường phù hợp với tổ hợp ràng buộc đó, tiến hành benchmark, chọn ra "người chiến thắng" và trả về response kèm thông tin nhà cung cấp, tên mô hình và điểm số trong header.
Điểm đáng chú ý là failover chỉ xảy ra trong giai đoạn thiết lập kết nối. Nếu nhà cung cấp chính từ chối, hệ thống sẽ tự động kết nối đến các mô hình á quân. Gateway còn có cơ chế prefetch các "session plan" đã ký sẵn, giúp cuộc gọi mới kết nối trực tiếp đến nhà cung cấp từ bộ nhớ, không cần vòng lặp control-plane trong khi người gọi vẫn đang chờ.
Benchmark công khai và tự động hóa việc đánh giá cảm nhận
Điểm khác biệt cốt lõi của Speko nằm ở sự minh bạch. Họ công khai toàn bộ quy trình đo lường: cùng một input được đưa vào mọi mô hình trong cùng một khu vực ở các đợt chạy khác nhau, và bảng xếp hạng được xuất bản công khai — kể cả khi lựa chọn của chính họ hoạt động kém hơn so với các giải pháp thay thế.
Speko không chỉ benchmark các clip ngắn 30 giây, mà còn kiểm tra lời nói tự nhiên, số tiền, ngày tháng và các bài dài 10 phút — thứ khiến bảng xếp hạng có thể thay đổi hoàn toàn. Họ thậm chí đã huấn luyện một bộ chấm điểm tự động cho độ tự nhiên của TTS dựa trên các phiếu bầu nghe mù (blind test). Kết quả cho thấy bộ chấm điểm này chọn người thắng cuộc trùng với đánh giá của con người ở mức tương đương với độ đồng thuận giữa các giám khảo với nhau.
Câu chuyện khách hàng thực tế
- Một founder không biết nên chọn gì: chỉ đưa ra use case và giờ định tuyến mọi thứ qua Speko.
- Một AI quản lý bất động sản chạy LiveKit bằng Python, không cập nhật STT/TTS từ khi ra mắt. Họ không hề biết STT của mình có tỷ lệ lỗi cao trong các cuộc gọi, và việc hoán đổi từng bị xem như một dự án nghiên cứu mạo hiểm.
- Một nhóm cần chọn mô hình phù hợp cho tiếng Tây Ban Nha.
- Một nhóm y tế cần tìm STT xử lý tốt từ vựng chuyên ngành.
Trong mọi trường hợp, các khách hàng đều tìm được bộ công nghệ phù hợp từ bảng benchmark của Speko và chuyển sang định tuyến qua nền tảng này.
Gateway mã nguồn mở và chế độ BYOK
Speko không tự huấn luyện hay bán mô hình — đó chính là cách họ giữ tính khách quan cho bảng xếp hạng. Để phục vụ các đội ngũ muốn tránh thêm một "network hop" trên đường truyền âm thanh và không muốn chia sẻ API key với cloud của họ, Speko đã mở mã nguồn gateway trên GitHub (giấy phép MIT). Đây là một binary Go chạy như sidecar trong container, giao tiếp qua Unix socket, neo giữ host của nhà cung cấp và gắn key riêng của bạn. Ở chế độ BYOK, gateway hoàn toàn không liên lạc với Speko.
Lưu ý nhỏ: telemetry ẩn danh (không chứa nội dung) được bật theo mặc định, nhưng có thể tắt chỉ bằng một biến môi trường.
Chi phí và tăng trưởng
Gateway và cấu hình BYOK sẽ miễn phí vĩnh viễn. Speko tính phí cho hosted router và quản lý key tập trung với hóa đơn gộp. Kể từ khi bắt đầu kỳ batch vào cuối tháng 6, lượng sử dụng ngoài đã tăng trung bình khoảng 25% mỗi tuần.
Với cộng đồng nhà phát triển, nhà sáng lập Bek đặt hai câu hỏi: "Làm thế nào để bạn chọn mô hình giọng nói hiện tại? Và điều gì khiến bạn tin tưởng vào một bên benchmark thứ ba?"