Vals huy động 40 triệu USD để trở thành chuẩn mực đánh giá AI đáng tin cậy
Startup Vals AI, được Andreessen Horowitz dẫn dắt vòng gọi vốn Series A trị giá 40 triệu USD, đang nỗ lực xây dựng hệ thống đánh giá mô hình AI khách quan và đáng tin cậy hơn. Thay vì kiểm tra kiến thức chung, Vals tập trung đo lường khả năng thực hiện các tác vụ phức tạp trong lĩnh vực luật, tài chính và lập trình.

Vals huy động 40 triệu USD để trở thành chuẩn mực đánh giá AI đáng tin cậy
Vals AI, startup thành lập năm 2024, vừa gọi vốn thành công 40 triệu USD trong vòng Series A do Andreessen Horowitz dẫn dắt. Công ty đang theo đuổi sứ mệnh xây dựng hệ thống đánh giá mô hình AI khách quan và đáng tin cậy hơn, trong bối cảnh các mô hình AI mới liên tục ra đời với tốc độ chóng mặt.
Vấn đề của các hệ thống đánh giá truyền thống
Đánh giá hiệu năng (benchmarking) đã trở thành tiêu chuẩn ngành để các công ty AI chứng minh năng lực mô hình của mình. Khi các chỉ số đạt kết quả tốt, đó gần như luôn đồng nghĩa với một chiến dịch PR hiệu quả.
Tuy nhiên, không ít doanh nghiệp đã tìm ra cách "lách" các hệ thống đánh giá cũ — vốn được thiết kế từ nhiều năm trước và không còn phù hợp để đo lường năng lực của các mô hình hiện đại.
Theo Rayan Krishnan, nhà sáng lập 25 tuổi của Vals, vấn đề nằm ở chỗ các hệ thống đánh giá học thuật không theo kịp tốc độ phát triển của ngành.
"Chúng tôi chứng kiến hàng loạt mô hình mới, rất mạnh mẽ ra mắt nhanh chóng, trong khi các bài đánh giá học thuật không bắt kịp đà tiến đó," Krishnan chia sẻ.
Cách tiếp cận khác biệt của Vals
Điểm khác biệt cốt lõi của Vals nằm ở phương pháp đánh giá. Trong khi nhiều hệ thống benchmark công khai bộ đề kiểm tra — cho phép doanh nghiệp huấn luyện mô hình "học tủ" và gian lận kết quả — Vals không tiết lộ tài liệu kiểm tra cụ thể.
Thay vì đo kiến thức chung, Vals đánh giá khả năng hoàn thành các tác vụ phức tạp gắn với từng ngành cụ thể như luật, tài chính và lập trình.
- Đánh giá đầu ra thực tế: liệu mô hình có tạo ra sản phẩm chất lượng tương đương con người?
- Phân tích cả tác động tiêu cực: điều gì xảy ra nếu mô hình được triển khai không kiểm soát?
- Mở rộng sang lĩnh vực mới: sức khỏe tâm thần, an ninh mạng, an ninh sinh học, thậm chí cả luật xung đột vũ trang và Công ước Geneva
"Điều chúng tôi làm thực sự là nhìn vào tác động thực tế của các mô hình. Liệu chúng có thể làm ra sản phẩm chất lượng ngang bằng con người trong từng lĩnh vực không?" — Krishnan giải thích.
Mô hình kinh doanh và tăng trưởng
Các công ty trả tiền cho Vals để kiểm tra mô hình của họ — một khái niệm thoạt nghe có vẻ nghịch lý. Tại sao lại bỏ tiền để biết mô hình của mình chưa đạt yêu cầu?
Krishnan so sánh mô hình doanh thu này với việc học sinh trả phí cho College Board để thi SAT. Có một phép đo hiệu quả giúp doanh nghiệp khắc phục điểm yếu và cải thiện theo thời gian. Đồng thời, những kết quả đánh giá này đang trở thành yếu tố quyết định quan trọng khi các công ty cân nhắc mua hoặc tích hợp mô hình AI mới.
Các con số tăng trưởng nổi bật:
- Doanh thu hiện gấp 8 lần so với năm ngoái
- Đội ngũ nhân sự tăng từ 8 người lên 25 người
- Kế hoạch tuyển thêm 10-15 nhân sự và chuyển sang văn phòng lớn hơn
- Ra mắt chương trình cung cấp dịch vụ đánh giá mô hình cho các cơ quan liên bang
Trước đó, Vals từng gọi thành công vòng hạt giống do 8VC và Bloomberg Beta dẫn dắt. Krishnan từng thực tập tại Palantir, làm việc cho Microsoft và phòng thí nghiệm AI nổi tiếng của Đại học Stanford.
Tầm nhìn về tương lai của ngành AI
Krishnan tin rằng hệ thống đánh giá của Vals sẽ định hình cách các công ty AI phát triển kinh doanh và xây dựng niềm tin công chúng.
"Các công ty AI đang bắt đầu niêm yết công khai... Khi mô hình AI trở thành phần cốt lõi của nền kinh tế và được phổ biến rộng rãi hơn, các loại đánh giá như chúng tôi làm sẽ thúc đẩy việc sử dụng chúng và trở thành phần trung tâm trong hồ sơ công khai của các công ty này."
Đối với độc giả Việt Nam, sự phát triển của các chuẩn đánh giá độc lập như Vals có ý nghĩa quan trọng khi ngày càng nhiều doanh nghiệp trong nước ứng dụng AI vào sản phẩm và quy trình vận hành. Một hệ thống đánh giá đáng tin cậy sẽ giúp các tổ chức đưa ra quyết định lựa chọn mô hình AI dựa trên bằng chứng thực tế thay vì chỉ dựa vào tuyên bố tiếp thị từ nhà cung cấp.


