Startup dữ liệu AI Micro1 đạt tốc độ doanh thu 500 triệu USD giữa cơn sốt đào tạo AI
Micro1, startup cung cấp dữ liệu huấn luyện AI bốn năm tuổi, đã tăng tốc độ doanh thu gộp hàng năm từ 100 triệu USD lên 500 triệu USD chỉ trong tám tháng nhờ nhu cầu gần như vô hạn từ các phòng thí nghiệm AI lớn. Công ty đang mở rộng mảng dữ liệu tổng hợp và bán dữ liệu 'đóng gói sẵn' cho nhiều khách hàng, dự kiến biên lợi nhuận tăng cao. Tuy nhiên, việc phân phối dữ liệu cho các nhà phát triển AI Trung Quốc đang gây tranh cãi trong ngành.

Startup dữ liệu AI Micro1 đạt tốc độ doanh thu 500 triệu USD giữa cơn sốt đào tạo AI
Nhu cầu gần như không đáy về dữ liệu huấn luyện AI độc đáo từ các phòng thí nghiệm hàng đầu và tập đoàn lớn đang thúc đẩy sự bùng nổ mạnh mẽ cho nhóm các startup gắn nhãn dữ liệu (data-labeling).
Một trong những doanh nghiệp tăng trưởng nhanh nhất là Micro1, startup bốn năm tuổi vừa mở rộng tốc độ doanh thu gộp (gross annual run rate) từ 100 triệu USD lên 500 triệu USD trong tám tháng qua, theo một người quen thuộc với công ty. Giống như các đối thủ khác thuê chuyên gia theo hợp đồng (bác sĩ, luật sư, nhà khoa học), Micro1 giữ lại khoảng 60-70% con số đó, đưa tốc độ doanh thu ròng hàng năm của họ lên 150-200 triệu USD.
Mặc dù Micro1 vẫn xếp sau các đối thủ như Mercor (đạt 2 tỷ USD doanh thu gộp hàng năm hè này) và Handshake (đạt 1 tỷ USD đầu năm), tốc độ tăng trưởng của startup này cho thấy nhu cầu đủ lớn để hỗ trợ nhiều nhà cung cấp dữ liệu huấn luyện AI cùng phát triển.
Động lực tăng trưởng: dữ liệu tổng hợp và đóng gói sẵn
Sự tăng trưởng nhanh được dự báo sẽ tiếp tục khi nhiều nhà nghiên cứu giả thuyết rằng chi tiêu cho dữ liệu AI trong tương lai có thể sánh ngang với chi tiêu cho hạ tầng tính toán.
Viễn cảnh đó tốt cho Micro1 khi startup này chứng kiến quy mô hợp đồng tăng tốc và kỳ vọng biên lợi nhuận sẽ mở rộng theo thời gian. Công ty đang ngày càng tạo ra dữ liệu tổng hợp (synthetic data) không cần con người tham gia, chẳng hạn như tạo mô tả tự động cho nội dung video.
Ngoài ra, một phần dữ liệu họ tạo ra có thể bán cho nhiều khách hàng, đẩy biên lợi nhuận gộp cho dữ liệu "đóng gói sẵn" (off-the-shelf) lên tới 80-90%, theo một người quen thuộc với tài chính của startup này.
Việc bán cùng một bộ dữ liệu cho nhiều khách hàng đã gây tranh cãi gần đây, khi các nhà phê bình cho rằng phân phối dữ liệu cho các nhà phát triển AI Trung Quốc giúp mô hình của họ mạnh ngang các mô hình hàng đầu Mỹ.
Lập trường về dữ liệu và khách hàng
Người sáng lập Micro1, Ali Ansari, tuyên bố trên X vào tháng trước rằng không giống một số đối thủ, startup này không bán dữ liệu cho các nhà sản xuất mô hình Trung Quốc:
"Một số công ty dữ liệu con người làm việc với các đối thủ nước ngoài. Kết quả thể hiện rõ hôm nay ở Kimi K3. Chúng tôi cho rằng thật đáng xấu hổ khi tuyên bố khát vọng thống trị AI của Mỹ trong khi bán hàng triệu USD dữ liệu cho các quốc gia mà chúng ta đang cạnh tranh đối đầu."
Hành trình từ tuyển dụng AI sang dữ liệu huấn luyện
Giống Mercor, Micro1 khởi đầu là startup tuyển dụng bằng AI. Nhưng sau khi nhận thấy khách hàng gắn nhãn dữ liệu dùng nền tảng AI của mình để sàng lọc và tuyển kỹ sư cho công việc chú thích, Ansari quyết định xoay trục sang kinh doanh gắn nhãn dữ liệu.
Ansari trước đó chia sẻ với TechCrunch rằng bên cạnh việc để các chuyên gia đánh giá đầu ra của mô hình (khái niệm gọi là "phòng tập củng cố học tập" — reinforcement learning gyms), công ty đang xây dựng bộ dữ liệu tiền huấn luyện robot bằng cách cho hàng trăm nhân viên đa năng ghi lại các tương tác với đồ vật hàng ngày tại nhà.
Micro1 gọi vốn Series A với định giá 500 triệu USD vào tháng 9 năm ngoái, và TechCrunch được biết startup này có thể vừa huy động thêm một vòng với định giá cao hơn đáng kể. Micro1 không phản hồi yêu cầu bình luận.