LAION ra mắt LAION-BVD: Kho video đa phương thức mở lớn nhất thế giới với 10 triệu giờ nội dung
LAION vừa công bố LAION-BVD (Big Video Dataset), một kho dữ liệu video mở quy mô chưa từng có với 80 triệu video, tổng thời lượng 10 triệu giờ, được thiết kế cho việc huấn luyện mô hình đa phương thức. Bộ dữ liệu này bao gồm video, âm thanh và hình ảnh, hứa hẹn giúp cộng đồng nghiên cứu độc lập tiếp cận nguồn dữ liệu lớn thay vì phụ thuộc vào các công ty công nghệ độc quyền.
LAION ra mắt LAION-BVD: Kho video đa phương thức mở lớn nhất thế giới với 10 triệu giờ nội dung
LAION, tổ chức phi lợi nhuận nổi tiếng với các bộ dữ liệu mở trong lĩnh vực AI, vừa chính thức giới thiệu LAION-BVD (Big Video Dataset) — một kho dữ liệu video quy mô lớn dành cho nghiên cứu học đa phương thức (multimodal learning). Với 80 triệu video đã tải về, tổng thời lượng lên tới 10 triệu giờ, đây được xem là bộ dữ liệu video mở lớn nhất hiện nay, mở ra cơ hội nghiên cứu mới cho cộng đồng AI trên toàn thế giới.
Quy mô và phương pháp xây dựng
LAION-BVD được xây dựng từ việc thu thập 1,3 tỷ URL video từ kho lưu trữ CommonCrawl, sau đó tiến hành tải về và xử lý thành công 80 triệu video. Điểm đặc biệt của bộ dữ liệu này là nó được thiết kế để phục vụ tiền huấn luyện đa phương thức trên nhiều loại dữ liệu cùng lúc: video, âm thanh và hình ảnh.
Bằng cách sử dụng kỹ thuật phát hiện cảnh dựa trên nội dung (content-aware scene detection), chúng tôi trích xuất các clip và tạo caption tổng hợp cho cả video lẫn âm thanh.
Ngoài ra, nhóm nghiên cứu còn khai thác các khung hình (frames) từ video như một nguồn dữ liệu hình ảnh - văn bản thay thế. Những khung hình bắt tại thời điểm chuyển cảnh này có phân bố thị giác khác biệt so với các kho ảnh web truyền thống, giúp bổ sung đa dạng cho quá trình huấn luyện.
Kết quả ấn tượng trên nhiều chuẩn đánh giá
Theo công bố chính thức, các mô hình được huấn luyện trên LAION-BVD đạt hiệu suất cạnh tranh trên các chuẩn đánh giá video - văn bản và âm thanh - văn bản phổ biến:
-
Mô hình ViCLIP huấn luyện trên LAION-BVD đạt hoặc vượt các mô hình huấn luyện trên InternVid tới 2,1% trên chuẩn video-text, với sự cải thiện nhất quán khi tăng quy mô dữ liệu từ 10 triệu lên 50 triệu clip.
-
Mô hình CLAP cho thấy hiệu suất cạnh tranh so với các bộ dữ liệu âm thanh quy mô lớn khác, nhờ vào việc tận dụng âm thanh tự nhiên phong phú trích xuất trực tiếp từ video.
-
Mô hình CLIP dựa trên khung hình vídeo đạt hiệu suất mạnh mẽ trên các chuẩn đánh giá truy xuất hình ảnh - văn bản, cho thấy tiềm năng bổ sung nguồn dữ liệu mới cho các mô hình tiền huấn luyện hiện có.
Vì sao LAION-BVD quan trọng với cộng đồng nghiên cứu?
Điểm mấu chốt của dự án này nằm ở triết lý mở và tái lập (open and reproducible). Tổ chức LAION nhấn mạnh rằng các bộ dữ liệu video quy mô lớn hiện nay đang bị tập trung chủ yếu trong tay một số ít công ty công nghệ tư nhân, hạn chế khả năng nghiên cứu độc lập.
Bằng việc cung cấp tài nguyên mở cho nghiên cứu hàn lâm, chúng tôi mong muốn mở rộng khả năng tiếp cận dữ liệu huấn luyện đa phương thức và cho phép đánh giá minh bạch hơn đối với các mô hình video, âm thanh và hình ảnh quy mô lớn.
Với các nhà nghiên cứu tại Việt Nam đang theo đuổi hướng AI đa phương thức, LAION-BVD là một cơ hội quý giá để tiếp cận nguồn dữ liệu đẳng cấp quốc tế mà không phụ thuộc vào các hệ sinh thái đóng.
Điều kiện sử dụng và hạn chế
LAION-BVD được phát hành chỉ dành cho mục đích nghiên cứu, không dùng cho mục đích thương mại. Bộ dữ liệu nhằm hỗ trợ nghiên cứu khoa học, tái lập kết quả, phân tích an toàn và nghiên cứu các mô hình nền tảng đa phương thức. Người dùng được khuyến khích tôn trọng bản quyền của các nhà sáng tạo nội dung và sử dụng dữ liệu tuân thủ pháp luật cũng như điều khoản nền tảng.
Bên cạnh đó, giống như các bộ dữ liệu web quy mô lớn khác, LAION-BVD có thể chứa thiên kiến, khuôn mẫu và phân bố không đồng đều về ngôn ngữ, khu vực và chủ đề. Các nhà nghiên cứu cần lưu ý những giới hạn này khi sử dụng và nên đánh giá, báo cáo chúng đi kèm với kết quả mô hình.
Hướng phát triển tương lai
Việc LAION-BVD ra đời đánh dấu một bước tiến quan trọng trong việc dân chủ hóa dữ liệu AI quy mô lớn. Trong bối cảnh các công ty lớn ngày càng khép kín nguồn dữ liệu huấn luyện, những dự án như LAION-BVD đóng vai trò then chốt giúp các viện nghiên cứu, trường đại học và cả các startup AI tại Việt Nam có thể tham gia sâu hơn vào cuộc đua phát triển mô hình đa phương thức, góp phần đưa AI Việt Nam tiến gần hơn đến trình độ quốc tế.