OpenWALDO: Dự án mã nguồn mở đầy tham vọng nhằm thay thế dữ liệu đào tạo AI độc quyền
Người sáng lập CentOS và Rocky Linux, Gregory Kurtzer, ra mắt OpenWALDO - một nỗ lực xây dựng bộ dữ liệu đào tạo AI mã nguồn mở, minh bạch mà bất kỳ ai cũng có thể đóng góp. Mặc dù mới chỉ có 167,3 tỷ token tham chiếu, dự án kỳ vọng mang lại tính mở cho quy trình đào tạo AI, vốn đang bị chi phối bởi dữ liệu bí mật của các tập đoàn công nghệ lớn.

OpenWALDO: Nỗ lực "mở khóa" dữ liệu đào tạo AI, thách thức mô hình độc quyền
Một dự án mới mang tên OpenWALDO (Open Weights, Artifacts, Licenses, Data, Origins) vừa được ra mắt với tham vọng xây dựng một bộ dữ liệu đào tạo AI mã nguồn mở, cộng đồng có thể đóng góp như cách các dự án phần mềm nguồn mở vận hành. Sáng kiến này hướng đến việc minh bạch hóa nguồn gốc dữ liệu — điểm mù lớn nhất của các mô hình AI hiện nay, kể cả các mô hình open-weight đang rất phổ biến.
Vấn đề của mô hình "open-weight" hiện tại
Dù được gọi là "mở", hầu hết các mô hình open-weight vẫn che giấu dữ liệu đào tạo. Người dùng chỉ nhận được bộ trọng số (weights) sau khi mô hình đã được huấn luyện, nhưng không biết nó được "dạy" từ những gì.
“Không có cách nào để biết dữ liệu nào đã đào tạo một mô hình, theo giấy phép nào, hoặc với sự đồng ý nào,” — CIQ, công ty bảo trợ dự án, nhận định.
CIQ cảnh báo rằng dữ liệu ẩn có thể xuất phát từ nội dung có bản quyền, phản hồi lấy từ các mô hình khác, hoặc nội dung người dùng không được cấp phép công khai. Điều này tạo ra rủi ro pháp lý và an ninh cho các công ty muốn dựa vào AI trong hệ thống của mình.
Tham vọng của Gregory Kurtzer
Người khởi xướng dự án là Gregory Kurtzer — cha đẻ của CentOS, Rocky Linux và hiện là CEO của CIQ (chuyên về hạ tầng HPC/AI). Ông đặt mục tiêu đưa triết lý mã nguồn mở, thứ đã giúp Linux và Kubernetes thành công, vào lĩnh vực AI.
“Tôi đã dành cả sự nghiệp để thấy nguồn mở biến người dùng thành nhà xây dựng, biến đối thủ thành cộng tác viên,” — Kurtzer phát biểu.
Theo ông, khi tất cả các phòng lab AI đang huấn luyện trong bí mật, một lượng lớn công việc trùng lặp đang làm lãng phí thời gian và tài nguyên compute. Nếu có một bộ dữ liệu dùng chung, minh bạch, mọi cải tiến của cộng đồng sẽ đều có lợi cho các mô hình tương lai.
Lợi ích cho doanh nghiệp và cộng đồng
Mô hình mà OpenWALDO hướng đến có thể được so sánh với cách doanh nghiệp dùng Linux:
- Nhận bộ dữ liệu gốc (corpus) kèm "hóa đơn vật liệu" (bill of materials) — rõ ràng nguồn gốc và giấy phép
- Thêm dữ liệu độc quyền riêng của doanh nghiệp
- Xây dựng và triển khai mô hình với khả năng kiểm toán hoàn toàn
Điều này đặc biệt quan trọng trong bối cảnh các mô hình open-weight từ Trung Quốc (như dòng DeepSeek) đang ngày càng tiệm cận khả năng của các mô hình đóng như ChatGPT hay Claude. Nhiều doanh nghiệp bắt đầu đặt câu hỏi: tại sao phải trả phí đắt đỏ cho dịch vụ AI mà mình không thực sự sở hữu, không kiểm soát được, và không thấy rõ bên trong?
Thách thức không nhỏ
Hiện tại, bộ dữ liệu OpenWALDO mới có 167,3 tỷ token tham chiếu — con số khá lớn với cộng đồng, nhưng chỉ là "hạt cát" so với hàng chục nghìn tỷ token mà các mô hình frontier sử dụng. CIQ chưa phản hồi câu hỏi liệu đã có mô hình nào được huấn luyện thành công trên bộ dữ liệu này hay chưa.
Kurtzer so sánh hoài nghi về bảo mật AI với những tranh cãi về mã nguồn mở trong quá khứ:
“Linux không thắng vì được chứng nhận an toàn. Nó thắng vì có thể kiểm tra, có thể fork, và được cộng đồng xác nhận.”
Tương lai nào cho AI mở?
OpenWALDO đứng trước một bài toán kinh điển của nguồn mở: làm sao thuyết phục một ngành công nghiệp đã quá sâu vào con đường dữ liệu đóng từ bỏ "bí quyết" và hợp tác trên một nền tảng chung? Chỉ thời gian mới trả lời được liệu đây là một cuộc cách mạng, hay chỉ là một dự án OSS khác bị cộng đồng AI thờ ơ.
Dự án đang kêu gọi sự đóng góp từ cộng đồng, với trang web chính thức và kho mã nguồn trên GitHub sẵn sàng nhận phản hồi và dữ liệu từ các lập trình viên, nhà nghiên cứu quan tâm đến AI minh bạch.
