Nghi vấn OpenAI 'đánh cắp' nghiên cứu toán học từ chat Codex riêng tư của hai nhà khoa học
Hai nhà toán học Tristan Buckmaster và Levent Alpoge cáo buộc OpenAI đã sử dụng trái phép các cuộc trò chuyện riêng tư trên Codex để huấn luyện mô hình AI, từ đó công bố lời giải cho một bài toán khó trước khi họ kịp xuất bản. Vụ việc đang gây chấn động cộng đồng nghiên cứu về quyền riêng tư dữ liệu và đạo đức AI, đặt ra câu hỏi lớn về tính bảo mật của các nền tảng AI mã nguồn đóng.

Hai nhà toán học hàng đầu vừa công bố bằng chứng cho thấy OpenAI có thể đã sử dụng dữ liệu từ các phiên chat riêng tư trên Codex để đào tạo mô hình AI của mình. Nếu đúng, đây sẽ là một trong những vụ bê bối lớn nhất về vi phạm quyền riêng tư dữ liệu trong lĩnh vực trí tuệ nhân tạo, ảnh hưởng trực tiếp đến niềm tin của người dùng trên toàn cầu, đặc biệt là các nhà nghiên cứu và lập trình viên Việt Nam đang sử dụng các công cụ AI trong công việc hàng ngày.
Diễn biến vụ việc
Theo tài liệu được đăng tải trên Reddit, hai nhà toán học Tristan Buckmaster (Đại học NYU) và Levent Alpoge đã dành trọn một năm để giải bài toán mà nhiều bộ óc vĩ đại nhất thế giới chưa thể chinh phục. Họ phải trả phí để sử dụng Codex và Claude hàng ngày nhằm kiểm tra ý tưởng, đối chiếu các bản nháp và hoàn thiện chứng minh toán học của mình.
Chỉ vài ngày trước khi dự kiến công bố kết quả, OpenAI bất ngờ tuyên bố mô hình của họ cũng đã giải được bài toán tương tự — một thông tin gần như không thể xảy ra ngẫu nhiên vì hầu như không ai khác trên thế giới đang nghiên cứu vấn đề này.
Khiếu nại của nhà toán học
Khi Tristan chất vấn liệu OpenAI có sử dụng dữ liệu từ các phiên chat riêng tư của họ để huấn luyện mô hình hay không, phía OpenAI chỉ trả lời mơ hồ rằng "mô hình không tra cứu dữ liệu người dùng" nhưng lại im lặng trước câu hỏi trực tiếp về việc huấn luyện AI trên dữ liệu này.
"Tôi hỏi họ ba lần, và cả ba lần họ đều né tránh. Điều đó nói lên tất cả." — Tristan Buckmaster
Đỉnh điểm của sự việc là khi OpenAI đưa ra cho Tristan hai lựa chọn:
- Công bố kết quả trước, sau đó OpenAI sẽ xuất bản lời giải của mình vào ngày hôm sau.
- Hoặc viết bài nghiên cứu nhưng phải ghi công cho "một mô hình nội bộ của OpenAI".
Khi Tristan từ chối cả hai, một nhân viên OpenAI được xác định là Sébastien Bubeck đã đe dọa: "Vì sao anh muốn hủy hoại sự nghiệp của mình? Nếu anh không muốn tôi tử tế, thì tôi không nhất thiết phải tử tế."
Những câu hỏi lớn về bảo mật dữ liệu
Vụ việc đặt ra nhiều vấn đề nghiêm trọng cho ngành công nghiệp AI:
- Quyền riêng tư dữ liệu người dùng: Liệu các cuộc trò chuyện riêng tư có bị sử dụng để đào tạo AI mà không có sự đồng ý rõ ràng của người dùng?
- Tính minh bạch của các nhà cung cấp AI: OpenAI và các công ty công nghệ lớn cần phải minh bạch về nguồn dữ liệu huấn luyện hơn nữa.
- Rủi ro cho các nhà nghiên cứu: Các nhà khoa học sử dụng AI như trợ lý nghiên cứu có thể đối mặt với nguy cơ đánh cắp phát minh, ảnh hưởng lợi thế cạnh tranh khi công bố công trình.
Hàm ý cho cộng đồng Việt Nam
Với sự bùng nổ của các nền tảng AI như ChatGPT, Gemini hay Claude tại Việt Nam, vụ việc này là lời cảnh tỉnh cho các lập trình viên, nhà khoa học dữ liệu và doanh nghiệp đang sử dụng AI để xử lý các thông tin nhạy cảm hoặc nghiên cứu độc quyền. Các chuyên gia khuyến cáo người dùng nên cân nhắc các giải pháp AI mã nguồn mở hoặc các nền tảng có chính sách bảo mật dữ liệu rõ ràng để bảo vệ tài sản trí tuệ của mình.
Kết luận
Cho đến thời điểm hiện tại, OpenAI vẫn chưa đưa ra phản hồi chính thức về cáo buộc này. Nếu những gì Tristan và Levent trình bày là sự thật, đây có thể là tiền lệ pháp lý quan trọng, định hình lại cách các công ty AI thu thập và xử lý dữ liệu người dùng — một vấn đề không chỉ của riêng giới học thuật mà còn của toàn thể người dùng công nghệ trên toàn cầu.