Hồ sơ tòa án hé lộ: Microsoft từng gọi việc thu thập dữ liệu AI là 'vụ trộm sức lao động lớn nhất lịch sử'
Tài liệu chưa được che giấu trong vụ kiện bản quyền của The New York Times chống lại OpenAI và Microsoft cho thấy các công ty này từng nội bộ thừa nhận việc thu thập dữ liệu để huấn luyện AI là hành vi ăn cắp, đồng thời cảnh báo rằng sản phẩm AI đe dọa sự tồn vong của giới xuất bản.

Hồ sơ tòa án mới được công bố đã phơi bày những thừa nhận gây sốc từ nội bộ Microsoft và OpenAI về cách họ thu thập dữ liệu để huấn luyện trí tuệ nhân tạo. Những tài liệu này cho thấy các công ty từng gọi hành vi của mình là "ăn cắp", đồng thời nhận thức rõ rằng sản phẩm AI có thể đẩy các nhà xuất bản tin tức đến bờ vực diệt vong.
Những lời thừa nhận gây chấn động
Theo hồ sơ trong vụ kiện bản quyền mà The New York Times khởi kiện OpenAI và Microsoft cách đây ba năm, một lãnh đạo cấp cao của Microsoft đã mô tả hoạt động huấn luyện AI của hai công ty là "hành vi ăn cắp". Trong khi đó, chính ban lãnh đạo OpenAI cũng thừa nhận các mô hình AI của họ tạo ra "mối đe dọa tồn vong" đối với giới xuất bản và nhà báo — những người mà tác phẩm của họ đã trở thành dữ liệu huấn luyện miễn phí.
"Đây là một vụ trộm sức lao động lớn nhất trong lịch sử loài người." — Brent Hecht, Giám đốc Khoa học Ứng dụng của Microsoft, trong một bản ghi nhớ nội bộ tháng 1/2023.
Tài liệu cũng mô tả chi tiết cách hai công ty này có được nội dung của các nguyên đơn: vượt qua tường phí một cách không bị phát hiện, xây dựng tập dữ liệu huấn luyện thông qua thu thập dữ liệu quy mô lớn, và cố tình xóa bỏ thông báo bản quyền khỏi dữ liệu huấn luyện.
Quy mô sao chép đáng kinh ngạc
Các tài liệu tiết lộ lần đầu tiên rằng chỉ riêng tập dữ liệu huấn luyện trung gian của OpenAI đã chứa hơn 91.692 bản sao các tác phẩm do NYT, Daily News và Center for Investigative Reporting xuất bản. Một tập dữ liệu dựa trên Common Crawl còn bao gồm hơn 2 triệu tài liệu chỉ từ riêng trang nytimes.com.
Hồ sơ cũng nêu rõ cách OpenAI và Microsoft thu thập nội dung của các nguyên đơn, bao gồm việc thu thập dữ liệu từ Bing Index. Theo hồ sơ, OpenAI đã giao toàn bộ tập dữ liệu huấn luyện GPT-3 cho Microsoft để đánh giá cách triển khai các mô hình trong sản phẩm thương mại của mình.
Đặc biệt, một kế hoạch có tên Project Mango được cho là đã tập hợp tập dữ liệu huấn luyện chứa bản sao của ít nhất 160.903 tác phẩm riêng biệt từ các nhà xuất bản tin tức.
Bằng chứng về việc vượt tường phí có chủ đích
Các tài liệu cho thấy khi nhà nghiên cứu OpenAI Nick Ryder thông báo với Chủ tịch Greg Brockman về một "thủ thuật để vượt qua tường phí của nytimes", Brockman đã trả lời: "ah nice" (hay đấy).
Nhân viên OpenAI cũng được cho là đã xây dựng các tập dữ liệu như WebText và WebText2, phụ thuộc không cân xứng vào nội dung tin tức bị thu thập. Họ còn cố tình loại bỏ thông báo bản quyền khỏi dữ liệu huấn luyện trước khi đưa vào mô hình, vì các nhà nghiên cứu "không muốn mô hình xuất ra thông báo bản quyền" cho người dùng.
Lập luận chống lại "sử dụng hợp lý"
Nhiều thừa nhận mới này đi ngược lại lập luận "sử dụng hợp lý" (fair use) mà OpenAI đưa ra để bào chữa. Cụ thể, quy tắc này yêu cầu việc sử dụng không được thay thế hoặc gây tổn hại đến thị trường của tác phẩm gốc.
Dữ liệu của chính Microsoft cho thấy công cụ Copilot đã khiến tỷ lệ nhấp chuột vào tên miền của The New York Times giảm tới 93% so với tìm kiếm Bing truyền thống. Một bài thuyết trình nội bộ của Microsoft mô tả sự sụt giảm này là một "vòng lặp diệt vong" có thể "gây tổn hại cho hiệu suất mô hình của chúng ta và toàn bộ web cùng lúc".
"Thật bất thường khi một sản phẩm cuối lại đe dọa nền tảng kinh tế của chính những nhà cung cấp thiết yếu của nó." — Trích tài liệu nội bộ Microsoft.
Tổng giám đốc Microsoft Satya Nadella cũng khai trong một buổi lấy lời khai rằng "bất cứ nội dung nào nằm sau tường phí đều nên được cấp phép bởi bất kỳ ai muốn sử dụng". Ông cũng khẳng định nếu biết OpenAI đã thu thập và huấn luyện trên thông tin sau tường phí, ông sẽ yêu cầu OpenAI phải huấn luyện lại mô hình.
Nỗi lo về tương lai của báo chí
Nick Turley, người đứng đầu ChatGPT của OpenAI, viết trong liên lạc nội bộ rằng các nhà xuất bản đang đối mặt với "mối đe dọa tồn vong" từ các sản phẩm như chatbot — những công cụ "phần lớn mang tính thay thế" và "sẽ ngày càng thay thế nhiều hơn khi trở nên tốt hơn".
Một tài liệu của Microsoft cũng nêu rằng có "rủi ro thực sự" khi AI tạo sinh có thể "gây xáo trộn đáng kể đến việc làm của chính những người đã tạo ra dữ liệu mà mô hình nền tảng được huấn luyện".
Đối với độc giả Việt Nam, vụ kiện này đặt ra câu hỏi quan trọng về tương lai của ngành xuất bản nội dung số trong nước. Khi các mô hình AI ngày càng được sử dụng rộng rãi, việc bảo vệ bản quyền và đảm bảo nguồn thu cho các tòa soạn — vốn đã chật vật với mô hình kinh doanh số — trở thành vấn đề cấp thiết hơn bao giờ hết.
Hiện OpenAI và Microsoft đều chưa đưa ra phản hồi về các tiết lộ này.

