Giám đốc Microsoft: Thu thập dữ liệu bằng AI là "vụ trộm lao động lớn nhất lịch sử loài người"
Tài liệu pháp lý từ vụ kiện của The New York Times chống lại OpenAI và Microsoft tiết lộ những phát ngôn gây chấn động từ chính lãnh đạo hai công ty. Một giám đốc Microsoft gọi việc AI thu thập dữ liệu là "vụ trộm lao động lớn nhất lịch sử", trong khi lãnh đạo OpenAI thừa nhận ChatGPT là "mối đe dọa sinh tồn" với các nhà xuất bản.

The New York Times (NYT) đã khởi kiện OpenAI và Microsoft với cáo buộc vi phạm bản quyền từ cuối năm 2023, và gần ba năm sau, vụ án vẫn đang tiếp diễn. Mới đây, đội ngũ pháp lý của tờ báo này đã yêu cầu tòa án ra phán quyết tóm tắt, kèm theo một hồ sơ pháp lý gây chấn động dựa trên các tuyên bố và tài liệu nội bộ của hai bị đơn.
Theo 404 Media, phần lớn các tài liệu này vẫn bị niêm phong hoặc che đen theo yêu cầu của cả hai công ty. Tuy nhiên, những gì được tiết lộ đã phơi bày các phát ngôn có thể gây bất lợi nghiêm trọng cho chính ban lãnh đạo của họ.
"Vụ trộm lao động lớn nhất lịch sử loài người"
Hồ sơ pháp lý trích dẫn một bản ghi nhớ nội bộ của Microsoft, được cho là do Brent Hecht — Giám đốc Khoa học Ứng dụng của công ty — soạn thảo vào tháng 1/2023. Trong đó, ông viết rằng "hàng triệu người trên khắp thế giới sẽ sớm coi việc các mô hình lớn 'hút sạch' toàn bộ công sức của họ là một vụ trộm đáng kinh ngạc với quy mô chưa từng có", đồng thời gọi đây là "vụ trộm lao động lớn nhất trong lịch sử loài người".
Một tài liệu khác của Microsoft cũng được viện dẫn, với nội dung: "gần như không ai có ý định để nội dung họ tạo ra bị sử dụng theo cách này, và họ cũng không được đền bù cho việc đó".
Minh họa về thu thập dữ liệu AI và bản quyền
Copilot và "vòng lặp tử thần" cho ngành xuất bản
Khi ChatGPT bùng nổ về độ phổ biến trong suốt năm 2023, dữ liệu của chính Microsoft cho thấy Copilot đã khiến tỷ lệ nhấp chuột vào The New York Times giảm tới 93% so với tìm kiếm trên Bing. Một bản ghi nhớ khác của vị giám đốc Khoa học Ứng dụng gọi đây là "vòng lặp tử thần" (doom loop) và cảnh báo nó "sẽ gây tổn hại cho hiệu năng của các mô hình và toàn bộ web cùng một lúc".
Hồ sơ của NYT trích lời Hecht từ tài liệu này: "Thật bất thường khi một sản phẩm cuối lại đe dọa nền tảng kinh tế của những nhà cung cấp thiết yếu cho nó, nhưng đó chính là tình huống mà chúng ta đã tạo ra cho mảng kinh doanh LLM với 'chuỗi cung ứng nội dung' của nó".
OpenAI cũng thừa nhận mối đe dọa
Không chỉ Microsoft, các tài liệu nội bộ của OpenAI cũng gây bất lợi cho chính công ty này. Nick Turley, Giám đốc phụ trách ChatGPT của OpenAI, được cho là đã nói trong các trao đổi nội bộ rằng chatbot AI là một "mối đe dọa sinh tồn" đối với các nhà xuất bản, bởi chúng "phần lớn mang tính thay thế" và "sẽ ngày càng thay thế nhiều hơn khi trở nên tốt hơn".
Một kỹ sư OpenAI khác còn khai trước tòa rằng "dù chúng ta có hiển thị liên kết nổi bật đến đâu, người dùng cũng sẽ không nhấp vào". Nick Ryder, một nhà nghiên cứu của OpenAI, được cho là đã nhắn cho chủ tịch Greg Brockman về một "thủ thuật để vượt qua tường phí của NYTimes", và Brockman trả lời: "ah hay đấy".
Trụ sở và hoạt động của các công ty AI
Cuộc chiến pháp lý xoay quanh "fair use"
Các công ty AI lập luận rằng việc thu thập dữ liệu từ internet để huấn luyện mô hình là "sử dụng hợp lý" (fair use). Một tòa án từng đồng tình rằng việc Anthropic sử dụng tài liệu đã xuất bản thuộc phạm vi này.
Luật định nghĩa fair use gồm các mục đích như phê bình, bình luận, đưa tin, giảng dạy, học bổng hoặc nghiên cứu. Bốn yếu tố quyết định gồm: mục đích và tính chất sử dụng; bản chất tác phẩm có bản quyền; mức độ và khối lượng trích dẫn so với tổng thể tác phẩm; và ảnh hưởng của việc sử dụng lên thị trường tiềm năng hoặc giá trị của tác phẩm.
Tuy nhiên, những tiết lộ trong hồ sơ của NYT có thể làm phức tạp lập luận fair use của OpenAI, đặc biệt khi chúng cho thấy ban lãnh đạo cả hai công ty đều ý thức rõ về những hệ quả thị trường của việc thu thập dữ liệu bằng AI.
Nadella: Nội dung sau tường phí phải được cấp phép
CEO Microsoft Satya Nadella trong một buổi lấy lời khai hồi đầu năm nay đã tuyên bố rằng "bất cứ nội dung nào nằm sau tường phí đều nên được cấp phép bởi bất kỳ ai muốn sử dụng nó… để làm nền tảng hoặc huấn luyện". Ông cũng nói thêm rằng nếu được thông báo rằng OpenAI đã thu thập và huấn luyện trên thông tin nằm sau tường phí, Microsoft sẽ yêu cầu OpenAI "huấn luyện lại các mô hình của mình".
Đây được xem là một trong những phát ngôn gây bất lợi nhất cho chính bị đơn, bởi nó cho thấy ngay cả lãnh đạo cấp cao nhất cũng thừa nhận sự cần thiết của việc cấp phép nội dung có bản quyền.
Tranh chấp bản quyền giữa AI và báo chí
Ý nghĩa với người dùng và ngành công nghệ Việt Nam
Vụ kiện này không chỉ là câu chuyện giữa các ông lớn công nghệ Mỹ. Nó đặt ra câu hỏi cốt lõi về tương lai của nội dung số: nếu các mô hình AI tiếp tục "hút" nội dung mà không đền bù, liệu nguồn cung nội dung chất lượng có cạn kiệt?
Đối với Việt Nam — nơi các tòa soạn, nhà sáng tạo nội dung và cả các startup AI đang trong giai đoạn phát triển — diễn biến pháp lý này có thể trở thành tiền lệ quan trọng. Các doanh nghiệp trong nước cần theo dõi sát các quy định về bản quyền dữ liệu huấn luyện, đặc biệt khi ngày càng nhiều công cụ AI tạo sinh được tích hợp vào sản phẩm thương mại.
Kết quả của vụ NYT kiện OpenAI và Microsoft có thể định hình lại cách ngành AI tiếp cận dữ liệu, cũng như cách các nhà xuất bản — trong đó có báo chí Việt Nam — được đền bù xứng đáng cho công sức sáng tạo của mình.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026
Công nghệ
Trận chiến với Dream Devourer trong Chrono Trigger: Khi lỗi tràn số nguyên trở thành vũ khí
19 tháng 9, 2026