Microsoft: 'Gần như không ai' lấy được bài báo NYT qua chatbot Copilot
Microsoft khẳng định chatbot Copilot của hãng gần như không tái tạo nội dung đáng kể từ các bài báo hay sách, trong hồ sơ pháp lý mới nhất nhằm chống lại các cáo buộc vi phạm bản quyền từ The New York Times và các tác giả. Công ty dẫn dữ liệu từ hơn 8,2 triệu lượt trò chuyện cho thấy chỉ chưa đến 1% phản hồi trùng lặp từ 16 từ trở lên, và lập luận rằng việc sử dụng nội dung có bản quyền trong huấn luyện AI là 'sử dụng hợp pháp' (fair use).

Microsoft vừa đưa ra tuyên bố mạnh mẽ trong cuộc chiến pháp lý về bản quyền với các nhà xuất bản lớn, khẳng định rằng chatbot Copilot của họ "hiếm khi" tái tạo các câu hoàn chỉnh từ bài báo hoặc sách, chứ chưa nói đến việc sao chép các đoạn nội dung quan trọng.
Hình minh họa Microsoft Copilot
Dữ liệu từ hơn 8,2 triệu phiên trò chuyện
Trong hồ sơ pháp lý mới nộp lên tòa án vào cuối tuần qua, Microsoft cho biết đã cung cấp 8,2 triệu bản ghi chat của Copilot cho một chuyên gia do các nhà xuất bản tin tức chỉ định. Theo công ty, những bản ghi này được chọn lọc đặc biệt vì chúng "khớp với các từ khóa liên quan đến việc sử dụng trang web của nguyên đơn" - tức là những phiên trò chuyện có khả năng cao nhất chứa nội dung vi phạm.
Kết quả phân tích cho thấy:
- Chỉ 59.545 phiên chat (chưa đến 1%) chứa ít nhất 16 từ trùng với nội dung tin tức dùng để huấn luyện mô hình AI.
- Một chuyên gia của Trung tâm Báo chí Điều tra (CIR) chỉ tìm thấy 51 trường hợp "trùng lặp đáng kể" với tác phẩm của họ.
- Trong vụ kiện của các tác giả sách, chỉ có 24 phản hồi chứa ít nhất 30 từ trùng khớp.
- Chỉ 10/212 cuốn sách được đánh giá là có bất kỳ sự trùng lặp nào.
Lập luận về "sử dụng hợp pháp"
Microsoft lập luận rằng những con số này củng cố quan điểm của họ rằng việc sử dụng nội dung có bản quyền để huấn luyện AI nên được coi là hợp pháp (fair use). Công ty tuyên bố:
Mặc dù các hệ thống như Copilot dựa vào việc sử dụng tài liệu có bản quyền, nhưng các hệ thống kết quả được sử dụng cho các mục đích khác biệt đáng kể so với bản gốc. Việc chúng thỉnh thoảng tái tạo các đoạn văn bản "khó có thể làm suy yếu mục đích chuyển hóa của việc huấn luyện LLM."
Bối cảnh vụ kiện lớn
Đây là một phần trong cuộc chiến pháp lý do các nhà xuất bản và tác giả khởi kiện chống lại Microsoft và OpenAI. Nguyên đơn cáo buộc hai công ty này đã xây dựng sản phẩm dựa trên tác phẩm của họ và hiện cạnh tranh trực tiếp, một phần bằng cách tái tạo nội dung có bản quyền.
Các khiếu nại từ nhóm nhà xuất bản tin tức và nhóm tác giả sách đã được gộp chung dưới một thẩm phán để đẩy nhanh quá trình xét xử, bất chấp sự phản đối từ phía nguyên đơn. Microsoft nộp hồ sơ này để yêu cầu thẩm phán ra phán quyết tóm tắt (summary judgement), có thể kết thúc vụ kiện ở giai đoạn sớm.
Đáng chú ý, chính quyền Trump cũng vừa nộp một tuyên bố quan tâm trong vụ kiện của NYT vào tuần này, đứng về phía OpenAI. Nếu thẩm phán đứng về phía các nhà xuất bản và tác giả, cuộc chiến pháp lý sẽ tiếp tục kéo dài tại tòa án.
Ý nghĩa đối với người dùng Việt Nam
Vụ kiện này có tác động không nhỏ đến người dùng AI tại Việt Nam, nơi Copilot và ChatGPT đang được sử dụng rộng rãi trong học tập và làm việc. Nếu tòa án ra phán quyết có lợi cho các nhà xuất bản, các công ty AI có thể buộc phải thay đổi cách huấn luyện mô hình hoặc trả phí bản quyền, điều này có thể ảnh hưởng đến chi phí và chất lượng dịch vụ AI mà người dùng cuối đang được hưởng.