AI lớn và bài toán nội dung: Lấy công sức, giữ lại tiền
Các ông lớn AI ngày càng lộ rõ cách làm ăn: thu thập sách, báo, ảnh, mã nguồn và mọi thứ trên internet để huấn luyện mô hình mà không trả tiền hay tuân thủ giấy phép. Những tài liệu tòa án mới được công bố cho thấy chính nội bộ Microsoft và OpenAI cũng thừa nhận đây là vòng xoáy hủy diệt chuỗi cung ứng nội dung. Câu hỏi đặt ra: ai thực sự được hưởng lợi từ làn sóng AI này?

AI lớn và bài toán nội dung: Lấy công sức, giữ lại tiền
Các ông lớn AI ngày càng lộ rõ cách làm ăn: thu thập sách, báo, ảnh, mã nguồn và mọi thứ trên internet để huấn luyện mô hình mà không trả tiền hay tuân thủ giấy phép. Những tài liệu tòa án mới được công bố cho thấy chính nội bộ Microsoft và OpenAI cũng thừa nhận đây là vòng xoáy hủy diệt chuỗi cung ứng nội dung. Câu hỏi đặt ra: ai thực sự được hưởng lợi từ làn sóng AI này?
Minh họa về AI và nội dung
Vấn đề cốt lõi: AI cần nội dung của người khác để tồn tại
Các công ty AI lớn buộc phải "nuốt" công sức của người khác để huấn luyện mô hình ngôn ngữ lớn (LLM). Đó là sách, bài báo, ảnh, mã nguồn, website, và gần như mọi thứ tồn tại trên internet. Chúng ta đều biết điều này. Điều chúng ta cũng biết là các công ty AI rất ghét phải trả tiền cho những nội dung đó, ghét tuân thủ giấy phép đi kèm, và càng không muốn chia sẻ doanh thu với những người đã tạo ra chúng.
Cách làm ăn mặc định của Big AI từ lâu là: "Cứ lấy đã, chuyện hợp pháp tính sau." Gần đây, cách làm này càng lộ liễu hơn bao giờ hết.
Tài liệu tòa án hé lộ sự thật bên trong Microsoft và OpenAI
Hãy nhìn vào cuộc chiến bản quyền giữa The New York Times với OpenAI và Microsoft. Theo báo cáo của 404 Media về các tài liệu tòa án mới được bỏ niêm phong, phía nguyên đơn cáo buộc Microsoft biết rõ mình đang làm gì khi "nhập khẩu" internet một cách bừa bãi.
Đáng chú ý, Tiến sĩ Brent Hecht — Giám đốc Khoa học Ứng dụng của Microsoft — được trích dẫn trong bản tóm tắt lập luận của phía nhà báo rằng vụ việc liên quan đến "một vụ trộm cắp đáng kinh ngạc với quy mô chưa từng có", thậm chí có thể là "vụ trộm lao động lớn nhất trong lịch sử loài người".
Đây không phải nhận xét của giới truyền thông, mà là lời của một nhân viên cấp cao chính Microsoft.
Không chỉ Hecht. Trong một văn bản chính sách nội bộ của Microsoft cũng được trích dẫn tại tòa, những người soạn thảo thừa nhận rằng AI tạo sinh có thể "phá vỡ đáng kể việc làm của chính những người đã tạo ra dữ liệu huấn luyện mô hình nền tảng [bởi vì] LLM là sản phẩm tự hủy hoại chuỗi cung ứng của chính nó." Điều đó dẫn đến sự sụp đổ của mô hình — hay còn gọi là model collapse.
Nói cách khác, AI đang giết chính con ngỗng đẻ trứng vàng mang tên nội dung chất lượng.
OpenAI và giấy phép trả tiền: "Không cần thiết"
Theo hồ sơ tòa án, đại diện doanh nghiệp của OpenAI đã tuyên thệ rằng LLM của họ sẵn sàng "hút" tác phẩm của người khác ngay cả khi chúng được bảo vệ bởi tường phí. Vị đại diện này nói họ không biết về "bất kỳ nỗ lực nào nhằm phát hiện nội dung sau tường phí trong tập dữ liệu huấn luyện" hay "loại bỏ nội dung sau tường phí khỏi tập dữ liệu huấn luyện".
Khi đồng sáng lập OpenAI là Greg Brockman được thông báo rằng OpenAI có thể vượt qua tường lửa, ông được cho là đã đáp: "ah, ngon."
Dù những phát biểu này có đại diện cho thái độ chung hay không, một điều chắc chắn: các chính sách như vậy cuối cùng sẽ quay lại cắn chính những nhà sản xuất LLM. Chúng đã và đang ảnh hưởng tiêu cực đến thị trường báo chí, viết tiểu thuyết, thiết kế đồ họa — bất cứ lĩnh vực nào đòi hỏi con người phải được trả tiền cho công sức sáng tạo thực sự.
Vấn đề với mã nguồn do AI tạo ra
Big AI cũng áp dụng cách tiếp cận tương tự với các công cụ sinh mã. Tòa Phúc thẩm Liên bang số 9 của Mỹ gần đây đã cho GitHub, Microsoft và OpenAI thắng một phần trong vụ kiện Doe v. GitHub. Tòa cho rằng nguyên đơn chưa đủ căn cứ theo một điều khoản cụ thể của Đạo luật Bản quyền Thiên niên kỷ Kỹ thuật số (DMCA).
Thẩm phán Eric Miller viết: "Người tạo ra tác phẩm mới mà không bao gồm thông tin quản lý bản quyền (CMI) không thể bị coi là đã 'xóa' hay 'sửa đổi' bất cứ thứ gì."
Tuy nhiên, phán quyết này không có nghĩa là GitHub Copilot hay bất kỳ mô hình lập trình nào được phép huấn luyện trên mọi dự án mã nguồn mở mà không bị ràng buộc. Nó không xác định rằng việc sao chép mã nguồn vào tập huấn luyện luôn là sử dụng hợp lý. Và nó chắc chắn không bãi bỏ các giấy phép GPL, Apache, BSD hay MIT.
Mã nguồn mở không đồng nghĩa với "muốn làm gì thì làm". Nhưng với AI, nó có vẻ như vậy.
Vấn đề nằm ở chỗ: một lập trình viên nhận gợi ý từ Copilot rất khó — thậm chí không thể — kiểm tra xem đoạn mã đó có bị ràng buộc bởi GPL không, hay đoạn trích từ thư viện có thuộc Apache không. Và như lời một nhân viên OpenAI đã nói: người dùng không bao giờ bấm vào đường link. Trong các pipeline lập trình có AI, đôi khi còn chẳng có link nào để bấm.
Vòng xoáy "lấy hết, trả chẳng bao nhiêu"
Một luật sư bạn của tác giả — người rất am hiểu mã nguồn mở — lo ngại về xu hướng rộng hơn: ngày càng nhiều vụ kiện đang tranh tụng giấy phép mã nguồn mở như hợp đồng thay vì như giấy phép sở hữu trí tuệ mà chúng vốn được viết ra để làm.
Cách tiếp cận theo lý thuyết hợp đồng cho phép nguyên đơn né tránh những câu hỏi cốt lõi mà luật bản quyền buộc phải trả lời: Bạn có sở hữu tác phẩm không? Nó có phải là biểu đạt được bảo hộ không? Nó có thực sự bị sao chép không?
"Những câu hỏi đó là nền tảng mà mọi giấy phép được xây dựng trên đó. Giấy phép mã nguồn mở là sự cho phép sử dụng tài sản trí tuệ của người khác."
Với AI trong cuộc chơi, vấn đề này sẽ sớm trở thành một trong những rắc rối sở hữu trí tuệ mà lập trình viên ghét, doanh nghiệp muốn tránh, nhưng tòa án buộc phải giải quyết — với đội ngũ luật sư đắt đỏ khiến ngay cả các triệu phú AI cũng phải lo lắng về mức phí theo giờ.
Nói cho cùng, sự bất định về sở hữu trí tuệ không phải là vấn đề giấy tờ nhỏ. Đó là vấn đề an ninh và tuân thủ chuỗi cung ứng. Nếu bạn dùng mã do AI tạo ra, bạn có thể đang đưa vào phần mềm của mình những nghĩa vụ pháp lý không xác định. Nếu bạn là lập trình viên mã nguồn mở, công việc của bạn có thể đang bị dùng để cải thiện một dịch vụ độc quyền trả về mã không có nguồn gốc, không ghi công, không có sự đối ứng ý nghĩa.
Cú twist mới: Kiện độc quyền nhóm
Gần đây còn có một diễn biến mới: một vụ kiện chống độc quyền liên bang nhắm vào Anthropic, OpenAI, SpaceXAI và Google. Các nguyên đơn cáo buộc những công ty này đã phối hợp để làm chậm sự phát triển của các hệ thống AI tiên tiến.
Vụ kiện chỉ ra những phát biểu công khai của các lãnh đạo AI — tất cả đều kêu gọi phối hợp để "điều chỉnh nhịp độ" phát triển AI tiên phong trong cùng một cuối tuần. CEO Anthropic Dario Amodei đã lập luận ủng hộ phối hợp toàn ngành để làm chậm phát triển tiên phong. CEO OpenAI Sam Altman, đồng sáng lập Google DeepMind Demis Hassabis và Elon Musk cũng đã công khai bày tỏ quan điểm tương tự rằng các hệ thống AI mạnh cần được kiểm soát và triển khai cẩn trọng.
Nghe qua thì có vẻ hợp lý. An toàn AI là vấn đề thực sự. Nhưng có sự khác biệt rất lớn giữa việc tất cả các ông lớn AI đồng ý với nhau về tốc độ phát triển thị trường — và việc họ quyết định ai được cạnh tranh, được xây dựng cái gì, và khi nào được xây dựng.
Các công ty Big AI đều tỏ ra như người tốt, trong khi đồng thời bóp nghẹt các đối thủ nhỏ hơn.
Tất nhiên, để thắng kiện, nguyên đơn cần nhiều hơn là những trích dẫn về an toàn AI. Luật chống độc quyền đòi hỏi bằng chứng về thỏa thuận và thiệt hại thực tế cho cạnh tranh. Và ngay cả khi thắng, liệu có gì thay đổi? Những vụ thắng kiện chống độc quyền gần đây với Google và mảng quảng cáo của họ cho thấy kết quả thực tế thường rất nhạt nhòa.
Mô hình chung: Câu trả lời luôn có lợi cho Big AI
Bạn có thấy mô hình ở đây không?
- Khi người sáng tạo phản đối, họ được bảo rằng huấn luyện là sử dụng hợp lý.
- Khi lập trình viên phản đối, họ được bảo rằng mã do AI tạo ra là mã mới.
- Khi đối thủ phản đối, họ được bảo rằng an ninh đòi hỏi các công ty lớn nhất phải phối hợp.
Thật thú vị khi câu trả lời luôn để Big AI giữ dữ liệu, giữ thị trường và giữ tiền.
Vấn đề trung tâm không phải là liệu AI có nên được phép phát triển hay không. Nó sẽ phát triển. Vấn đề là liệu những công ty xây dựng nó có được phép coi công sức của tất cả mọi người khác như nguồn nguyên liệu miễn phí, rồi dùng sản phẩm tạo ra để lấy đi lưu lượng, doanh thu và quyền thương lượng của chính những người sáng tạo hay không.
Điều này có ý nghĩa gì với Việt Nam?
Với độc giả và cộng đồng công nghệ Việt Nam, câu chuyện này không hề xa vời. Các startup và lập trình viên Việt Nam ngày càng dùng nhiều công cụ AI sinh mã như GitHub Copilot hay các trợ lý lập trình khác. Việc thiếu minh bạch về nguồn gốc và giấy phép của mã do AI tạo ra có thể đưa những rủi ro pháp lý không ngờ vào sản phẩm — đặc biệt khi làm việc với khách hàng quốc tế khó tính về tuân thủ.
Các nhà sáng tạo nội dung, báo chí và thiết kế Việt Nam cũng đang đối mặt với làn sóng nội dung do AI tạo ra, khiến lưu lượng truy cập và giá trị công việc sáng tạo bị xói mòn. Việc theo dõi sát các vụ kiện tại Mỹ không chỉ là chuyện "ở bên kia bán cầu" — nó định hình luật chơi toàn cầu mà các doanh nghiệp Việt Nam sẽ buộc phải tuân theo.
Nếu chúng ta không sớm đặt ra ranh giới rõ ràng cho cuộc "đổ bộ" của Big AI, sẽ chỉ có một nhóm nhỏ tỷ phú thực sự hưởng lợi, còn phần còn lại của chúng ta có nguy cơ trở thành những tá điền trong một hệ thống phong kiến hậu công nghệ của thế kỷ 21.