Amazon hủy sách hiếm để nuôi AI: Dấu hiệu của thời đại khi 'fair use' bị bóp méo
Một cuộc điều tra của 404 Media tiết lộ Amazon mua số lượng lớn sách hiếm, cắt gáy và quét để làm dữ liệu huấn luyện AI, phá hủy hoàn toàn bản in. Bài viết so sánh cách làm tàn nhẫn này với cách tiếp cận bảo tồn của Internet Archive, đồng thời chỉ trích việc Amazon lạm dụng khái niệm 'fair use' để hợp pháp hóa hành vi đánh cắp tri thức.

Amazon hủy sách hiếm để nuôi AI: Khi 'fair use' chỉ là cái cớ cho tham vọng độc quyền tri thức
Một cuộc điều tra gây chấn động từ 404 Media vừa phơi bày một thực tế đáng lo ngại: Amazon đang mua hàng loạt sách in hiếm, cắt bìa và quét toàn bộ nội dung để phục vụ cho việc huấn luyện các mô hình AI — sau đó tiêu hủy hoàn toàn bản gốc. Hành động này không chỉ là sự phá hoại di sản văn hóa mà còn đặt ra câu hỏi lớn về ranh giới đạo đức trong cuộc đua AI khốc liệt hiện nay.
Trong khi Amazon biện minh cho hành vi này bằng khái niệm "fair use" (sử dụng hợp lý), thì cách tiếp cận của Internet Archive — tổ chức phi lợi nhuận chuyên số hóa sách — lại cho thấy một chuẩn mực hoàn toàn khác: số hóa một cách cẩn trọng, tôn trọng giá trị vật lý và lịch sử của từng cuốn sách.
Cuộc điều tra hé lộ quy trình hủy sách của Amazon
Theo 404 Media, các nhà điều tra đã đặt một thiết bị theo dõi bên trong một cuốn sách hiếm mà họ nghi ngờ sẽ bị một công ty AI mua lại. Cuốn sách này đã đi qua nhiều chặng đường trước khi dừng chân tại một kho hàng của Amazon ở Las Vegas, Nevada (mã VGT3).
Tại đây, nhân viên Amazon xác nhận toàn bộ công việc của họ là nhận các lô sách in khổng lồ, cắt bỏ gáy sách để quét nhanh hơn — điều này đồng nghĩa với việc cuốn sách bị phá hủy không thể phục hồi. Logo của đội ngũ này thậm chí còn là hình ảnh một con khủng long đang nhe răng với cuốn sách trên tay, như một sự mỉa mai đầy ám ảnh.
Những cuốn sách bị mua không phải là các ấn bản phổ thông. Chúng là sách hiếm, có thể chỉ còn vài bản trên toàn thế giới, hoặc là sách nước ngoài mà rất ít người đọc. Một người bán sách chia sẻ: "Có nhiều loại giá trị khác nhau. Giá trị tiền bạc, lịch sử, trí tuệ, tình cảm... Các công ty AI không quan tâm đến những điều đó. Họ chỉ muốn nội dung như một chuỗi từ ngữ."
Tương phản với Internet Archive: Số hóa mà không hủy hoại
Câu chuyện trở nên đáng suy ngẫm hơn khi so sánh với cách làm của Internet Archive — tổ chức do Brewster Kahle thành lập năm 1996 với sứ mệnh "cung cấp truy cập phổ quát đến mọi tri thức".
Internet Archive vận hành các trung tâm số hóa với máy móc và phần mềm được tùy chỉnh riêng, nơi các kỹ thuật viên (gọi là "script operator") cẩn thận lật từng trang sách để chụp lại. Phương pháp này chậm hơn và tốn kém hơn so với cách cắt gáy, nhưng đảm bảo không bao giờ phá hủy cuốn sách gốc.
Tổ chức này công khai tuyên bố: "Tại Internet Archive, chúng tôi không bao giờ hủy hoại một cuốn sách bằng cách cắt bìa. Thay vào đó, chúng tôi số hóa theo cách khó khăn nhất — từng trang một."
Điều này tạo nên một sự tương phản rõ rệt: một bên là gã khổng lồ công nghệ với nguồn lực vô hạn nhưng chọn giải pháp hủy diệt, một bên là tổ chức phi lợi nhuận với ngân sách hạn hẹp nhưng đặt giá trị bảo tồn lên hàng đầu.
'Fair use' — hay chỉ là ngụy biện cho hành vi trộm cắp trí tuệ?
Điều đáng lo ngại nhất không chỉ nằm ở việc phá hủy vật lý, mà còn ở cách Amazon và các công ty AI khác sử dụng khái niệm "fair use" như một tấm khiên pháp lý. Việc quét toàn bộ sách có bản quyền để huấn luyện AI thương mại — trong đó có dòng mô hình Nova bị đánh giá kém chất lượng — là một hành vi đánh cắp sở hữu trí tuệ ở quy mô khổng lồ.
Rõ ràng, việc chi hàng tỷ đô la cho "bong bóng AI" trong khi lựa chọn phá hủy di sản tri thức của nhân loại là một quyết định có chủ đích. Giống như việc xây dựng các nhà máy nhiên liệu hóa thạch thay vì đầu tư vào năng lượng hạt nhân hay tái tạo, giống như việc tung ra thị trường những sản phẩm chưa sẵn sàng, hay thiết lập các kế hoạch tài chính phức tạp để thao túng tăng trưởng — tất cả đều là những lựa chọn.
Bài học cho cộng đồng AI Việt Nam
Câu chuyện này đặt ra một bài học quan trọng cho các startup và nhà phát triển AI tại Việt Nam: dữ liệu huấn luyện chất lượng không đến từ sự hủy diệt. Việc xây dựng bộ dữ liệu cần tôn trọng bản quyền, hợp tác với các nhà xuất bản, thư viện và tác giả để có được nguồn dữ liệu hợp pháp, thay vì chạy theo lối tắt phá hoại.
Sự khác biệt giữa Amazon và Internet Archive không chỉ là về kỹ thuật, mà còn là về triết lý phát triển. Một bên coi tri thức như nguyên liệu thô cần khai thác cạn kiệt, bên kia coi tri thức là tài sản chung cần được bảo tồn cho các thế hệ tương lai. Trong cuộc đua AI toàn cầu, câu hỏi không chỉ là "chúng ta có thể làm gì" mà còn là "chúng ta nên làm gì" — và Amazon vừa cho chúng ta một câu trả lời đáng buồn.