Amazon bí mật mua sách quý hiếm, cắt gáy và quét để huấn luyện AI

17 tháng 8, 2026·2 phút đọc

Theo điều tra của 404 Media, Amazon đang mua hàng loạt sách quý hiếm, cắt bỏ gáy và số hóa chúng để làm dữ liệu huấn luyện cho các mô hình AI. Sách cổ và ấn bản ngừng in trở thành nguồn dữ liệu vàng khi các mô hình ngôn ngữ lớn đã "nạp" gần hết văn bản công khai trên internet, đồng thời giúp tránh nguy cơ sụp đổ mô hình do dữ liệu do chính AI sinh ra.

Amazon bí mật mua sách quý hiếm, cắt gáy và quét để huấn luyện AI

Amazon, hãng khởi nghiệp từ việc bán sách trực tuyến, hiện đang bị phát hiện mua số lượng lớn sách quý hiếm, sau đó cắt rời gáy và quét toàn bộ nội dung để phục vụ cho việc huấn luyện trí tuệ nhân tạo.

Theo báo cáo từ 404 Media, một thiết bị theo dõi được giấu bên trong một cuốn sách quý hiếm và chuyển đến cơ sở của Amazon tại Las Vegas. Cơ sở này, mang mã định danh VGT3, được nhận diện qua logo một chú khủng long đang cầm cuốn sách trên móng vuốt.

Khi được yêu cầu bình luận, Amazon xác nhận: “Chúng tôi mua sách thông qua các kênh thương mại nhằm cải thiện các sản phẩm và dịch vụ mà khách hàng đang sử dụng.”

Vì sao sách quý hiếm trở thành "mỏ vàng" dữ liệu?

Các công ty công nghệ lớn cần một lượng văn bản khổng lồ để huấn luyện mô hình ngôn ngữ lớn (LLM). Hiện tại, họ gần như đã khai thác cạn kiệt nguồn văn bản công khai trên internet. Trong bối cảnh đó, sách cổ, ấn bản ngừng in hoặc những cuốn sách hầu như không tồn tại trên web trở thành miền đất mới đầy tiềm năng.

Điểm đặc biệt quan trọng: hầu hết sách xuất bản trước năm 2022 đều được viết bởi con người, không hề có sự can thiệp của AI sinh tạo.

Nguy cơ "sụp đổ mô hình" (Model Collapse)

Việc dùng dữ liệu do AI tạo ra để huấn luyện AI tiếp theo là một cạm bẫy nguy hiểm.

Khi mô hình ngôn ngữ huấn luyện trên quá nhiều văn bản do AI sinh ra, chất lượng đầu ra có thể bị suy giảm nghiêm trọng — hiện tượng này được gọi là "model collapse".

Do đó, việc tìm kiếm nguồn dữ liệu nguyên bản từ sách giấy truyền thống là chiến lược quan trọng để giữ cho các mô hình AI duy trì chất lượng cao.

Góc nhìn cho độc giả Việt Nam

Tại Việt Nam, nhiều thư viện số và nhà xuất bản cũng đang sở hữu khối lượng lớn sách quý hiếm, văn bản Hán-Nôm hoặc tài liệu địa phương chưa được số hóa. Nếu xu hướng này lan rộng, các công ty AI trong nước hoàn toàn có thể tìm đến những nguồn tư liệu này để làm giàu dữ liệu huấn luyện, thay vì phụ thuộc vào dữ liệu tiếng Anh có sẵn.

Tuy nhiên, câu chuyện này cũng đặt ra bài toán về bản quyền và đạo đức: việc tiêu hủy sách hiếm để phục vụ AI có thể đồng nghĩa với việc đánh mất những di sản văn hóa quan trọng của nhân loại.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗