Từ kẻ tấn công thành đồng minh: Câu chuyện nghịch lý bảo vệ nghệ sĩ trên nền tảng Cara
Nền tảng chia sẻ ảnh Cara dành cho nghệ sĩ chống AI vừa hứng chịu ba cuộc tấn công quét dữ liệu lớn trong tháng 8. Điều bất ngờ là kẻ đứng sau vụ quét đầu tiên đã hối hận và hợp tác với nhà sáng lập để phát triển công cụ mã nguồn mở Lantern, giúp nghệ sĩ phát hiện tác phẩm của mình bị sử dụng trái phép trong các bộ dữ liệu AI.

Kể từ đầu năm 2023, nhiếp ảnh gia Jingna Zhang cùng đội ngũ tình nguyện viên nhỏ bé đã miệt mài duy trì Cara — một nền tảng mạng xã hội và hồ sơ nghệ thuật dành cho giới sáng tạo. Điều thu hút khoảng 1,5 triệu nghệ sĩ đến với nền tảng này chính là lập trường kiên quyết chống lại việc sử dụng tác phẩm của họ để huấn luyện AI mà không được phép.
Cara không chỉ lọc bỏ hình ảnh do AI tạo ra mà còn trang bị các tính năng bảo vệ như Glaze — công cụ làm nhiễu phong cách hình ảnh để ngăn AI bắt chước. Tuy nhiên, việc ngăn chặn hoàn toàn các đợt quét dữ liệu là điều gần như bất khả thi. Chỉ trong tháng 8 vừa qua, Cara đã phải hứng chịu ba cuộc tấn công quét dữ liệu lớn, khiến chi phí máy chủ tăng vọt và gây hoang mang cho cộng đồng nghệ sĩ vốn đã rời bỏ Instagram vì lo ngại dữ liệu bị khai thác.
Cuộc tấn công đầu tiên và lời thú nhận đầy bất ngờ
Sự việc bắt đầu vào ngày 13/8 khi một tài khoản Reddit tên MandarinDawnPoppy994 đăng tải kho lưu trữ 12 terabyte chứa 12 triệu tác phẩm — gần như toàn bộ thư viện ảnh công khai của Cara — lên diễn đàn r/DefendingAIArt. Kẻ này còn tự hào rằng quá trình quét dữ liệu chỉ tốn chưa đến 10 USD.
Zhang chia sẻ với WIRED: "Chúng tôi biết được sự việc qua việc người dùng tag chúng tôi". Kẻ quét dữ liệu đã "đắc chí và tìm kiếm những người khác cùng tham gia làm điều gì đó với bộ dữ liệu trên Reddit". Cô nhấn mạnh: "Tôi cảm thấy điều này có chủ đích và rất tổn thương" khi luật pháp hiện tại chưa theo kịp để bảo vệ nghệ sĩ khỏi các hành vi thu thập dữ liệu kiểu này.
Làn sóng bắt chước và những cuộc tấn công tiếp nối
Đáng lo ngại hơn, vụ việc đầu tiên đã kéo theo các hành vi "bắt chước" khác. Kẻ thứ hai thu thập khoảng 8,5 triệu liên kết cùng siêu dữ liệu như tên người dùng, tiêu đề, tags từ Cara và đăng tải lên Hugging Face — nền tảng dành cho nhà phát triển AI. Sau khi nhận được hàng loạt yêu cầu gỡ xuống, Hugging Face tuyên bố sẽ thông báo cho người dùng tên "CaptiveDreamer" gỡ siêu dữ liệu cá nhân, nhưng không thể làm điều tương tự với các URL vì "không có bản sao tác phẩm nào được lưu trữ tại đây".
Đến ngày 22/8, kẻ thứ ba thu thập 123.000 hình ảnh từ Cara, cùng với bài đăng văn bản và tiểu sử người dùng chứa thông tin cá nhân, rồi chia sẻ trên trang Academic Torrents. Zhang buộc phải phát động chiến dịch GoFundMe với mục tiêu 120.000 USD cho chi phí pháp lý, nhằm tìm mọi chiến lược bảo vệ Cara thông qua luật an ninh mạng và bản quyền. Đến nay, cô đã quyên góp được hơn 100.000 USD.
Sự thật phũ phàng: Không nền tảng nào an toàn tuyệt đối
Zhang bày tỏ sự bức xúc không chỉ với hành vi quét dữ liệu mà còn với sự hiểu lầm từ cộng đồng: "Chúng tôi đã làm những điều đúng đắn trong giới hạn cho phép mà không làm hỏng trải nghiệm người dùng". Cô nhấn mạnh rằng Cara gần như chắc chắn đã từng bị quét dữ liệu trước đó như bất kỳ trang web nào khác.
"Nếu việc xóa tác phẩm và rời khỏi Cara khiến họ cảm thấy tốt hơn, tôi ủng hộ điều đó. Nhưng tôi không muốn tạo ảo tưởng rằng ở nơi khác họ sẽ an toàn hơn, vì thực tế không phải vậy. Các nền tảng lớn thường bị quét dữ liệu nhiều hơn, điều đó khiến tôi càng lo lắng hơn."
Kẻ tấn công hối cải trở thành đồng minh
Điều bất ngờ nhất trong câu chuyện này là mối quan hệ hợp tác nảy sinh giữa Zhang và kẻ đã khởi đầu cơn bão quét dữ liệu. "Heft" — biệt danh của một sinh viên Bắc Mỹ có nền tảng về phần mềm và đam mê lưu trữ kỹ thuật số — thừa nhận ban đầu việc quét dữ liệu chỉ là một dự án kỹ thuật. Tuy nhiên, sau khi chứng kiến phản ứng đau khổ từ cộng đồng nghệ sĩ, anh đã thay đổi hoàn toàn.
"Heft" tâm sự: "Nhìn lại, việc cố tình nhắm vào Cara và trình bày theo cách tôi đã làm trong bài đăng là tàn nhẫn và thiếu suy nghĩ. Tôi đã bỏ lỡ những hậu quả mà điều này có thể gây ra ngoài việc khiến mọi người tức giận". Anh cho biết mình đã nhận được nhiều lời đe dọa và bị doxing do vụ việc này.
Công cụ Lantern: Tín hiệu hy vọng mới
Từ sự hối cải đó, Heft đã gia nhập máy chủ Discord của Cara với vai trò "người gỡ rối", giải thích cặn kẽ những điểm yếu cấu trúc cho phép quét dữ liệu. Cả hai đang hợp tác phát triển Lantern — công cụ cho phép nghệ sĩ tạo "dấu vân tay một chiều" cho hình ảnh của mình mà không cần lưu trữ chúng trên nền tảng.
Lantern "thường xuyên quét các bộ dữ liệu AI mới được công khai", nếu phát hiện tác phẩm của nghệ sĩ xuất hiện, họ sẽ "nhận được thông báo kèm liên kết để yêu cầu gỡ xuống hoặc nộp đơn khiếu nại vi phạm bản quyền". Điểm đáng chú ý là Lantern là dự án mã nguồn mở, cho phép bất kỳ ai đóng góp vào mã nguồn.
Zhang hy vọng sự việc này sẽ thu hút sự chú ý của các nhà hoạch định chính sách: "Bị tấn công bởi AI sẽ trở nên vô cùng phổ biến". Cô nhấn mạnh rằng hầu hết những kẻ tấn công sẽ không bao giờ xin lỗi, càng không cố gắng sửa sai — điều khiến sự hối cải của Heft và món quà Lantern trở nên đặc biệt quý giá trong bối cảnh pháp lý còn nhiều lỗ hổng.