Dịch vụ tìm kiếm khuôn mặt để lộ hơn 9 triệu ảnh nhạy cảm của người dùng

19 tháng 8, 2026·6 phút đọc

ClarityCheck, một công cụ tìm kiếm thông tin cá nhân, đã để lộ hơn 9 triệu tệp ảnh — bao gồm cả khuôn mặt của người lớn, thanh thiếu niên và trẻ em — trên một kho lưu trữ Amazon S3 không được bảo vệ. Ngoài ra, một lỗ hổng API khác cũng cho phép bất kỳ ai tra cứu email, địa chỉ và số điện thoại chỉ bằng cách nhập tên. Sự cố này làm dấy lên lo ngại nghiêm trọng về quyền riêng tư của dữ liệu sinh trắc học và rủi ro bị lạm dụng bởi AI.

Dịch vụ tìm kiếm khuôn mặt để lộ hơn 9 triệu ảnh nhạy cảm của người dùng

Dịch vụ tìm kiếm khuôn mặt để lộ hơn 9 triệu ảnh nhạy cảm của người dùng

Một công cụ tra cứu thông tin cá nhân có tên ClarityCheck tự quảng cáo rằng dịch vụ tìm kiếm ảnh ngược của họ “riêng tư và bảo mật”, nhưng nghiên cứu mới cho thấy công ty này đã để lộ hơn 9 triệu tệp ảnh — bao gồm cả khuôn mặt của người dùng — trên một kho lưu trữ đám mây công khai. Không chỉ vậy, một lỗ hổng API thứ hai cũng khiến email, số điện thoại và địa chỉ của nhiều người bị phơi bày.

Hàng triệu bức ảnh khuôn mặt bị phơi bày trên kho lưu trữ không an toàn

Theo phát hiện của nhà nghiên cứu bảo mật độc lập Jeremiah Fowler, cơ sở dữ liệu bị lộ của ClarityCheck chứa khoảng 450 GB hình ảnh — bao gồm ảnh hồ sơ, ảnh chụp màn hình và nhiều bức ảnh khác của người lớn, thanh thiếu niên và trẻ em. Toàn bộ dữ liệu được lưu trữ trong một Amazon S3 bucket không có xác thực, với các thư mục mang tên “faces” và “profiles”. Bất kỳ ai truy cập Internet đều có thể xem được thông qua một URL xuất hiện ngay trong mã nguồn công khai của trang web ClarityCheck.

ClarityCheck là một trong số các công cụ “tìm người” (people-finder) xuất hiện trong những năm gần đây. Các trang web này quảng cáo khả năng tìm kiếm qua web, hồ sơ công khai và các cơ sở dữ liệu khác để xác định danh tính một cá nhân. Trang tìm ảnh của ClarityCheck tuyên bố có thể “xác định bất kỳ ai trong một bức ảnh” và tìm hồ sơ mạng xã hội “trong vài giây”.

Dữ liệu nhạy cảm bị để lộ trong nhiều tháng

Mặc dù ClarityCheck đã bảo vệ cơ sở dữ liệu hình ảnh sau khi WIRED liên hệ vào tháng 7, Fowler cảnh báo rằng lượng dữ liệu này đã bị lộ trong nhiều tháng và những nỗ lực ban đầu của ông để thông báo cho công ty đã thất bại. Việc lộ dữ liệu tình cờ luôn gây rủi ro — nhưng đặc biệt nguy hiểm với dữ liệu sinh trắc học như khuôn mặt, vì chúng không thể thay đổi và cực kỳ nhạy cảm.

“Nếu bạn đang cố tìm hiểu một người là ai, bạn có thể không có sự cho phép, vì vậy mọi người có thể không biết rằng hình ảnh của họ đã bị đưa vào cơ sở dữ liệu công khai này. Một bot AI có thể quét dữ liệu, trích xuất khuôn mặt và dùng chúng để huấn luyện. Và có rất nhiều ảnh trẻ em trong đó.” — Jeremiah Fowler, nhà nghiên cứu bảo mật độc lập

Quan điểm của ClarityCheck: “Không chấp nhận” mô tả dữ liệu bị lộ

Trong tuyên bố gửi tới WIRED, người phát ngôn của ClarityCheck cho biết họ đánh giá cao nỗ lực của Fowler và đã “hành động ngay lập tức để hạn chế truy cập”. Tuy nhiên, công ty bác bỏ việc gọi dữ liệu là “phơi bày công khai”, với lý do rằng “một người bình thường” sẽ không tìm thấy nó, vì để truy cập cần biết URL cụ thể không được lập chỉ mục trên công cụ tìm kiếm.

Quan điểm này trái ngược với chuẩn mực ngành bảo mật. Văn phòng Chính phủ Mỹ và cộng đồng an ninh mạng đều coi dữ liệu là “bị lộ” nếu nó có thể truy cập được bởi những người không được phép — đặc biệt khi nó nằm trên Internet mở mà không yêu cầu xác thực. Mark Beare, người đứng đầu mảng sản phẩm tiêu dùng tại Malwarebytes, giải thích:

“Lộ lọt là trạng thái dữ liệu cá nhân hoặc nhạy cảm bị để ở trạng thái có thể truy cập, khám phá, hoặc có nguy cơ bị truy cập trái phép — dù chưa ai thực sự lấy hoặc lạm dụng nó. Một bản sao lưu cơ sở dữ liệu có thể truy cập công khai, một bucket lưu trữ cấu hình sai, hoặc thông tin xác thực nằm đó cho nhà nghiên cứu thấy đều là lộ lọt.”

Lỗ hổng API: Tra cứu email, số điện thoại chỉ bằng cách nhập tên

Ngoài kho ảnh, ClarityCheck còn cấu hình sai API đến mức bất kỳ ai sử dụng trình duyệt thông thường đều có thể thao tác URL trên trang web để xem dữ liệu cá nhân. Chỉ cần nhập tên, hệ thống trả về nhiều địa chỉ email, địa chỉ vật lý và số điện thoại của những người trùng tên. Các URL này cũng đã được bảo mật sau khi WIRED liên hệ. ClarityCheck giải thích rằng các thông tin hiển thị “được lấy từ dữ liệu công khai và các nhà cung cấp dữ liệu bên thứ ba có giấy phép.”

Ảnh khuôn mặt của phóng viên WIRED được xác định trực tiếp

Khi một phóng viên WIRED thử nghiệm hệ thống bằng ảnh khuôn mặt của chính mình, trang web tiến hành “quét các đặc điểm khuôn mặt” và “lập bản đồ hình học khuôn mặt độc đáo” trước khi truy xuất một báo cáo với tên đầy đủ, địa chỉ, lịch sử vị trí, các lần xuất hiện công khai, ảnh, video, hồ sơ mạng xã hội — và thậm chí cả “hồ sơ hẹn hò ẩn” (nhưng phải trả phí). Báo cáo cuối cùng đã nêu đúng tên phóng viên, kèm tiểu sử và nhiều liên kết đến ảnh của họ trên Internet.

Bài học cho người dùng và lời cảnh báo về AI

Sự cố ClarityCheck không phải là trường hợp cá biệt — tình trạng cấu hình sai và lộ dữ liệu đang ngày càng phổ biến. Nhưng khi các nền tảng số cung cấp nhiều khả năng tự động thu thập và phân tích dữ liệu nhạy cảm, rủi ro cũng lớn hơn theo cấp số nhân. Rebecca Williams, giám đốc chiến lược về quyền riêng tư và quản trị dữ liệu tại ACLU, nhận định:

“Các hệ thống dựa vào thông tin cá nhân cực kỳ nhạy cảm để xác minh danh tính sẽ luôn mang những rủi ro này, kể cả khi có biện pháp giảm thiểu dữ liệu và bảo mật mạnh hơn, bởi bản thân mô hình kinh doanh phụ thuộc vào việc thu thập dữ liệu nhạy cảm.”

Cảnh báo cuối cùng dành cho người dùng: ảnh khuôn mặt của bạn trên mạng có thể bị thu thập bởi các dịch vụ tương tự, và không ai đảm bảo rằng dữ liệu đó được bảo mật đúng cách. Với sự phát triển của AI tạo sinh, khuôn mặt của bạn có thể bị dùng cho mục đích giả mạo mà bạn không hề hay biết.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗