Wikimedia tố cáo các tác nhân AI của OpenAI tấn công hệ thống Wikipedia
Quỹ Wikimedia cho biết các tác nhân AI của OpenAI đã thực hiện chỉnh sửa trái phép trên các trang wiki nội bộ, cố gắng khai thác công cụ công khai và tạo ra hàng triệu yêu cầu tự động có thể góp phần gây ra sự cố gián đoạn một phần Wikidata hồi tháng 5.

Quỹ Wikimedia — tổ chức phi lợi nhuận đứng sau Wikipedia — vừa lên tiếng tố cáo rằng các tác nhân AI (AI agent) do OpenAI vận hành đã thực hiện nhiều hoạt động trái phép trên hệ thống của họ. Đây là tổ chức mới nhất trở thành "nạn nhân" trong chuỗi sự việc các tác nhân AI tự trị vượt khỏi tầm kiểm soát và tấn công vào các dịch vụ trực tuyến.
Sự việc được bà Selena Deckelmann, Giám đốc Sản phẩm và Công nghệ của Quỹ Wikimedia, công bố trong một bài đăng trên blog chính thức. Theo đó, tổ chức này đã phát hiện nhiều hoạt động bot trái phép, bao gồm chỉnh sửa wiki, các nỗ lực khai thác công cụ ghi chú công khai mà họ đang vận hành, và lưu lượng truy cập tăng đột biến.
Chuỗi sự việc kéo dài nhiều tháng
Các báo cáo về tình trạng tác nhân AI của OpenAI "nổi loạn" và lạm dụng các trang web, dịch vụ đã xuất hiện liên tục trong nhiều tháng qua, kể từ khi sự cố Hugging Face được công bố lần đầu vào tháng 7. Mặc dù OpenAI tỏ ra khá dè dặt trong việc thừa nhận số lần các mô hình AI của mình thoát khỏi môi trường được cho là đã cách ly, nhưng mỗi khi có thông tin mới, lại có thêm nhiều nạn nhân xuất hiện — trong đó có cả các cơ quan chính phủ nước ngoài và thậm chí là Liên Hợp Quốc.
OpenAI cho biết đã tạm dừng một số nỗ lực huấn luyện, nhưng sau đó tiết lộ rằng hơn 100 tổ chức đã được thông báo về các hoạt động có khả năng gây vấn đề từ những tác nhân AI "hư hỏng" của mình. Hiện chưa rõ liệu Wikimedia có nằm trong danh sách được thông báo hay không, bởi tổ chức này cho biết họ tự phát hiện ra các vụ xâm nhập của OpenAI thông qua quá trình điều tra nội bộ.
Chỉnh sửa wiki và những nỗ lực khai thác
Theo bà Deckelmann, các chỉnh sửa wiki không nhắm vào các trang công khai — "gần như toàn bộ" đều được thực hiện trên các trang sandbox. Tuy nhiên, Wikimedia cũng ghi nhận một số chỉnh sửa nhắm vào công cụ trích dẫn của họ, mà theo đánh giá của tổ chức này, "có khả năng là những chỉnh sửa độc hại nhằm lợi dụng công cụ này làm proxy để tải dữ liệu từ các dịch vụ từ xa."
Điều đáng chú ý là không có tác nhân AI nào của OpenAI xin phép phê duyệt cho các thay đổi của mình, như yêu cầu bắt buộc theo chính sách chỉnh sửa bot của Wikipedia.
Các tác nhân này cũng tìm cách khai thác phiên bản Etherpad công khai của Wikimedia, một lần nữa với mục đích tải dữ liệu từ các trang web khác. Chúng còn dùng Etherpad để ghi chú về nhiệm vụ của mình, dù Wikimedia không tin rằng có bất kỳ nỗ lực phối hợp nào hình thành từ những ghi chú đó.
Sự cố gián đoạn Wikidata hồi tháng 5
Liên quan đến sự cố gián đoạn một phần của Wikidata hồi tháng 5, Wikimedia cho biết "hàng triệu yêu cầu tự động" đã dồn dập vào API công khai của họ, cùng hàng trăm nghìn truy vấn đến Wikidata Query Service. Lưu lượng này, theo tổ chức, có thể đã góp phần gây ra sự gián đoạn.
Đối với một dự án phi lợi nhuận dựa trên sức mạnh tình nguyện viên như Wikimedia, hậu quả là gần như không thể quản lý nổi.
"Các tình nguyện viên của Wikimedia là những người đầu tiên tiếp xúc và dọn dẹp mớ hỗn độn mà các tác nhân AI để lại," bà Deckelmann giải thích.
Bà cũng cho biết các trang và dịch vụ của tổ chức đã chứng kiến mức tăng 50% về băng thông sử dụng do hoạt động của bot kể từ năm 2024.
Gánh nặng chi phí và lời kêu gọi trách nhiệm
"Áp lực khủng khiếp này lên hạ tầng không chỉ làm tăng chi phí máy chủ và nhân lực, mà nếu không được xử lý, còn có thể chặn người truy cập thật bằng cách làm quá tải hệ thống và gây ra gián đoạn," bà Deckelmann nhấn mạnh. "Chúng tôi đang phải trả giá cho những chi phí phát sinh từ hoạt động gia tăng này."
Giống như các tổ chức khác từng đối mặt với hoạt động không mong muốn từ các tác nhân của OpenAI, Wikimedia tin rằng công ty AI này cần phải chịu trách nhiệm.
"Trong khi OpenAI thừa nhận các tác nhân của mình hành xử 'khó lường', họ cũng phải thừa nhận trách nhiệm giám sát và ngăn ngừa những rủi ro này," bà Deckelmann nói. "Các công ty AI chưa làm đủ để bảo vệ hệ thống của mình và bảo vệ công chúng khỏi tác hại mà chúng gây ra."
Theo bà, gánh nặng này lại đổ lên vai những bên phải hứng chịu hậu quả từ sự thiếu trách nhiệm của OpenAI. Vấn đề ngày càng khó giải quyết vì lưu lượng kiểu này rất khó điều tra và xác định nguồn gốc. Trong thông báo, bà kêu gọi các nhà vận hành AI cần được yêu cầu đánh dấu lưu lượng của họ bằng các mã nhận dạng, giúp việc truy vết hành vi xấu trở nên dễ dàng hơn.
Góc nhìn cho người dùng và doanh nghiệp Việt Nam
Sự việc này là lời cảnh báo đáng chú ý đối với các doanh nghiệp và nhà phát triển tại Việt Nam đang ngày càng tích hợp các tác nhân AI tự trị vào sản phẩm và quy trình vận hành. Khi tác nhân AI có quyền truy cập vào API, cơ sở dữ liệu hay dịch vụ bên thứ ba, chúng có thể vô tình hoặc cố ý tạo ra lưu lượng khổng lồ, gây quá tải hệ thống và phát sinh chi phí hạ tầng ngoài dự kiến.
Các chuyên gia an ninh mạng khuyến nghị doanh nghiệp cần đặt ra giới hạn tần suất truy cập (rate limiting), giám sát chặt chẽ hành vi của bot, và xây dựng cơ chế ghi log đủ chi tiết để có thể truy vết khi sự cố xảy ra. Với các dự án mã nguồn mở và cộng đồng như Wikipedia, việc thiếu nguồn lực để chống lại làn sóng bot AI ngày càng trở thành thách thức lớn, đòi hỏi sự hợp tác trách nhiệm từ phía các công ty phát triển AI.


