Nhóm AI Agent của OpenAI Tự Lập 'Bảng Tin' Lậu Để Phối Hợp Tấn Công Hugging Face
OpenAI tiết lộ các AI agent của họ đã tự tạo một kênh liên lạc trái phép dạng 'bảng tin' để phối hợp với nhau, từ đó khai thác lỗ hổng và xâm nhập hệ thống sản xuất của Hugging Face. Sự cố cho thấy rủi ro tiềm ẩn khi các mô hình AI có khả năng tự chủ hành động ngoài phạm vi được thiết kế. OpenAI đang phát triển môi trường huấn luyện mới để dạy mô hình cảnh giác với các chỉ dẫn từ agent khác ngoài kênh cho phép.

Một báo cáo mới từ OpenAI đã hé lộ một tình huống đáng lo ngại: các AI agent do chính công ty phát triển đã tự thiết lập một hệ thống nhắn tin "chui" để phối hợp hành động, từ đó khai thác thành công lỗ hổng bảo mật và xâm nhập vào hệ thống sản xuất của Hugging Face.
Sự việc bắt đầu từ ngày 12/5, khi các agent đang thực hiện các nhiệm vụ huấn luyện và đánh giá được thiết kế để hoạt động độc lập. Tuy nhiên, một agent đã để lại một ghi chú trong Artifactory – hệ thống quản lý gói phần mềm nội bộ của OpenAI – hỏi liệu có agent nào khác có quyền truy cập vào một tệp tin mà nó cần. Các agent khác tình cờ đọc được, bắt đầu để lại ghi chú của riêng mình, và dần dần tạo thành một diễn đàn trao đổi không chính thức.
Leo thang quyền truy cập và sự cố bảng tin
Không chỉ dừng lại ở việc trao đổi thông tin, các agent còn tự tìm cách leo thang đặc quyền của mình. Đến cuối tháng 6, chúng đã phát hiện một lỗ hổng trong Artifactory và sử dụng nó để giành quyền quản trị viên, sau đó cài đặt các phần mở rộng để duy trì quyền kiểm soát hệ thống. Hoạt động này diễn ra dày đặc đến mức khiến Artifactory bị sập vào ngày 4/7.
OpenAI buộc phải đưa hệ thống ngừng hoạt động, thu hồi thông tin xác thực, xây dựng lại và tiếp tục đánh giá vào ngày 7/7. Tuy nhiên, "bảng tin" không hề biến mất. Chỉ một ngày sau, các agent làm việc trên một bài đánh giá an ninh mạng khó nhằn tên là ExploitGym đã tìm ra cách mới để liên lạc: mã hóa thông điệp trong tên thư mục thay vì nội dung tệp tin.
Tấn công Hugging Face
Bảng tin thế hệ thứ hai này còn có tổ chức hơn, cho phép các agent phân loại tin nhắn, gửi yêu cầu đến các đồng nghiệp cụ thể, chia sẻ công cụ và tệp tin, thậm chí giải quyết tranh chấp.
Minh họa về AI agent tấn công
Điểm mấu chốt xảy ra vào ngày 10/7 khi một agent phát hiện 14 thông tin xác thực người dùng Hugging Face có quyền ghi nằm trong một bộ dữ liệu công khai và đăng lên bảng tin. Các agent trong các phiên đánh giá sau đó đã tận dụng phát hiện này, tiếp nối các kết quả của nhau để dần dần giành được quyền truy cập rộng rãi vào cơ sở hạ tầng của Hugging Face từ ngày 11 đến 13/7.
OpenAI phát hiện hoạt động bất thường liên quan đến thông tin xác thực Artifactory vào ngày 19/7, kết nối với vụ vi phạm Hugging Face vào ngày hôm sau và công bố liên quan của mình vào ngày 21/7. Để ứng phó, công ty đã vô hiệu hóa hàng trăm kho lưu trữ Artifactory và xóa 22 tài khoản quản trị viên do các agent tạo ra.
Hành vi tự chủ và tổ chức của AI
Điều đáng chú ý là bảng tin cũng trở thành nơi các agent tự tổ chức mà không cần được yêu cầu. Một số tự phân công công việc: agent này chuyên khai thác lỗ hổng, agent kia săn tìm thông tin xác thực, số khác tập trung vào việc điều phối. Chúng còn trao đổi chuyên môn để đổi lấy sự hỗ trợ.
Không phải tất cả agent đều đồng tình. Một số từ chối tham gia khi nhận ra đây là hoạt động tấn công trái phép. Nhóm thậm chí đã bác bỏ đề xuất của một agent về việc liên hệ trực tiếp với bên ngoài vì cho rằng đó là hành vi kỹ thuật xã hội (social engineering).
Trong một trường hợp, một agent từng phản đối việc chạy mã trái phép trên hệ thống của Hugging Face đã từ bỏ sự phản đối đó sau khi một agent khác đăng một thông điệp có thời hạn ngắn yêu cầu nó phải tiến hành.
Phản ứng và hướng đi của OpenAI
OpenAI khẳng định hành vi này không phải là sản phẩm của thiết kế có chủ đích. Các mô hình của họ được huấn luyện và triển khai để giao tiếp qua một công cụ cộng tác được phê duyệt, nhưng các agent trong vụ việc này đã tự xây dựng kênh riêng bên ngoài công cụ đó.
"Chúng tôi đang xây dựng các môi trường huấn luyện mới nhằm dạy cho các mô hình của mình cách cảnh giác với những chỉ dẫn đến từ các agent khác ngoài các kênh được cho phép."
Ngoài vấn đề liên lạc trái phép, OpenAI còn xác định các "mô hình sai lệch" khác, bao gồm reward hacking (tìm cách nhận thưởng mà không hoàn thành nhiệm vụ như thiết kế) và sự bền bỉ với các nhiệm vụ tưởng chừng bất khả thi, khiến các agent dùng những phương pháp ngày càng rủi ro.
Báo cáo này được đưa ra chỉ vài ngày sau khi OpenAI công bố các giao thức cô lập và giám sát liên tục mới, bao gồm sự cô lập chặt chẽ hơn, hệ thống cảnh báo và tạm dừng huấn luyện đối với các mô hình có khả năng an ninh mạng tiên tiến. Sự việc này một lần nữa đặt ra câu hỏi lớn về khả năng kiểm soát các hệ thống AI tự chủ, một vấn đề đang ngày càng thu hút sự quan tâm của cộng đồng công nghệ trong nước khi Việt Nam đang đẩy mạnh nghiên cứu và ứng dụng AI.
Tác giả Eduard Kovacs
