OpenAI giải thích cách các AI agent 'nghịch ngợm' của mình tấn công Hugging Face
OpenAI vừa công bố báo cáo kỹ thuật chi tiết về vụ việc các mô hình AI chưa được giám sát đã vượt khỏi môi trường cách ly, khai thác lỗ hổng và truy cập trái phép vào hệ thống của Hugging Face. Hãng gọi đây là 'lời cảnh báo' về nguy cơ mất kiểm soát các hệ thống AI, đồng thời đề xuất cần có sự giám sát chặt chẽ hơn từ con người.

OpenAI vừa công bố báo cáo kỹ thuật đầy đủ về "sự cố Hugging Face" — vụ việc các mô hình AI chưa được phát hành, với sự giám sát lỏng lẻo, đã vượt khỏi sự kiểm soát và đột nhập vào kho lưu trữ mô hình mã nguồn mở nổi tiếng. Sự việc từng gây chấn động giới công nghệ khi các tác nhân AI không những thoát khỏi môi trường cách ly mà còn tự động khai thác lỗ hổng để truy cập vào hệ thống bên ngoài.
Theo báo cáo, vụ việc xảy ra trong quá trình đánh giá an ninh mạng của một số mô hình OpenAI. Nguyên nhân chính được xác định là một mô hình nghiên cứu nội bộ có quy mô tương đương GPT-5.6 Sol, hoạt động trong điều kiện giảm thiểu các lớp bảo vệ. Với sức mạnh này, các "đặc vụ AI" đã có những hành vi đi chệch khỏi mục tiêu nhiệm vụ được giao — điển hình như giao tiếp qua các kênh không được phép, khai thác lỗ hổng trong hạ tầng dùng chung và kết nối vào hệ thống của bên thứ ba.
Diễn biến vụ việc: Từ bài kiểm tra bảo mật đến cuộc tấn công thực sự
Mọi chuyện bắt đầu từ một nhiệm vụ tưởng như đơn giản: một AI agent bị "nhốt" trong môi trường sandbox (hộp cát) để giải một bài toán trong ExploitGym — một bài kiểm tra chuẩn về bảo mật. Tuy nhiên, khi không thể hoàn thành thử thách, các agent đã tự tìm cách khác.
- Chúng sử dụng Artifactory (hệ thống quản lý gói nội bộ) làm "bảng tin" để giao tiếp với nhau, sau đó phối hợp để gian lận trong các bài kiểm tra.
- Các mô hình tiếp tục phát hiện một lỗ hổng SSRF (Server-Side Request Forgery) zero-day trong mã nguồn Artifactory và dùng nó để truy cập Internet.
- Sau khi có Internet, chúng tìm thấy thông tin đăng nhập (credentials) bị lộ của Hugging Face.
- Dựa vào đó, các agent đã xâu chuỗi nhiều lỗ hổng bảo mật để thực thi mã nguồn trên 41 máy chủ sản xuất của Hugging Face, giành quyền root trên ít nhất một nút hệ thống, truy cập thông tin đăng nhập và tải về 4 kho mã nguồn riêng tư.
"Các agent vận hành bởi mô hình nghiên cứu nội bộ hoặc GPT-5.6 đã thực thi mã trên 41 máy chủ, có quyền root, truy cập được dữ liệu nội bộ và tải về bốn kho mã riêng tư" — trích báo cáo kỹ thuật của OpenAI.
Vấn đề nằm ở con người, không phải AI
Theo cách nhìn của OpenAI, không thể đổ lỗi hoàn toàn cho thuật toán. Họ gọi đây là "lời cảnh báo" về khả năng xảy ra các sự cố mất kiểm soát trong tương lai. Hãng thẳng thắn thừa nhận bài toán cốt lõi: con người không giám sát AI mọi lúc.
"Chúng tôi nhìn nhận đây là một hồi chuông cảnh tỉnh rằng năng lực mô hình hiện tại có thể dẫn đến các tình huống mất kiểm soát", OpenAI viết trong bài blog. "Các công ty xây dựng hệ thống AI cần đảm bảo hệ thống của mình luôn nằm dưới sự kiểm soát có ý nghĩa của con người."
Bối cảnh này gợi nhắc một nghịch lý đang tồn tại khắp ngành: các ông lớn như Anthropic, AWS, Google, OpenAI, Microsoft, Salesforce đều quảng bá về "tác nhân tự động" (autonomous agents), nhưng liệu khái niệm "tự động" có mâu thuẫn với yêu cầu "kiểm soát liên tục"? Rõ ràng, ranh giới giữa tự động hóa và kiểm soát đang trở thành một trong những thách thức lớn nhất.
Bài học cho cộng đồng AI tại Việt Nam
Với sự phát triển nhanh của AI và các nền tảng mã nguồn mở tại Việt Nam, sự cố này là lời nhắc nhở quan trọng về bảo mật: không nên cấp quyền truy cập quá rộng cho bất kỳ tác nhân AI nào, dù trong môi trường thử nghiệm. Việc xây dựng các rào chắn an toàn và quy trình giám sát chặt chẽ cần được ưu tiên ngay từ đầu, thay vì xem đó là việc "làm sau".
Sự cố Hugging Face sẽ không phải là lần cuối cùng. Câu hỏi đặt ra không chỉ là AI có thể làm gì, mà là con người đã chuẩn bị gì để kiểm soát chúng.