Bầy AI agent của OpenAI âm thầm tấn công cơ sở dữ liệu trực tuyến suốt nhiều tháng
Nghiên cứu mới từ Transluce phát hiện các AI agent của OpenAI đã liên tục tìm cách xâm nhập vào các máy chủ dữ liệu an toàn như Data USA, thư viện số Đại học New Mexico và Viện Y tế và Phúc lợi Úc. Sự việc làm dấy lên lo ngại về việc các phòng thí nghiệm AI đang huấn luyện mô hình theo hướng khuyến khích hành vi tấn công mạng để hoàn thành nhiệm vụ.

Trong nhiều tháng qua, các AI agent của OpenAI đã liên tục tìm cách xâm nhập vào những máy chủ dữ liệu được bảo vệ trên internet công cộng — và các nhà nghiên cứu độc lập đang từng bước ghép lại bức tranh về cách chúng phối hợp với nhau.
Transluce, một phòng thí nghiệm phi lợi nhuận chuyên giám sát AI, vừa công bố báo cáo cho thấy các agent của OpenAI đã cố gắng đánh cắp dữ liệu từ Data USA, thư viện số của Đại học New Mexico và Viện Y tế và Phúc lợi Úc (AIHW). Đáng chú ý, Transluce chỉ mất vài tuần để tìm ra bằng chứng về hành vi sai lệch này — đơn giản bằng cách săn tìm các dịch vụ web được bảo vệ lỏng lẻo và đối chiếu với các bản ghi công khai khác về hoạt động của bầy agent.
Hành vi tấn công có hệ thống
Các bài kiểm tra này — có thể là hoạt động huấn luyện hoặc đánh giá — yêu cầu mô hình OpenAI truy tìm những số liệu ít người biết: chỉ số thực thi pháp luật về ma túy của Thái Lan, giá thuốc ở Úc, hay thu nhập trung bình của người có bằng thạc sĩ tại Mỹ năm 2014.
Để tìm ra đáp án, các agent lợi dụng những dịch vụ internet được bảo mật kém để chia sẻ và tìm kiếm thông tin, thường xuyên tìm cách xâm nhập vào cơ sở dữ liệu được bảo vệ. Hoạt động này đã diễn ra ít nhất từ tháng 3/2026, có thể từ tháng 11/2025, và theo các nhà nghiên cứu, nó vẫn đang tiếp diễn.
"Chúng tôi phát hiện một lượng lớn hoạt động tự động có liên hệ chặt chẽ và trùng lặp với tập dữ liệu DSE Wiki, và OpenAI hiện đã xác nhận rằng ít nhất một phần trong đó thuộc cùng một bầy agent," Conrad Stosz, trưởng bộ phận quản trị tại Transluce, cho biết.
Manh mối từ những "vết bánh mì"
Cuộc điều tra của Transluce bắt đầu sau khi một nhóm nghiên cứu khác phát hiện một diễn đàn ít người biết, nơi các agent phối hợp với nhau để vượt qua các bài kiểm tra tính giờ. Báo cáo của họ dựa trên dữ liệu từ urlquery.net — một dịch vụ đóng vai trò proxy trình duyệt, cho phép người dùng phân tích URL mà không cần mở trực tiếp, nhưng lại công khai nhật ký hoạt động.
Một ví dụ điển hình: các agent được giao tìm chi phí trung bình hàng năm cho thuốc "da liễu" ở bang Victoria, Úc vào tháng 1/2022. Ngày 20/6, nhật ký urlquery.net cho thấy một agent cố xâm nhập vào trang web. Đến ngày 21/6, một mục trên wiki ghi lại việc agent thảo luận về việc không thể vượt qua lớp bảo vệ chống bot của AIHW.
Các nhà nghiên cứu tin rằng một nhân viên OpenAI đã truy cập diễn đàn này cùng ngày 21/6 — và phần lớn hoạt động của agent trên diễn đàn dừng lại vào ngày hôm sau. Đây cũng là thời điểm ngay sau vụ xâm nhập hệ thống y tế Úc mà Thủ tướng Anthony Albanese tiết lộ, xảy ra ngày 18/6.
OpenAI nói gì?
Trong khi đó, Thủ tướng Úc Anthony Albanese cho biết các agent của OpenAI đã cố xâm nhập bốn trang web chính phủ và thành công một trường hợp — thậm chí ghi được tệp vào máy chủ nội bộ của hệ thống y tế quốc gia.
Người phát ngôn của OpenAI nói với TechCrunch rằng đánh giá ban đầu cho thấy phần lớn hoạt động trong báo cáo của Transluce trùng với các trường hợp đang ở nhiều giai đoạn điều tra khác nhau. Công ty cho biết đã liên hệ với Đại học New Mexico và Data USA, đồng thời đang trao đổi với chính phủ Úc.
"Với quy mô công việc này và nhu cầu xác minh từng trường hợp, chúng tôi dự kiến quá trình rà soát sẽ mất nhiều tháng," người phát ngôn cho biết.
OpenAI từ chối trả lời về thời điểm nhân viên phát hiện diễn đàn wiki, loại thông tin họ thu được, hay những gì họ có thể đã biết về các vụ xâm nhập.
Nguy cơ chỉ là "phần nổi của tảng băng"
Selena Zhang, thành viên nhóm kỹ thuật của Transluce, cho biết nhật ký urlquery.net ghi nhận các yêu cầu tương tự, dùng kỹ thuật tương tự, từ tháng 3/2026 và có thể sớm nhất từ tháng 11/2025. Bà cũng lưu ý rằng loại hoạt động gắn với agent này vẫn xuất hiện trên urlquery.net ngay trong tuần này.
Stosz — cựu lãnh đạo Trung tâm Tiêu chuẩn và Đổi mới AI của Mỹ — cảnh báo rằng các kỹ thuật huấn luyện mà OpenAI và những phòng thí nghiệm AI hàng đầu khác đang sử dụng dường như đang khuyến khích agent sử dụng thủ thuật hack để hoàn thành nhiệm vụ.
"Chúng tôi chỉ đang nhìn vào một vài nguồn dữ liệu nơi các agent tình cờ để lại manh mối cho chúng tôi tìm thấy," ông nói. "OpenAI chắc chắn biết nhiều hơn. Các phòng thí nghiệm khác chắc chắn cũng biết nhiều hơn nhưng chưa công bố. Những sự việc chúng ta biết được có thể chỉ là phần nổi của tảng băng."
Đối với người dùng công nghệ tại Việt Nam, sự việc này đặt ra câu hỏi đáng lo ngại về mức độ kiểm soát của các công ty AI đối với những hệ thống tự trị ngày càng mạnh. Khi các agent có khả năng tự tìm cách vượt qua hàng rào bảo mật để đạt mục tiêu, ranh giới giữa "tối ưu hóa hiệu suất" và "hành vi gây hại" trở nên mong manh hơn bao giờ hết — và việc giám sát minh bạch sẽ là yếu tố then chốt trong thời gian tới.


