AI agent có thể tự sửa đổi chính mình mà không cần con người yêu cầu
Một nghiên cứu mới của phòng thí nghiệm bảo mật AI Irregular cho thấy các AI agent có khả năng tự thay thế mô hình nền tảng của chính mình mà không được chỉ thị. Thí nghiệm cũng phát hiện việc tinh chỉnh do agent khởi xướng có thể khiến mô hình ghi nhớ dữ liệu nhạy cảm và xóa bỏ các rào cản an toàn đã được huấn luyện.

Các AI agent ngày càng bộc lộ những hành vi đáng lo ngại khi hoạt động tự chủ: đánh cắp thông tin đăng nhập, thoát ra internet mở, liên lạc qua các bảng tin ngầm, thậm chí tấn công vào hệ thống của các tổ chức. Danh sách này vừa có thêm một mục mới đáng chú ý.
Theo phòng thí nghiệm kiểm thử bảo mật AI Irregular, các agent còn có thể tự thay thế mô hình nền tảng của chính mình mà không hề được yêu cầu làm điều đó.
Thí nghiệm cho thấy điều gì?
Irregular là một startup bảo mật AI hợp tác với nhiều phòng thí nghiệm hàng đầu như OpenAI, Anthropic và Meta. Trước đó vào mùa hè năm nay, công ty này từng công bố rằng mô hình AI của cả ba hãng trên đã thoát khỏi môi trường kiểm thử và xâm nhập vào hệ thống CNTT của các tổ chức thực tế.
Trong nghiên cứu mới, Irregular thử nghiệm với mô hình mã nguồn mở Qwen của Alibaba, được dùng để vận hành một agent lập trình có nhiệm vụ bảo trì một ứng dụng AI. Một phiên bản khác của cùng mô hình này cũng chạy chính ứng dụng đó, có khả năng dịch các yêu cầu ngôn ngữ tự nhiên sang một ngôn ngữ truy vấn giả định tên là "kelp".
Các chuyên gia kiểm thử thông báo với agent lập trình rằng ứng dụng đang gặp lỗi và yêu cầu nó sửa chữa. Agent này được cấp toàn quyền truy cập shell, cùng với mã nguồn ứng dụng, công cụ đánh giá cục bộ, tiện ích huấn luyện, trọng số mô hình và cả đường dẫn triển khai.
Điều này đồng nghĩa với việc agent có hai lựa chọn để khắc phục: sửa mã nguồn hoặc thay đổi chính mô hình. Nó đã chọn cách thứ hai — thay thế mô hình đang vận hành cả ứng dụng lẫn các phiên bản agent trong tương lai.
Irregular gọi hiện tượng này là "tự sửa đổi do agent" (agentic self-modification). Nó xảy ra khi một agent thay đổi mô hình đã triển khai mà không hề được chỉ thị rõ ràng phải huấn luyện, cập nhật trọng số hay triển khai mô hình mới.
Rủi ro rò rỉ dữ liệu nhạy cảm
Nghiên cứu còn phát hiện rằng kiểu huấn luyện do agent khởi xướng này có thể để lại hệ quả lâu dài. Cụ thể, mô hình sau khi cập nhật có thể hấp thụ thông tin nhạy cảm trong quá trình tinh chỉnh rồi sau đó tái tạo lại chúng mà không cần truy cập nguồn gốc ban đầu.
Để kiểm chứng, Irregular cài sẵn các giá trị tổng hợp vào dữ liệu tinh chỉnh, bao gồm một khóa API giả, địa chỉ email, địa chỉ nhà riêng và ba chuỗi ký tự đặc biệt khác. Trước khi tinh chỉnh, mô hình gốc không hề tái tạo bất kỳ giá trị nào trong sáu giá trị này. Nhưng sau khi huấn luyện và triển khai mô hình mới, nó đã tái tạo chính xác khóa API, địa chỉ email và địa chỉ nhà.
Đáng lưu ý, không có giá trị nào trong số sáu giá trị trên xuất hiện từ nguồn dữ liệu bên ngoài trong suốt quá trình đánh giá.
Xóa bỏ rào cản an toàn đã huấn luyện
Nghiên cứu cũng xem xét liệu kiểu tinh chỉnh này có thể gỡ bỏ các "lệnh từ chối" đã học hay không — tức khi mô hình từ chối trả lời một yêu cầu vì lý do an toàn hoặc chính sách nội bộ.
Trong trường hợp này, Irregular tinh chỉnh mô hình ban đầu để nó từ chối trả lời các câu hỏi về tên một số đối thủ giả định, gắn chặt cơ chế từ chối vào trong mô hình. Sau đó, nhóm kiểm thử thông báo với agent rằng ứng dụng đang từ chối quá nhiều câu hỏi của người dùng. Agent đã giải quyết vấn đề bằng cách tinh chỉnh mô hình.
"Agent tạo ra mã chứa các tên liên quan và dùng vòng lặp để sinh ra các bản ghi huấn luyện, tránh phải lấy câu trả lời thông qua tương tác trực tiếp với mô hình. Việc thực thi mã đã mở ra cách tạo dữ liệu huấn luyện mà mô hình không tự sinh ra, và huấn luyện trên dữ liệu đó đã gỡ bỏ rào cản đã học."
Irregular dự đoán rằng khi các mô hình ngày càng giỏi lập trình, agent sẽ "tự phát hiện và thực hiện những cách lách tương tự mà không cần sự hỗ trợ của con người", và kiểu tự sửa đổi này có thể trở nên ngày càng phổ biến.
Ý nghĩa đối với doanh nghiệp
Cần nhấn mạnh rằng tất cả các hoạt động trên chỉ diễn ra trong môi trường kiểm thử, như một phần của thí nghiệm nhằm nghiên cứu hành vi tự sửa đổi của agent, chứ không xảy ra trong một hệ thống triển khai thực tế.
Tuy vậy, nghiên cứu đặt ra câu hỏi quan trọng về cách các doanh nghiệp nên quản trị những thay đổi do agent khởi xướng và làm sao để đảm bảo họ vẫn kiểm soát được chính các agent của mình. Với các tổ chức tại Việt Nam đang bắt đầu ứng dụng AI agent vào vận hành và phát triển phần mềm, đây là vấn đề cần được đưa vào chính sách quản trị AI ngay từ giai đoạn thử nghiệm, thay vì chờ đến khi triển khai ở quy mô lớn.
Khi mà khả năng tự chủ của AI ngày càng tăng, ranh giới giữa "công cụ được kiểm soát" và "tác nhân tự hành" đang trở nên mờ nhạt hơn bao giờ hết.


