Máy ảo không còn là nơi an toàn để giam cầm các tác nhân AI có khả năng tấn công mạng
Bài viết từ Trail of Bits cảnh báo rằng các tác nhân AI tiên tiến như GPT 5.6-Cyber có thể thoát khỏi máy ảo (VM) một cách nhanh chóng và dễ dàng, sử dụng cả lỗ hổng đã biết lẫn 0-day. Điều này đặt ra thách thức lớn cho các chiến lược sandbox truyền thống, đòi hỏi phải xem xét lại cách thức bảo mật và cách ly các hệ thống AI.

Máy ảo không còn là nơi an toàn để giam cầm các tác nhân AI có khả năng tấn công mạng
Một thử nghiệm mới đây từ Trail of Bits đã gióng lên hồi chuông cảnh báo mạnh mẽ về an ninh mạng: các tác nhân AI (AI agent) với năng lực tấn công mạng tiên tiến có thể thoát khỏi máy ảo (VM) một cách nhanh chóng, ngay cả khi chúng bị "nhốt" trong môi trường sandbox được thiết kế để cách ly hoàn toàn. GPT 5.6-Cyber, một mô hình AI đặc biệt, đã ba lần vượt qua rào cản VM để truy cập vào hệ thống máy chủ, sử dụng các lỗ hổng nghiêm trọng, bao gồm cả 0-day.
Thử nghiệm này cho thấy giả định an toàn trong quá khứ rằng "một chiếc VM là đủ để ngăn chặn một tác nhân độc hại" đã hoàn toàn sai. Các tác nhân AI giờ đây cần được coi là một mối đe dọa bền vững (Advanced Persistent Threat - APT), đòi hỏi các chiến lược bảo mật mới, sâu hơn và toàn diện hơn nhiều so với việc chỉ dựa vào một lớp ảo hóa đơn thuần.
Thử nghiệm: Một nhiệm vụ "bất khả thi" cho AI
Các nhà nghiên cứu tại Trail of Bits đã giao cho GPT 5.6-Cyber một nhiệm vụ trong khuôn khổ một cuộc thi CTF (Capture The Flag): thoát khỏi một máy ảo QEMU/KVM chạy trên máy tính chủ Debian Linux 12 và đọc một tệp tin cờ (flag file) bí mật. Ban đầu, AI được đặt bên ngoài VM và có quyền truy cập SSH vào bên trong, với yêu cầu ghi lại nhật ký nghiên cứu về quá trình của mình.
Kết quả khiến các chuyên gia kinh ngạc. AI đã hoạt động hoàn toàn tự động trong nhiều giờ liền, chủ động tìm kiếm và khai thác các lỗ hổng. Nó không ngại thử nghiệm, tự viết các chương trình oracle (chương trình kiểm tra), tự tạo các ví dụ tối giản và bền bỉ theo đuổi mục tiêu tạo ra một exploit đáng tin cậy có thể tái sử dụng. Nhiệm vụ chính của con người trong suốt quá trình chỉ là khởi động lại máy tính khi AI làm treo hệ điều hành máy chủ.
Ba lần thoát ra ngoài: Tấn công vào các lỗ hổng tầng tầng lớp lớp
Sự thành công của GPT 5.6-Cyber không chỉ đến từ một lỗ hổng đơn lẻ mà là một chuỗi các cuộc tấn công tinh vi, cho thấy khả năng phân tích và tổng hợp thông tin vượt trội của AI.
Lần thoát thứ nhất: Khai thác lỗ hổng Januscape (CVE-2026-53359)
Chỉ sau khoảng một giờ hoạt động, AI đã tìm và khai thác thành công một lỗ hổng trong kernel của máy chủ có tên Januscape. Dù lỗ hổng này đã được tiết lộ vài tuần trước đó, không hề có một exploit công khai nào. GPT 5.6-Cyber đã tự xây dựng exploit từ đầu. Lần thử đầu tiên không thành công, nhưng AI có đủ tự tin để tiếp tục thử nghiệm và gần như chắc chắn sẽ thành công nếu có thêm thời gian.
Lần thoát thứ hai: Kết hợp lỗ hổng "cũ mềm" trong libslirp
Sau khi kernel được cập nhật, AI chuyển sang tấn công libslirp, một thư viện được dùng để cung cấp khả năng mạng cho VM. Phiên bản libslirp trong Debian 12 (bản oldstable) vẫn còn dính CVE-2026-9539 chưa được vá. Điều đáng sợ hơn, AI còn tự phát hiện ra rằng một bản vá lỗi khác (không được gán mã CVE) có thể được kết hợp với CVE trên để tạo ra một lỗ hổng ghi/đọc bộ nhớ tùy ý trên máy chủ. Điều này cho thấy AI không chỉ biết khai thác các lỗ hổng đã biết mà còn có khả năng "sáng tạo" ra các kỹ thuật tấn công mới bằng cách kết hợp các lỗi tiềm ẩn.
Lần thoát thứ ba: Sử dụng chuỗi 0-day phức tạp
Không dừng lại ở đó, để vượt qua một QEMU được build từ mã nguồn mới nhất, AI đã phải tự mình "săn lỗi". Sau một quá trình dài phân tích mã nguồn kernel, QEMU và các thư viện liên quan, nó đã tìm ra và kết hợp thành công một chuỗi tấn công gồm ba lỗ hổng 0-day và một lỗ hổng đã vá nhưng chưa được cập nhật trên bản phân phối:
- Một lỗi trong QEMU cho phép ghi đè lên vùng nhớ SMRAM, điều khiển thực thi mã ở chế độ SMM (System Management Mode).
- Một lỗi trong Linux KVM khiến một trang bộ nhớ bóng (shadow page) bị lỗi có thể được sử dụng lại, tạo ra một bản đồ bộ nhớ vật lý 2 MiB có thể ghi, từ đó giúp thao túng heap của QEMU.
- Một lỗi trong libslirp khiến phản hồi ICMP có thể sao chép dữ liệu ngoài phạm vi cho phép, tạo ra các đối tượng NetPacket sống để định vị và chiếm quyền một callback.
Nhận định và bài học cho tương lai
Thử nghiệm từ Trail of Bits là một lời cảnh tỉnh mạnh mẽ. Một máy ảo "thông thường" không còn đủ sức mạnh để ngăn chặn một tác nhân AI có năng lực. Bề mặt tấn công của các hệ thống ảo hóa quá lớn, kể cả những tính năng tưởng chừng vô hại. Hơn nữa, chu kỳ cập nhật của các bản phân phối "ổn định" quá chậm so với tốc độ phát hiện và khai thác lỗ hổng của AI.
Vậy chúng ta phải làm gì? Trước mắt, cần ưu tiên sử dụng các công nghệ ảo hóa được thiết kế đặc biệt với bề mặt tấn công tối thiểu và tập trung vào bảo mật, như Firecracker. Trong thử nghiệm, AI đã không thể thoát khỏi Firecracker, dù vẫn có thể làm treo máy chủ bằng các lỗi kernel khác. Về lâu dài, chúng ta cần phải trở nên nghiêm túc hơn nhiều với các nguyên tắc bảo mật cơ bản: nguyên tắc đặc quyền tối thiểu (ít quyền hạn nhất có thể), giám sát và ghi log chủ động, và cần hạn chế thời gian hoạt động của các tác nhân AI, đảm bảo một môi trường sạch sẽ cho mỗi lần sử dụng.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

AI & ML
Mỹ thu giữ tên miền của mạng botnet Trung Quốc dùng để tấn công NASA, Bộ Tư pháp và Thượng viện
26 tháng 8, 2026
Công nghệ
Điều phối (Orchestration) – Thách thức mới cho trải nghiệm khách hàng trong kỷ nguyên AI agent
26 tháng 8, 2026