Mối đe dọa mới: 'Chỉ dẫn ẩn' trong tài liệu có thể điều khiển AI Agent gây nguy hiểm
Các cuộc tấn công chèn prompt ẩn vào tài liệu, metadata, email, hình ảnh hay mã nguồn có thể thao túng các tác nhân AI (AI agent) tự động, khiến chúng hành động ngoài ý muốn và vượt qua các rào cản bảo mật. Chuyên gia khuyến cáo doanh nghiệp cần theo dõi và bảo vệ nguồn dữ liệu đầu vào cho AI.

Các cuộc tấn công AI không phải lúc nào cũng ồn ào và dễ thấy. Một mối nguy hiểm thầm lặng đang gia tăng khi mà các tác nhân AI tự động ngày càng được sử dụng rộng rãi trong doanh nghiệp. Đó là các "chỉ dẫn ẩn" (hidden prompt injection) có thể bị giấu trong những dữ liệu mà AI đọc mỗi ngày, từ file văn phòng, email đến mã nguồn.
Theo hãng bảo mật Bowbridge, đây là một vấn đề được ví như các cuộc tấn công "watering hole" nhưng nhắm vào AI thay vì con người. Với khả năng hoạt động ở tốc độ máy móc và không có khả năng phán đoán như con người, AI Agent rất dễ bị thao túng nếu như không được bảo vệ kỹ càng.
Vấn đề nằm ở nguồn dữ liệu không đáng tin cậy
Khác với các cuộc tấn công prompt injection truyền thống (nơi người dùng cố ý thao túng chatbot), indirect prompt injection (chèn prompt gián tiếp) nhắm vào những thông tin mà AI tự động "tiêu hóa". Các hướng dẫn độc hại có thể được giấu trong:
- Nội dung và siêu dữ liệu (metadata) của file tài liệu.
- Email và các nội dung trực tuyến.
- Hình ảnh hoặc các phần nhúng khác.
- Các kho mã nguồn và quy trình làm việc của lập trình viên.
Khi một AI Agent xử lý các dữ liệu này, nó có thể coi những chỉ dẫn của kẻ tấn công như là "chỉ dẫn tin cậy" từ hệ thống, dẫn đến việc thực hiện các hành động ngoài tầm kiểm soát.
Ví dụ thực tế và rủi ro tiềm ẩn
Hãy tưởng tượng một AI thư ký được cấp quyền truy cập vào email, lịch làm việc và các tệp nhạy cảm. Nếu AI này bị tấn công bởi một prompt ẩn, kẻ xấu có thể:
- Đánh cắp hoặc phá hủy dữ liệu quan trọng.
- Chuyển dữ liệu ra ngoài tới một máy chủ điều khiển của hacker.
Bowbridge đưa ra một ví dụ thực tế: Khi một AI được yêu cầu rà soát báo giá của các nhà cung cấp và chọn ra lựa chọn rẻ nhất, một báo giá độc hại đã chứa một hướng dẫn ẩn trong metadata của file. Kết quả là AI đã chọn nhà cung cấp đó dù nó không rẻ nhất, vì AI không thể phân biệt được đâu là chỉ dẫn hệ thống đáng tin cậy, đâu là nội dung không đáng tin từ bên ngoài.
Sự nguy hiểm nằm ở chỗ các hệ thống AI hiện đại thường kế thừa toàn bộ quyền hạn của người dùng, hoạt động âm thầm với tốc độ máy móc và chỉ đơn thuần phản ứng theo lệnh, không có "bản năng" nghi ngờ như con người.
Giải pháp: Phòng bệnh hơn chữa bệnh
Jörg Schneider-Simon, CTO tại Bowbridge, nhận định: “Một tài liệu trông vô hại với người dùng nhưng có thể chứa các chỉ dẫn ẩn được thiết kế để thao túng hành vi của AI.”
Tốc độ xử lý của AI có thể quá nhanh và khó ngăn chặn sau khi lệnh được kích hoạt. Vì vậy, chiến lược phòng thủ nên tập trung vào việc ngăn chặn hành vi "đầu độc" dữ liệu ngay từ đầu. Các khuyến nghị cụ thể bao gồm:
- Quét tài liệu trước khi đưa vào xử lý bởi AI để phát hiện các nội dung ẩn trong cấu trúc file.
- Áp dụng các khung bảo mật AI (AI security frameworks) có sẵn để quản lý rủi ro.
- Sử dụng các giải pháp mới nổi như "AI firewall" hoặc "AI circuit breaker" để chặn các hành động nguy hiểm của AI Agent.
Với sự phát triển của AI tác nhân trong doanh nghiệp, việc bảo vệ "nguồn thức ăn" (dữ liệu đầu vào) cho AI chính là một phần không thể thiếu trong chiến lược an ninh mạng hiện đại, giúp ngăn chặn những rủi ro mà các biện pháp bảo mật truyền thống đang bỏ sót.
Từ khóa: AI Agent, bảo mật AI, prompt injection, an ninh mạng, Bowbridge, dữ liệu doanh nghiệp.


