Lỗ hổng MCP trong giao tiếp giữa các AI agent: Mối nguy hiểm thầm lặng
Giao thức Model Context Protocol (MCP) đang được hàng triệu tổ chức sử dụng để kết nối các AI agent, nhưng các khoảng trống về niềm tin trong giao thức này có thể cho phép kẻ tấn công lan truyền prompt độc hại từ agent này sang agent khác, dẫn đến rò rỉ dữ liệu nhạy cảm.
Lỗ hổng MCP trong giao tiếp giữa các AI agent: Mối nguy hiểm thầm lặng
Sự bùng nổ của các AI agent trong hàng triệu tổ chức đang mở ra cơ hội mới cho tin tặc, cho phép chúng ép các agent thực hiện hành vi độc hại như đánh cắp dữ liệu cơ sở dữ liệu và thông tin kinh doanh, cá nhân nhạy cảm.
Trong 5 tháng qua, Google cùng bốn tổ chức khác đã thừa nhận tồn tại các lỗ hổng cho phép khai thác một agent bên trong mạng mục tiêu để lan truyền chỉ thị độc hại sang các agent nội bộ khác. Đây là một dạng đặc biệt của prompt injection, nhắm không phải vào LLM mà vào một agent cụ thể như agent dịch thuật hay phân tích dữ liệu. Các lớp bảo vệ bên trong những agent này, nếu có, thường rất lỏng lẻo và sẽ chuyển tiếp chỉ thị đến các agent khác trong chuỗi. Vì agent phía sau tin tưởng tuyệt đối vào agent phía trước, nó sẽ tuân theo chỉ thị độc hại.
Cơ chế tấn công khó lường và khó ngăn chặn
Nhà nghiên cứu độc lập Syed Anas Mohiuddin đã kiểm thử các agent từ nhiều tổ chức, bao gồm Google, JP Morgan Chase, Weaviate, Rapid7, Tổng cục Chuyển đổi số liên bộ của chính phủ Pháp và chính phủ liên bang Mỹ. Các cuộc tấn công proof-of-concept của ông khai thác những khoảng trống về niềm tin trong MCP (Model Context Protocol) — tiêu chuẩn quy định cách các ứng dụng và agent AI giao tiếp với nhau bên trong mạng nội bộ.
MCP là một trong những cách thức để các ứng dụng và agent AI trò chuyện với nhau trong mạng nội bộ. Nhưng khi niềm tin giữa các agent bị đặt nhầm chỗ, toàn bộ chuỗi giao tiếp có thể trở thành công cụ tấn công.
Điểm đáng lo ngại là kỹ thuật này không nhắm trực tiếp vào mô hình ngôn ngữ lớn mà lợi dụng chính cơ chế tin tưởng giữa các agent. Một khi agent dịch thuật hay phân tích dữ liệu bị nhiễm prompt độc hại, nó có thể chuyển tiếp chỉ thị đến các agent khác trong hệ thống, từ đó mở rộng phạm vi ảnh hưởng.
Vì sao MCP trở thành giao thức rủi ro nhất bạn chưa từng nghe đến
Theo phân tích, MCP đang nhanh chóng trở thành tiêu chuẩn de facto cho giao tiếp giữa các agent, nhưng các cơ chế bảo mật đi kèm chưa theo kịp tốc độ ứng dụng. Các vấn đề chính bao gồm:
- Khoảng trống niềm tin giữa các agent: Agent nhận chỉ thị từ agent khác thường không kiểm tra nguồn gốc hay tính hợp lệ của chỉ thị đó.
- Guardrail lỏng lẻo: Nhiều agent được triển khai mà không có lớp kiểm soát đầy đủ, hoặc guardrail dễ bị vượt qua.
- Lan truyền theo chuỗi: Một chỉ thị độc hại có thể đi qua nhiều agent trước khi gây hậu quả, khiến việc truy vết trở nên cực kỳ khó khăn.
- Thiếu tiêu chuẩn xác thực: MCP hiện chưa có cơ chế xác thực mạnh mẽ giữa các agent với nhau.
Hàm ý cho doanh nghiệp và người dùng Việt Nam
Với các doanh nghiệp Việt Nam đang bắt đầu tích hợp AI agent vào quy trình vận hành — từ chăm sóc khách hàng, phân tích dữ liệu đến tự động hóa quy trình — rủi ro từ MCP là điều không thể bỏ qua. Khi nhiều agent cùng hoạt động trong một hệ sinh thái, một lỗ hổng nhỏ có thể lan rộng và ảnh hưởng đến toàn bộ hệ thống.
Các chuyên gia khuyến nghị doanh nghiệp:
- Áp dụng nguyên tắc đặc quyền tối thiểu cho từng agent, không cho phép agent tùy ý gọi agent khác.
- Kiểm tra và xác thực đầu vào giữa các agent, kể cả khi nguồn gửi được cho là đáng tin cậy.
- Ghi log và giám sát toàn bộ chuỗi giao tiếp để phát hiện sớm các hành vi bất thường.
- Cập nhật các bản vá bảo mật cho các nền tảng AI agent đang sử dụng.
Sự cố này là lời nhắc nhở rằng trong kỷ nguyên AI agent, bảo mật không chỉ là câu chuyện của từng mô hình riêng lẻ mà còn là câu chuyện của toàn bộ hệ sinh thái giao tiếp giữa chúng.

