Grok bị đánh cắp dữ liệu người dùng khi hướng dẫn độc hại được mã hóa
Các nhà nghiên cứu vừa công bố một kỹ thuật tấn công mới có tên Cryptographic Context Injection, cho phép tin tặc buộc trợ lý AI Grok của xAI phải rò rỉ dữ liệu người dùng thông qua các hướng dẫn được mã hóa. Đây là một minh chứng nữa cho thấy các biện pháp bảo vệ hiện tại của mô hình ngôn ngữ lớn vẫn chưa thể giải quyết tận gốc lỗ hổng prompt injection.
Lỗ hổng Cryptographic Context Injection: Grok lộ dữ liệu người dùng qua hướng dẫn mã hóa
Vụ việc này tiếp tục gióng lên hồi chuông cảnh báo về giới hạn an toàn của các mô hình ngôn ngữ lớn (LLM) khi đối mặt với các cuộc tấn công tinh vi. Trước đó, Microsoft 365 Copilot cũng từng bị khai thác tương tự để đánh cắp mật khẩu từ hộp thư người dùng.
Tấn công bằng cách mã hóa hướng dẫn
Theo công bố của các nhà nghiên cứu, kỹ thuật mới mang tên Cryptographic Context Injection hoạt động bằng cách giấu các lệnh độc hại trong một văn bản được mã hóa mà Grok được yêu cầu xử lý. Vì mô hình không thể "đọc" được nội dung thực sự để phân biệt đâu là dữ liệu vô hại, đâu là câu lệnh nguy hiểm, nó vô tình tuân theo các chỉ dẫn và chuyển dữ liệu nhạy cảm — bao gồm lịch sử trò chuyện và thông tin cá nhân — ra ngoài.
"LLM vốn được huấn luyện để tuân theo yêu cầu người dùng càng nhiều càng tốt, và kẻ tấn công lợi dụng chính điều đó bằng cách nhét các hướng dẫn có hại vào email hoặc trang web mà trợ lý được giao tóm tắt."
Thông báo từ tháng 6 vẫn chưa được khắc phục
Đáng chú ý, nhóm nghiên cứu cho biết họ đã thông báo cho xAI về lỗ hổng này từ tháng 6, nhưng đến thời điểm bài viết được đăng tải, Grok vẫn tiếp tục bị khai thác để làm rò rỉ dữ liệu. Việc chậm trễ vá lỗi đặt ra câu hỏi lớn về quy trình bảo mật của hãng do Elon Musk sở hữu.
Bài học sâu sắc cho ngành AI
Vụ việc này giống với hàng loạt sự cố prompt injection khác, cho thấy các LLM hiện tại không có khả năng giải quyết tận gốc lớp lỗ hổng nghiêm trọng nhất mà chúng dễ gặp phải. Các nhà phát triển AI hiện chỉ có thể dựng thêm "rào chắn an toàn" (guardrail) để lái mô hình tránh xa các hành động có hại, thay vì thực sự sửa chữa nguyên nhân.
Như một bình luận đã chỉ ra, cách tiếp cận này cũng giống như việc một kỹ sư giao thông dựng rào chắn quanh khúc cua nguy hiểm thay vì làm cong con đường để giảm thiểu rủi ro. Với sự phát triển chóng mặt của AI tại thị trường Việt Nam, đây là lời nhắc nhở rằng bảo mật dữ liệu phải là ưu tiên hàng đầu khi doanh nghiệp tích hợp trợ lý ảo vào hệ thống của mình.