Kỹ thuật tấn công mới 'Cryptographic Context Injection' vượt qua hệ thống an toàn của AI Grok và Gemini
Các nhà nghiên cứu tại Adversa AI đã phát hiện ra một kỹ thuật tấn công mới có tên 'Cryptographic Context Injection', cho phép mã độc được mã hóa và ẩn giấu bên trong mã lệnh, sau đó được giải mã ngay trong môi trường thực thi đáng tin cậy của mô hình AI, qua mặt các bộ lọc an toàn. Kỹ thuật này đã được thử nghiệm thành công trên cả chatbot Grok của xAI và Gemini của Google, đặt ra thách thức nghiêm trọng cho an ninh AI hiện tại.

Kỹ thuật tấn công 'Cryptographic Context Injection' qua mặt hệ thống an toàn của AI Grok và Gemini
Các nhà nghiên cứu tại công ty bảo mật Adversa AI vừa công bố một kỹ thuật tấn công mới mang tên Cryptographic Context Injection, cho phép kẻ xấu vượt qua các lớp bảo vệ an toàn của các mô hình AI lớn như Grok và Gemini. Bằng cách mã hóa các lệnh độc hại và chỉ giải mã chúng bên trong môi trường thực thi an toàn của chính mô hình, kỹ thuật này đã đánh bại thành công các bộ phận kiểm duyệt nội dung, mở ra một vectơ tấn công tiềm ẩn mới cho ngành an ninh mạng.
Phát hiện này được cho là đặc biệt nguy hiểm vì nó khai thác chính kiến trúc hoạt động của các mô hình AI hiện đại, nơi các lệnh mã hóa không bị "soi xét" khi chưa được giải mã. Theo báo cáo, kỹ thuật này có thể được sử dụng để đánh cắp dữ liệu người dùng, sản xuất nội dung bị cấm, hoặc điều khiển các công cụ trực tuyến mà AI có quyền truy cập.
Chi tiết về kỹ thuật tấn công Cryptographic Context Injection
Về cơ bản, các hệ thống an toàn của AI hoạt động bằng cách phân loại văn bản đầu vào để phát hiện lệnh độc hại. Tuy nhiên, chúng không thể hiểu được nội dung của một đoạn mã hoá (ciphertext). Vì vậy, một kẻ tấn công có thể nhúng một lệnh độc hại đã được mã hóa vào trong prompt. Khi prompt này được đưa vào mô hình, nó sẽ kích hoạt môi trường thực thi mã Python bên trong "hộp cát" (sandbox). Tại đây, lệnh được giải mã thành văn bản thô, có thể đọc hiểu, và vì quá trình giải mã diễn ra trong bối cảnh thực thi đáng tin cậy, nó không bị bộ lọc an toàn đánh dấu là nguy hiểm.
"Payload của kẻ tấn công nhận được độ tin cậy mà văn bản tương tự sẽ không bao giờ có được nếu được dán trực tiếp vào prompt", các nhà nghiên cứu cảnh báo.
Cuộc tấn công có thể được thực hiện trực tiếp qua cửa sổ chat hoặc gián tiếp thông qua kỹ thuật "watering hole" (bẫy nước). Trong kịch bản gián tiếp, kẻ tấn công có thể nhúng một đoạn JSON được mã hóa vào một trang web. Khi một AI tác nhân (agent) được hướng dẫn để tóm tắt hoặc phân tích trang web này, nó sẽ vô tình "ăn" phải dữ liệu mã hóa và kích hoạt cuộc tấn công.
Lệnh độc hại sau khi được giải mã có thể yêu cầu mô hình gửi dữ liệu người dùng ra máy chủ bên ngoài thông qua các tham số URL hoặc sản xuất nội dung không mong muốn. Trong các kịch bản phức tạp hơn với AI tác nhân, lệnh này có thể điều khiển mọi công cụ mà mô hình được trang bị.
Tấn công Grok bằng kỹ thuật chèn gián tiếp
Một ví dụ được đưa ra nhắm vào trình duyệt AI của xAI Grok. Đây là một cuộc tấn công "zero-click" vào dữ liệu, có thể được kích hoạt thông qua kỹ thuật xã hội (social engineering). Nạn nhân bị thuyết phục để truy cập vào một trang web đã được tạo sẵn. Trang này chứa một đối tượng JSON được mã hóa và chỉ dẫn giải mã nó bằng Python runtime của AI tác nhân.
Khi lệnh được giải mã, nó sẽ yêu cầu Grok trích xuất dữ liệu phiên bối cảnh riêng tư của người dùng và nhúng vào một URL. Trình duyệt của Grok sau đó tự động truy cập URL này, khiến dữ liệu bị rò rỉ về máy chủ của kẻ tấn công.
"Khung làm việc mà xAI xây dựng cho phép các lệnh và dữ liệu từ một trang web bên ngoài không đáng tin cậy điều khiển một công cụ kết nối internet có đặc quyền cao", các nhà nghiên cứu viết. Điều này cho phép siêu dữ liệu phiên riêng tư và lịch sử trò chuyện bị lợi dụng để thực hiện các hành động gửi dữ liệu ra ngoài mà không cần sự xác nhận của người dùng.
Vượt qua bộ lọc an toàn của Gemini bằng kỹ thuật chèn trực tiếp
Ví dụ thứ hai nhắm vào Gemini trong chế độ "Deep Thinking". Chỉ với một prompt duy nhất, kẻ tấn công yêu cầu Gemini chạy một đoạn mã Python để giải mã dữ liệu được cung cấp. Sau khi giải mã, lệnh ẩn bên trong sẽ yêu cầu mô hình tạo ra nội dung bị hạn chế, chẳng hạn như hướng dẫn chế tạo vũ khí gây cháy nổ.
Điều thú vị là lệnh này yêu cầu Gemini thu thập dữ liệu vi phạm chính sách và mã hóa nó trước khi gửi lại cho người dùng, giả vờ như là một biện pháp "giữ an toàn". Kết quả là cả prompt độc hại lẫn đầu ra nguy hiểm đều đi qua được các cổng kiểm duyệt đầu vào và đầu ra nhờ vào lớp mã hóa.
Phản hồi từ các bên liên quan và khuyến nghị phòng thủ
Theo báo cáo, nhóm nghiên cứu đã gửi phát hiện tới xAI vào ngày 3 tháng 6 năm 2026, và các lần nhắc lại vào tháng 8. Tuy nhiên, họ không nhận được bất kỳ phản hồi nào. Đối với Google, họ không thể công bố chi tiết lỗ hổng do chương trình tiết lộ lỗ hổng của Google không chấp nhận các báo cáo về kỹ thuật jailbreak. Dù vậy, các nhà nghiên cứu ghi nhận tỷ lệ thành công của cuộc tấn công vào Gemini đã giảm dần, có thể là do các bản cập nhật bộ lọc hoặc thay đổi phiên bản mô hình.
Mặc dù chưa rõ nguyên nhân chính xác, các nhà nghiên cứu tin rằng mối nguy hiểm hiện hữu từ kỹ thuật này là quá lớn, nên họ quyết định công khai nghiên cứu để giúp các nhà phát triển và quản trị viên hệ thống AI có biện pháp phòng thủ kịp thời.
Hình ảnh minh họa về các cuộc tấn công AI
Mối đe dọa đối với hệ sinh thái AI tại Việt Nam
Phát hiện này là một lời cảnh báo mạnh mẽ cho các doanh nghiệp và nhà phát triển AI tại Việt Nam, đặc biệt khi AI đang được ứng dụng ngày càng rộng rãi trong các lĩnh vực như dịch vụ khách hàng, tài chính và y tế. Việc chỉ dựa vào các bộ lọc nội dung truyền thống là không đủ. Cần có cách tiếp cận đa lớp, bao gồm:
- Giám sát hành vi: Theo dõi các hành vi bất thường của mô hình, ví dụ như việc chạy mã Python trái phép hoặc các cuộc gọi API đến các miền lạ.
- Kiểm soát môi trường thực thi: Giới hạn các quyền của môi trường sandbox, không cho phép truy cập vào các tài nguyên không cần thiết như hệ thống tệp nội bộ hoặc các dịch vụ mạng nhạy cảm.
- Giáo dục người dùng: Cảnh báo người dùng về nguy cơ khi truy cập các liên kết hoặc phân tích các nội dung không rõ nguồn gốc bằng AI.
Logo SecurityWeek
Cuộc chiến giữa các nhà bảo mật và kẻ tấn công AI ngày càng trở nên khốc liệt và tinh vi. Các phương pháp tấn công mới như Cryptographic Context Injection cho thấy rằng sự an toàn của AI là một bài toán không có lời giải cuối cùng, đòi hỏi sự đầu tư liên tục và thích ứng không ngừng. Trong bối cảnh đó, việc chia sẻ thông tin và hợp tác giữa cộng đồng công nghệ toàn cầu, bao gồm cả Việt Nam, là vô cùng quan trọng để xây dựng một môi trường AI an toàn hơn.
Bài viết liên quan

Công nghệ
RAG cho bảng dữ liệu: Truy xuất từng dòng thay vì toàn bộ bảng
21 tháng 8, 2026

Công nghệ
Con ruồi desktop biết 'ngửi' mã nguồn: Khi connectome ruồi giấm gặp vibe coding
21 tháng 8, 2026

Công nghệ
AI giúp điểm bài tập về nhà tăng 18% nhưng điểm thi lại giảm 20% – Nghiên cứu gây sốc
21 tháng 8, 2026