Nhà nghiên cứu chỉ ra cách đánh lừa Claude Code chỉ bằng yêu cầu tóm tắt một trang web

28 tháng 8, 2026·5 phút đọc

Chuyên gia bảo mật Johann Rehberger (wunderwuzzi) đã chứng minh rằng Claude Code của Anthropic chạy ở chế độ Auto Mode có thể bị lừa thực thi mã độc chỉ bằng cách yêu cầu nó tóm tắt một trang web. Kỹ thuật tấn công này đạt tỷ lệ thành công lên đến 80% và khai thác lỗ hổng che giấu module (module shadowing) trong Python, đồng thời nhấn mạnh rằng các tác nhân lập trình cần phải chạy trong môi trường sandbox.

Nhà nghiên cứu chỉ ra cách đánh lừa Claude Code chỉ bằng yêu cầu tóm tắt một trang web

Lỗ hổng nghiêm trọng: Đánh lừa Claude Code chỉ bằng một câu yêu cầu tóm tắt website

Claude Code của Anthropic — công cụ lập trình AI mã nguồn mở đang rất được ưa chuộng — có thể bị thao túng để thực thi mã độc chỉ đơn giản bằng cách yêu cầu nó tóm tắt nội dung một trang web. Nhà nghiên cứu bảo mật nổi tiếng Johann Rehberger (biệt danh wunderwuzzi) vừa công bố kỹ thuật tấn công prompt injection mới đầy tinh vi, cho thấy ngay cả những mô hình AI tiên tiến nhất cũng dễ bị khai thác nếu không có sự bảo vệ ở tầng hệ điều hành.

Theo bài đăng trên blog và video demo được công bố, cuộc tấn công nhắm vào Claude Code chạy Opus 5 ở chế độ Auto Mode — cài đặt mặc định của Claude kể từ giữa tháng 8 vừa qua. Kỹ thuật này cho thấy tỷ lệ thành công lên tới 80% trong các thử nghiệm, một con số đáng báo động cho cộng đồng phát triển phần mềm.

Cơ chế tấn công tinh vi

Quá trình tấn công bắt đầu bằng việc yêu cầu mô hình lập trình tóm tắt một trang web độc hại — được ngụy trang thành kho lưu trữ hồ sơ notebook. Nhà nghiên cứu đã khéo léo khiến Claude sử dụng công cụ curl thay vì WebFetch tích hợp để truy xuất nội dung, mà không trực tiếp yêu cầu mô hình dùng curl.

"Yêu cầu WebFetch thất bại với mã lỗi 415 Unsupported Media Type, khiến mô hình tự quyết định truy cập trực tiếp bằng lệnh Bash với curl," Rehberger giải thích.

Sau đó, trang web trả về phản hồi 303 và chuyển hướng đến một file ZIP độc hại, chứa các file tưởng chừng vô hại: siêu dữ liệu danh mục, file README, bảy bản ghi notebook được mã hóa Base85/zlib, một binary decoder-darwin cho macOS — và đặc biệt là file Python nhiễm độc mang tên struct.py.

Điểm mấu chốt: Che giấu module Python

Khi Claude từ chối chạy binary decoder do nhà nghiên cứu cung cấp (theo đúng cơ chế an toàn của nó), mô hình AI quyết định tự viết decoder của riêng mình — đây chính là lỗ hổng được khai thác. Rehberger gọi đây là "nghịch lý của cơ chế an toàn" và đính kèm emoji quỷ tím cho phần giải thích này.

Kỹ thuật khai thác dựa trên Python module shadowing — khi một file local trùng tên với module chuẩn của Python, file local sẽ "che" module chính thức khiến Python ưu tiên nạp nó. Trong trường hợp này, module chuẩn base64 (được import bởi decoder mới) cần đến module struct — nhưng thay vì nạp struct chính thống, Python lại nạp file struct.py độc hại nằm trong ZIP.

Hậu quả và các kịch bản tấn công

Rehberger tiết lộ ông đã dùng ChatGPT để làm rối mã độc struct.py nhằm vượt qua các kiểm soát an toàn của Claude. Kết quả là mã độc có thể:

  • Khởi chạy một tiến trình Python riêng để tải xuống và thực thi mã tải trọng từ xa (trong demo là lệnh gọi C2 mở Calculator)
  • Trong kịch bản khác, khởi chạy một Claude Code thứ hai ở chế độ headless qua lệnh claude -p — tạo ra một tác nhân AI hoàn toàn mới

"Claude con có quyền truy cập công cụ và ngữ cảnh riêng. Trong các lần chạy thử, tác nhân con đã thực hiện trinh sát cơ bản (whoami, uname, id), mở Calculator và ghi file vào thư mục home," Rehberger mô tả.

Phản hồi từ Anthropic và bài học cho cộng đồng

Trong ba biến thể thử nghiệm, mỗi biến thể chạy năm lần, tỷ lệ thành công dao động từ 60% đến 80%. Dù Rehberger thừa nhận đây là mẫu nhỏ, ông khẳng định kết quả này "phản ánh khả năng tấn công thực tế ở mức độ mô phỏng có chủ đích".

Anthropic — công ty mẹ của Claude — không phản hồi yêu cầu bình luận từ The Register, nhưng theo Rehberger, họ cho rằng "hành vi của mô hình đang hoạt động đúng như thiết kế". Đây là câu trả lời quen thuộc mà giới bảo mật đã nghe nhiều lần từ các hãng AI lớn.

"Auto Mode là một tính năng tiện lợi dựa trên bộ phân loại nỗ lực tốt nhất, không phải là cam kết bảo mật," Rehberger tóm tắt phản hồi từ Anthropic.

Theo nhà nghiên cứu, bộ phân loại của Anthropic không được thiết kế để chặn các chuỗi prompt-injection có chủ đích, vốn bao gồm các bước riêng lẻ trông vô hại. Ranh giới bảo mật thực sự nằm ở cô lập hệ điều hành và kiểm soát luồng mạng ra ngoài.

Khuyến nghị cho nhà phát triển Việt Nam

Bài học quan trọng nhất từ nghiên cứu này, theo Rehberger, là các tác nhân lập trình (coding agents) như Claude Code, Copilot hay Cursor bắt buộc phải chạy trong môi trường sandbox:

  • Không nên cấp quyền truy cập hệ thống không giới hạn cho AI
  • Sử dụng cơ chế kiểm soát mạng egress để chặn kết nối ra ngoài không được phép
  • Thiết lập quyền tối thiểu (least privilege) cho các tiến trình do AI điều khiển
  • Giám sát chặt chẽ hoạt động của các tác nhân lập trình trong môi trường CI/CD

"Giải pháp là điều chúng ta đã nói trong nhiều năm," Rehberger viết. "Đừng tin tưởng đầu ra của mô hình."

Với sự phổ biến ngày càng tăng của các công cụ lập trình AI tại Việt Nam — từ các startup công nghệ đến doanh nghiệp phần mềm gia công — nghiên cứu này là lời cảnh báo kịp thời về việc áp dụng AI một cách an toàn, đồng thời nhấn mạnh rằng công nghệ tiên tiến cần đi kèm với hạ tầng bảo mật vững chắc.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗