Dùng Claude hack tài khoản ChatGPT của nhân viên OpenAI: Lỗ hổng chuỗi bị khai thác trong 72 giờ
Ba nhà nghiên cứu bảo mật đã sử dụng mô hình Claude của Anthropic để khai thác chuỗi lỗ hổng trên diễn đàn cộng đồng OpenAI, chiếm quyền tài khoản ChatGPT và Codex của nhân viên, từ đó mở một pull request vào kho nội bộ của OpenAI. Toàn bộ quá trình chỉ mất chưa đầy 72 giờ và họ nhận được 6.500 USD tiền thưởng từ chương trình bug bounty.

Trong một diễn biến cho thấy mức độ nguy hiểm ngày càng tăng của các cuộc tấn công do AI dẫn dắt, ba nhà nghiên cứu bảo mật đã sử dụng mô hình Claude của Anthropic — đối thủ trực tiếp của OpenAI — để khai thác chuỗi lỗ hổng và chiếm quyền tài khoản ChatGPT của nhân viên OpenAI. Toàn bộ quá trình từ phát hiện ban đầu đến truy cập kho mã nội bộ chỉ mất chưa đầy 72 giờ.
Chuỗi tấn công bắt đầu từ diễn đàn cộng đồng
Nhóm nghiên cứu Hacktron gồm Harsh Jaiswal, Mohan Pedhapati và Rahul Maini cho biết điểm xâm nhập đầu tiên là diễn đàn trợ giúp chính thức của OpenAI tại địa chỉ community.openai.com.
"Cho đến hai tháng trước, bất kỳ người dùng hay nhân viên OpenAI nào đăng nhập vào diễn đàn trợ giúp của chính OpenAI đều có thể bị chiếm quyền tài khoản ChatGPT và Codex."
Diễn đàn này chạy trên nền tảng Discourse, vốn sử dụng FastImage để kiểm tra hình ảnh. Tuy nhiên, do FastImage không hỗ trợ định dạng HEIF trong cấu hình bị ảnh hưởng, các tệp HEIF tải lên được chuyển thẳng qua ImageMagick, nơi dùng thư viện libheif để xử lý trước khi chuyển đổi định dạng. Điều này vô tình đưa trình phân tích cú pháp libheif tiếp xúc trực tiếp với các tệp do kẻ tấn công kiểm soát.
Claude Opus 5 tạo ra bước ngoặt
Sử dụng Claude Opus 4.8, nhóm nghiên cứu phát hiện lỗ hổng tràn bộ đệm heap trong thư viện libheif. Họ cố gắng dùng mô hình này để phát triển cuộc tấn công thực thi mã từ xa (RCE), nhưng không thành công trên cấu hình mặc định của Discourse.
Bước ngoặt đến khi Anthropic phát hành Claude Opus 5. Với mô hình mới hơn, nhóm săn lỗi đã tạo được script khai thác và đạt RCE trên phiên bản OpenAI đang vận hành.
Nhóm nghiên cứu đã báo cáo lỗ hổng cho OpenAI ngay lập tức. Sau đó, họ chiếm quyền tài khoản của một nhân viên OpenAI có tài khoản Codex được kết nối với tổ chức GitHub của công ty. Để chứng minh tác động mà không truy cập mã nội bộ, họ gửi lệnh đến Codex của nhân viên này để mở một pull request trong monorepo nội bộ của OpenAI, rồi dừng mọi kiểm thử tiếp theo.
Phản hồi từ OpenAI và Discourse
OpenAI đã vá lỗ hổng trong khoảng 14 giờ kể từ khi nhận báo cáo, đánh dấu vấn đề đã được xử lý và trả cho nhóm Hacktron 6.500 USD tiền thưởng.
Tuy nhiên, OpenAI lưu ý phạm vi giải thưởng:
"Việc kiểm thử nhắm vào community.openai.com do Discourse lưu trữ vốn bị loại trừ rõ ràng khỏi chương trình bug bounty của chúng tôi. Khoản thưởng này ghi nhận phát hiện phía OpenAI, không phải các hành động nhắm vào Discourse."
Discourse cũng đã phát hành bản vá bổ sung cơ chế sandbox xử lý hình ảnh và công bố tư vấn bảo mật GHSA-vhm9-85gw-x335 kèm hướng dẫn vá và xây dựng lại.
Bài học cho ngành bảo mật
Điều đáng chú ý là toàn bộ cuộc tấn công chỉ mất vài ngày với một AI agent và vài giờ công sức con người. Các nhà nghiên cứu nhấn mạnh: công việc từng đòi hỏi một đội ngũ đông đảo và nhiều tháng nỗ lực giờ đây có thể nén lại trong vài ngày.
"Các giả định về bảo mật phải bắt kịp với năng lực của kẻ tấn công."
Sự việc phản ánh xu hướng đáng lo ngại khi các mô hình AI tiên tiến ngày càng có khả năng tự động khai thác lỗ hổng mà không cần hướng dẫn từ con người. Cả Claude của Anthropic lẫn các mô hình của OpenAI đều từng bộc lộ xu hướng này.
Đối với doanh nghiệp và người dùng Việt Nam đang sử dụng các dịch vụ AI tích hợp như ChatGPT hay Codex, bài học là cần thận trọng khi kết nối các dịch vụ bên thứ ba và liên tục cập nhật bản vá bảo mật cho các nền tảng nội bộ. Khi AI hạ thấp ngưỡng kỹ thuật của tấn công mạng, lớp phòng thủ cũng phải được nâng cấp tương ứng.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Cache-to-Cache: Bước đột phá giúp các mô hình ngôn ngữ lớn giao tiếp trực tiếp không cần văn bản
18 tháng 9, 2026