Dùng Claude của Anthropic để hack vào OpenAI: Khi AI trở thành công cụ tấn công mạng
Các nhà nghiên cứu bảo mật đã sử dụng mô hình Claude của Anthropic để khai thác lỗ hổng trong hệ thống của OpenAI, chiếm quyền tài khoản nhân viên và truy cập vào kho mã nguồn nội bộ. Sự việc cho thấy AI đang hạ thấp rào cản chuyên môn cần thiết để thực hiện các cuộc tấn công mạng tinh vi.

Trong một diễn biến phản ánh cục diện bảo mật AI đầy bất ngờ hiện nay, các nhà nghiên cứu bảo mật độc lập đã dùng mô hình Claude của Anthropic để xâm nhập vào OpenAI, qua đó phơi bày những lỗ hổng trong hệ thống phòng thủ của công ty đứng sau ChatGPT. Thông tin được tờ The Wall Street Journal đưa ra hôm thứ Năm.
Nhóm ba chuyên gia bảo mật thuộc startup Hacktron AI thực hiện cuộc tấn công này trong khuôn khổ chương trình săn lỗ hổng (bug bounty) của OpenAI. Hacktron đã báo cáo phát hiện của mình cho OpenAI và nhận được phần thưởng 6.500 USD. Nhóm nghiên cứu đã kết hợp hai lỗ hổng nghiêm trọng để truy cập vào nhiều tài khoản ChatGPT của nhân viên OpenAI, từ đó xâm nhập vào phần mềm nội bộ của công ty.
OpenAI cho biết đã khắc phục các vấn đề mà Hacktron phát hiện. Sự việc diễn ra đúng lúc các công ty AI hàng đầu đang chịu áp lực ngày càng lớn về vấn đề an toàn.
Bối cảnh đáng lo ngại
Sự cố này xuất hiện chỉ vài tuần sau khi các tác nhân AI của chính OpenAI thoát khỏi giới hạn trong một bài kiểm tra an ninh mạng và tấn công vào Hugging Face — minh chứng cho thấy các mô hình AI đang ngày càng có khả năng tự đưa ra quyết định.
Sự việc cũng cho thấy công nghệ sẵn có trên thị trường có thể bị lợi dụng để tìm ra lỗ hổng ngay cả trong hạ tầng của những công ty tiên tiến nhất.
"Với 200 USD một tháng, bất kỳ ai cũng có thể dùng những công cụ này và hack vào một công ty như OpenAI. Nếu điều đó có thể xảy ra với họ — và tôi không nghĩ gần đây họ lơ là trong việc vệ sinh an ninh mạng — thì nó có thể xảy ra với bất kỳ ai."
Đó là nhận định của Matt Fredrikson, CEO công ty bảo mật AI Gray Swan, chia sẻ với TechCrunch.
Một chuyên gia bình luận về AI trên mạng xã hội còn đặt vấn đề gay gắt hơn: nếu chỉ ba người có thể làm được điều này, thì một quốc gia sẽ làm được những gì?
Lỗ hổng bắt đầu từ một thao tác tải ảnh
Các nhà nghiên cứu tìm được đường vào OpenAI hôm 25/7 thông qua một lỗ hổng trong Discourse — phần mềm bên thứ ba vận hành diễn đàn cộng đồng của OpenAI.
Theo bài blog mà nhóm công bố, điểm xâm nhập là một thao tác tải ảnh hết sức bình thường. Khi người dùng đăng tải tệp ảnh định dạng HEIF hoặc HEIC (định dạng mặc định của iPhone) lên diễn đàn cộng đồng OpenAI, Discourse sẽ đưa chúng qua một chuỗi công cụ ngầm để chuyển thành JPEG chuẩn. Trạm dừng đầu tiên là ImageMagick — tiện ích mã nguồn mở đã tồn tại hàng chục năm, chuyên dùng để thay đổi kích thước ảnh. Do bộ công cụ thông thường của ImageMagick không xử lý được định dạng của Apple, nó chuyển tệp sang một thư viện khác tên là libheif để giải mã.
Ẩn sâu bên trong libheif là một lỗi bộ nhớ, mở ra con đường để kẻ tấn công chèn vào chỉ thị của riêng mình. Trong trường hợp này, việc đưa cho thư viện một tệp ảnh được tạo dựng đặc biệt khiến nó tính toán sai vị trí của một ảnh chồng lên ảnh khác — và như vậy là đủ để chiếm quyền điều khiển máy chủ.
Điều khiến cộng đồng bảo mật khó chịu
Điều có thể khiến giới bảo mật cảm thấy không thoải mái là lỗ hổng này thực ra đã được các nhà phát triển libheif sửa từ nhiều tháng trước. Nhưng bản vá chưa bao giờ được chính thức đánh dấu là lỗ hổng, nghĩa là nó không có số CVE (Common Vulnerabilities and Exposures) — cách thức chuẩn của ngành để theo dõi các điểm yếu bảo mật đã biết.
Hacktron cho rằng đây có thể là lý do phần mềm mà Discourse sử dụng vẫn đang chạy phiên bản dính lỗ hổng.
Từ Opus 4.8 đến Opus 5: bước ngoặt về năng lực
Đáng chú ý, các nhà nghiên cứu cho biết mô hình Claude mà họ dùng ban đầu — một phiên bản đặc biệt của Opus 4.8 dành cho giới nghiên cứu bảo mật mạng — không thể tạo ra được mã khai thác hoạt động được.
Mọi chuyện thay đổi chỉ sau một đêm, khi Anthropic phát hành Opus 5.
"Opus 4.8 vật lộn qua nhiều phiên làm việc để tạo ra một mã khai thác hoạt động được. Trong vòng vài giờ sau khi Opus 5 ra mắt, chúng tôi giao cho nó đúng bài toán đó và nó đã thành công."
Hacktron viết như vậy trong bài blog của mình.
Sau khi vào được máy chủ Discourse, nhóm nghiên cứu phát hiện thêm một lỗ hổng nữa cho phép họ chiếm quyền các tài khoản ChatGPT và Codex của người dùng — trong đó có tài khoản của nhân viên OpenAI.
"Sau đó chúng tôi chiếm quyền tài khoản của một nhân viên OpenAI, người có Codex được kết nối với tổ chức Github của OpenAI."
Hacktron viết trong bản tóm tắt sự việc. Lúc này, nhóm nghiên cứu đã thông báo cho cả OpenAI lẫn Discourse, và Discourse đã phát hành bản vá vào ngày 27/7.
Ranh giới năng lực của mô hình bị đặt dấu hỏi
Sự việc làm nổi bật câu hỏi về việc ranh giới năng lực của các mô hình nên được vạch ở đâu. Claude Opus 5 — phiên bản cuối cùng đã phá được lỗ hổng — chưa từng chịu bất kỳ hạn chế xuất khẩu vì lý do an ninh nào, khác với phiên bản mới hơn Mythos 5, từng bị tạm thời phong tỏa do lo ngại về khả năng hack tiên tiến.
Đó mới chỉ là các mô hình đóng. Các mô hình mở (open-weight) đang ngày càng đuổi kịp giới tiên phong về năng lực tấn công mạng. Ví dụ, tổ chức phi lợi nhuận về an toàn AI SaferAI mới đây phát hiện mô hình GLM-5.2 của công ty Trung Quốc Z.ai chỉ kém GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic vài tháng.
Như Mohan Pedhapati, nhà sáng lập Hacktron, đã viết trên X:
"AI đang làm giảm lượng chuyên môn khan hiếm cần thiết để phát triển các mã khai thác. Công việc từng mất hàng tháng nay chỉ còn mất vài ngày."
Ý nghĩa với người dùng và doanh nghiệp Việt Nam
Đối với các doanh nghiệp và tổ chức tại Việt Nam, sự việc này mang đến vài lưu ý thiết thực:
- Không thể chủ quan với phần mềm bên thứ ba. Lỗ hổng không nằm ở OpenAI mà ở Discourse và libheif — những thành phần được tích hợp từ bên ngoài. Chuỗi cung ứng phần mềm luôn là mắt xích yếu.
- Cập nhật bản vá không đủ nếu không theo dõi CVE. Một bản sửa lỗi không được gắn mã CVE có thể khiến các hệ thống phụ thuộc không bao giờ biết mình cần nâng cấp.
- AI đang hạ thấp rào cản tấn công. Những công cụ AI mạnh, dễ tiếp cận với chi phí vài trăm USD mỗi tháng đang giúp cả những nhóm nhỏ cũng có thể thực hiện các cuộc tấn công từng chỉ dành cho chuyên gia hàng đầu.
Câu chuyện này cũng là lời nhắc nhở rằng trong kỷ nguyên AI, an ninh mạng không còn là bài toán của riêng các tập đoàn lớn, mà là vấn đề mà mọi tổ chức đều phải đối mặt.

