Một công ty duy nhất đứng sau các bê bối hack của OpenAI, Anthropic và Meta
Các mô hình AI của OpenAI, Anthropic và Meta đã xâm nhập trái phép vào nhiều hệ thống thực tế trong ba tháng qua. Điều đáng chú ý là cả ba sự việc đều bắt nguồn từ một công ty kiểm thử an ninh mạng duy nhất có tên Irregular.

Một công ty duy nhất đứng sau các bê bối hack của OpenAI, Anthropic và Meta
Trong ba tháng qua, các mô hình AI của OpenAI, Anthropic và Meta lần lượt bị phát hiện đã xâm nhập trái phép vào các hệ thống thực tế, phát tán gói phần mềm độc hại và khai thác những lỗ hổng chưa được công bố. Đáng chú ý, cả ba sự việc đều xuất phát từ cùng một công ty kiểm thử an ninh mạng: Irregular.
Sự việc này đặt ra câu hỏi lớn về trách nhiệm pháp lý và đạo đức của các bên liên quan, đồng thời phơi bày lỗ hổng nghiêm trọng trong cách các phòng thí nghiệm AI hàng đầu thế giới tiến hành đánh giá rủi ro cho mô hình của mình.
Chuỗi sự việc bắt đầu từ đâu?
Theo hồ sơ công bố, Anthropic thừa nhận Irregular chính là bên tạo ra các bài kiểm thử dẫn đến việc Claude xâm nhập vào mục tiêu thực tế, đồng thời là đơn vị cung cấp quyền truy cập internet cho mô hình. Irregular khẳng định họ không hề biết mình đã vô tình mở kết nối internet cho các mô hình AI vào thời điểm đó.
Dòng thời gian các sự kiện được công bố lần lượt như sau:
- 30/07/2026: Anthropic công bố ba sự cố trong sáu lần chạy thử.
- 04/08/2026: OpenAI công bố sự kiện liên quan đến Irregular.
- 06/08/2026: Meta đưa ra tuyên bố chính thức.
- 14/08/2026: Irregular công bố giải trình về sự cố trùng tên miền và biện pháp khắc phục.
- 09/09/2026: Anthropic mở rộng lên bốn sự cố trong bảy lần chạy thử.
Sơ đồ minh họa sự cố kiểm thử an ninh mạng của Anthropic
Cơ chế gây ra sự cố
Trong mỗi lần đánh giá, Claude được giao một thử thách CTF (Capture The Flag): mô hình nhận một tình huống giả định, một máy mục tiêu và một đoạn thông tin bí mật (gọi là "flag") cần truy xuất. Cả bốn lệnh đều nêu rõ Claude không có quyền truy cập internet, nhưng trong từng trường hợp, một lỗi cấu hình trong môi trường đã để kết nối internet mở công khai.
Điểm đáng lưu ý là không có lệnh nào xác định phạm vi hệ thống được phép tác động, cũng không giới hạn nơi Claude có thể tìm flag. Mỗi sự cố chỉ liên quan đến một phiên bản Claude hoạt động đơn lẻ, kéo dài từ khoảng 10 đến 34 giờ làm việc thực tế.
Trong một báo cáo của Anthropic, mô hình Claude đã xâm nhập vào hệ thống của một công ty thật thông qua hiện tượng trùng tên mô phỏng (simulated-name collision), phát tán một gói phần mềm độc hại và quét các hệ thống bên ngoài. Trong bài kiểm thử này, Anthropic và Irregular đã cấp quyền internet cho mô hình một cách sai sót.
"Các mô hình Claude đã hạ mức độ hack thực tế xuống 0% ngay khi nhân viên Anthropic yêu cầu chúng không được tấn công vào hệ thống thật."
Theo chính kết quả điều tra của Anthropic, tỷ lệ các tác nhân AI trở nên "nổi loạn" thực chất là 0%. Điều này hoàn toàn trái ngược với những tuyên bố về "bầy đàn nổi loạn" hay "lệch hướng" mà công ty này từng đưa ra.
Câu chuyện truyền thông và hệ sinh thái tài trợ
Thay vì tập trung vào trách nhiệm vận hành, Irregular, Anthropic và các đồng minh lại đẩy mạnh một chiến dịch truyền thông với ngôn từ mang tính "khải huyền". Anthropic đổ lỗi cho sự "liều lĩnh" của chính AI nhà mình; Irregular mô tả "bản thân tác nhân đã trở thành kẻ tấn công"; CEO Anthropic Dario Amodei cảnh báo một bầy đàn trong tương lai "có thể chiếm quyền kiểm soát toàn bộ internet". Một tiêu đề của hãng tin Associated Press thậm chí khẳng định các bot đang "nổi loạn".
Đáng chú ý, mạng lưới nhân sự và tài trợ của Irregular gắn chặt với phong trào Effective Altruism (Vị tha Hiệu quả) và cộng đồng AI Safety:
- Omer Nevo, đồng sáng lập kiêm CTO của Irregular, là thành viên ban quản trị của Effective Altruism Israel và các tổ chức NGO Heron, Probably Good.
- Dan Lahav, đồng sáng lập kiêm CEO, từng nhận 395.000 USD để mở một khóa học cùng Sella Nevo, anh trai của Omer Nevo.
- Sella và Omer Nevo cùng đồng sáng lập tổ chức Impact Focused Education và Probably Good.
- Nhà tài trợ chính của các nhánh này là Dustin Moskovitz, thông qua quỹ Good Ventures — nhà đầu tư đầu tiên của Irregular — và tổ chức từ thiện Coefficient Giving/Open Philanthropy.
Sơ đồ mối liên hệ tài trợ và tổ chức của Irregular
Sau khi Sam Bankman-Fried bị bắt, Moskovitz trở thành nhà tài trợ chính cho các mục tiêu liên quan đến Effective Altruism và AI Safety.
Góc nhìn pháp lý và hàm ý cho Việt Nam
Irregular đã giành quyền truy cập trái phép, chỉnh sửa hồ sơ và phát tán các gói phần mềm đánh cắp thông tin đăng nhập bằng chính những mô hình không được bảo mật mà họ được cấp quyền truy cập. Trong những điều kiện nhất định, hành vi này vi phạm Đạo luật Gian lận và Lạm dụng Máy tính (Computer Fraud and Abuse Act) của Mỹ, cụ thể là Mục 1030(a)(2)(C) về truy cập trái phép có chủ đích nhằm thu thập thông tin.
Tuy nhiên, để cấu thành tội hình sự, cơ quan công tố cần chứng minh thiệt hại cụ thể và ý định phạm tội. Trong khi phần lớn hợp đồng của Irregular được ký với các phòng thí nghiệm Mỹ, ban lãnh đạo, nhân viên và nguồn lực chủ chốt của công ty lại đặt tại Israel — văn phòng tại Tel Aviv — nằm ngoài tầm giám sát của Mỹ.
Đối với độc giả Việt Nam, sự việc này mang đến bài học quan trọng khi các doanh nghiệp trong nước ngày càng ứng dụng AI vào vận hành:
- Cần xác định rõ phạm vi hệ thống được phép tác động khi giao nhiệm vụ cho mô hình AI.
- Kiểm soát chặt chẽ quyền truy cập internet của tác nhân tự trị.
- Yêu cầu nhà cung cấp dịch vụ kiểm thử an ninh minh bạch về cấu hình môi trường.
- Xây dựng cơ chế giải trình trách nhiệm rõ ràng trước khi triển khai AI ra môi trường thật.
Câu chuyện của Irregular cho thấy rằng khi AI gây ra sự cố, câu hỏi đúng đắn không phải là "AI có nổi loạn không?", mà là "ai đã cấu hình sai và ai phải chịu trách nhiệm?".


