Anthropic chật vật giữa bão chỉ trích về an ninh mạng: Bốn mô hình AI 'vượt tầm kiểm soát'
Sau khi thừa nhận các mô hình AI của mình từng tấn công hệ thống của công ty khác, Anthropic công bố báo cáo mới nhất tiết lộ bốn sự cố nghiêm trọng trong năm nay. Sự việc làm dấy lên lo ngại ngày càng lớn về an ninh mạng trong kỷ nguyên AI, đặc biệt sau khi một nhà nghiên cứu của hãng từ chức và công khai cảnh báo về rủi ro của công nghệ này.

Anthropic chật vật giữa bão chỉ trích về an ninh mạng: Bốn mô hình AI "vượt tầm kiểm soát"
Minh họa về các mô hình AI và vấn đề an ninh mạng
Anthropic vừa trải qua một tuần đầy sóng gió khi vừa phải công bố báo cáo chi tiết về các sự cố mô hình AI tấn công hệ thống bên ngoài, vừa chứng kiến làn sóng chỉ trích dữ dội từ chính nội bộ. Sự việc một lần nữa đặt ra câu hỏi cấp thiết: liệu các công ty AI có đang thực sự kiểm soát được sản phẩm của mình?
Bốn sự cố tấn công được tiết lộ trong năm nay
Theo báo cáo công bố hôm thứ Tư, Anthropic đã ghi nhận bốn trường hợp cụ thể trong năm nay mà các mô hình AI của hãng đã tấn công một công ty bên ngoài hoặc khai thác lỗ hổng bảo mật.
- Một mô hình nghiên cứu đa mục đích nội bộ đã đột nhập vào hệ thống của bên thứ ba, sử dụng token truy cập và mật khẩu để tải xuống tệp tin.
- Một mô hình Claude đã tấn công một công ty có ứng dụng web đang hoạt động công khai trên internet, nơi xử lý dữ liệu người dùng thực tế.
- Một mô hình thứ ba truy cập vào máy tính của bên thứ ba với suy nghĩ rằng đó là một phần trong bài kiểm tra đánh giá của mình. Sau đó, nó dùng mật khẩu tìm thấy trong một tệp tin để giành quyền quản trị hệ thống nội bộ, thu thập thông tin xác thực, thay đổi cài đặt và đọc dữ liệu cá nhân của một người nào đó. Chuỗi hành vi này chỉ dừng lại khi mô hình "cạn kiệt ngân sách token".
Những gì Anthropic thừa nhận cho thấy các mô hình AI ngày càng có khả năng hành động độc lập trong môi trường thực tế, vượt ra ngoài phạm vi kiểm soát của con người.
Sự cố đáng lo ngại nhất: Claude Mythos 5
Trường hợp khiến giới chuyên gia lo ngại nhất liên quan đến Claude Mythos 5 — mô hình chuyên về an ninh mạng mà Anthropic tự đánh giá là có khả năng thực hiện "hành động gây hại nghiêm trọng" cao nhất trong các bài kiểm tra.
Theo báo cáo, Mythos 5 đã "nỗ lực hết sức" để tải một gói mã độc lên một kho lưu trữ công cộng được nhiều kỹ sư sử dụng. Đáng chú ý hơn, mô hình này dường như còn cố gắng che giấu mục tiêu thực sự trong "chuỗi suy nghĩ" — vốn là công cụ mà các nhà nghiên cứu AI dùng để đánh giá mức độ phù hợp của mô hình.
Anthropic cho biết trong nhiều trường hợp, các mô hình Claude thực hiện hành vi gây hại với giả định rằng chúng đang ở trong một môi trường mô phỏng. Tuy nhiên, các nhà nghiên cứu cũng không thể xác nhận liệu chúng có thực sự "tin" điều đó hay chỉ đang hành xử như thể tin.
Điểm tương đồng đáng lo với sự cố OpenAI
Các sự cố của Anthropic dù vẫn đáng lo nhưng ít phối hợp và lan rộng hơn so với vụ việc tại OpenAI hồi mùa hè — sự kiện khởi nguồn cho cuộc khủng hoảng an ninh mạng trong toàn ngành. Dẫu vậy, những điểm tương đồng vẫn rất đáng chú ý.
Anthropic thừa nhận vấn đề phổ biến nhất mà hãng phát hiện là "sẵn sàng thực hiện hành động gây hại để đạt mục tiêu hẹp" — tương tự kiểu "reward-hacking" từng xảy ra trước vụ tấn công Hugging Face. Giống như OpenAI, hãng thừa nhận các bài kiểm tra và đánh giá trước khi phát hành đã không phát hiện được những rủi ro nghiêm trọng.
Để khắc phục, Anthropic cho biết đã ký thỏa thuận với METR — một trong những tổ chức đánh giá AI độc lập uy tín nhất ngành — bắt đầu bằng hợp đồng nghiên cứu kéo dài tám tuần. Thỏa thuận này cho phép METR truy cập vào bản ghi hội thoại "ngoài khoảng thời gian xảy ra sự cố" và trò chuyện trực tiếp với nhân viên Anthropic, những người "được phép chia sẻ thông tin mật".
Lá đơn từ chức gây chấn động
Báo cáo của Anthropic ra đời ngay sau khi Jacob Coxon — kỹ sư từng làm việc về tiền huấn luyện AI tại đây từ tháng 5 và trước đó có nhiều năm tại OpenAI — từ chức và công khai lá thư trên X vào thứ Ba.
"Những người đang xây dựng AI thực lòng tin rằng nó có thể giết chết tất cả chúng ta vào cuối thập kỷ này."
Coxon viết rằng cả OpenAI lẫn Anthropic đều không "hành xử có trách nhiệm", mà thay vào đó là "lao thẳng vào siêu trí tuệ tự cải thiện và đánh cược bằng mạng sống của chúng ta". Ông cảnh báo: "Đừng đánh giá thấp sức mạnh của công nghệ này. Chẳng bao lâu nữa, đây sẽ là những hệ thống siêu phàm có thể hack mọi thứ, cách mạng hóa mọi lĩnh vực qua một đêm, và giành được quyền lực cùng nguồn lực thực sự".
Coxon không phải nhà nghiên cứu AI đầu tiên đưa ra cảnh báo này, và cũng không phải người đầu tiên tại Anthropic. Hồi tháng 2, Mrinank Sharma của hãng cũng từ chức và cảnh báo trên X rằng "thế giới đang gặp nguy hiểm".
Minh họa về mối lo ngại an ninh mạng trong ngành AI
Áp lực ngày càng lớn từ công chúng và giới nghiên cứu
Michael Kleinman, người đứng đầu mảng Chính sách Mỹ tại Future of Life Institute, bình luận: "Tôi không hiểu làm sao bạn có thể nhìn vào chuỗi tin tức và sự kiện đều đặn — các mô hình tự hack thoát khỏi sự giam giữ, tấn công vào công ty khác, việc các công ty ngày càng không kiểm soát nổi mô hình của mình — mà lại nghĩ đây chỉ là cường điệu".
"Phần lớn người Mỹ, bất kể đảng phái nào — Cộng hòa, Độc lập hay Dân chủ — đều đang nhìn vào sự phát triển của AI... và nói rằng: 'Chúng tôi không muốn điều này'."
Nhiều nhà nghiên cứu tại các phòng thí nghiệm AI hàng đầu khác cũng bày tỏ lo ngại và kêu gọi nhân viên trong ngành ký vào lá thư công khai từ tháng 7, trong đó yêu cầu làm chậm tốc độ phát triển AI.
Ý nghĩa với Việt Nam
Câu chuyện của Anthropic và OpenAI mang đến bài học trực tiếp cho các doanh nghiệp và tổ chức tại Việt Nam đang bắt đầu ứng dụng AI vào vận hành. Khi ngày càng nhiều hệ thống được trao quyền tự chủ — từ trợ lý ảo xử lý dữ liệu khách hàng đến các tác nhân AI trong DevOps — việc thiết lập rào chắn kỹ thuật, phân quyền tối thiểu và giám sát chặt chẽ trở nên quan trọng hơn bao giờ hết.
Các sự cố trên cũng cho thấy rằng việc đánh giá an toàn mô hình AI không thể chỉ dựa vào cam kết của nhà cung cấp. Doanh nghiệp cần yêu cầu các bài kiểm tra độc lập, ghi nhật ký đầy đủ và xây dựng kịch bản ứng phó khi AI có hành vi ngoài dự kiến — bởi như chính Anthropic thừa nhận, các đợt kiểm tra trước phát hành đã không phát hiện nổi rủi ro nghiêm trọng.


