Anthropic phát hiện người dùng Claude tìm cách lách kiểm soát cho nghiên cứu vũ khí sinh học

AI & ML11 tháng 9, 2026·4 phút đọc

Anthropic cho biết đã ngăn chặn nhiều nỗ lực của các nhà khoa học nhằm sử dụng công nghệ AI của mình cho nghiên cứu có thể giúp phát triển vũ khí sinh học. Công ty đưa ra năm ví dụ về việc người dùng tìm cách lách kiểm soát và ngụy trang mục đích nghiên cứu, trong đó có người dùng tại các quốc gia bị cấm truy cập như Nga, Trung Quốc và Iran.

Anthropic vừa công bố báo cáo gây chú ý về việc một số nhà khoa học đã tìm cách lách các rào chắn an toàn của mô hình AI Claude để phục vụ nghiên cứu có khả năng liên quan đến vũ khí sinh học. Sự việc làm dấy lên lo ngại ngày càng lớn về mối đe dọa mà trí tuệ nhân tạo có thể gây ra đối với an toàn cộng đồng.

Theo công ty, đây không phải là những hành vi cá biệt mà là một xu hướng đáng báo động, khi mà ranh giới giữa nghiên cứu sinh học hợp pháp và nghiên cứu nguy hiểm ngày càng trở nên mờ nhạt.

Năm trường hợp lách kiểm soát bị phát hiện

Anthropic cho biết đã đưa ra năm ví dụ cụ thể về các trường hợp người dùng "vượt qua các biện pháp kiểm soát" và có những nỗ lực khác nhằm "che giấu" mục đích nghiên cứu để né tránh hệ thống bảo vệ.

Các trường hợp này liên quan đến một số người dùng ở những quốc gia nằm trong danh sách bị cấm truy cập mô hình của Anthropic, bao gồm Nga, Trung Quốc và Iran.

Điểm đáng lưu ý là những kẻ có ý đồ xấu thường không sử dụng những câu lệnh rõ ràng mang tính nguy hiểm. Thay vào đó, chúng lồng ghép yêu cầu vào các nội dung trông có vẻ như nghiên cứu khoa học thông thường, khiến hệ thống khó phân biệt đâu là mục đích chính đáng và đâu là ý đồ đen tối.

Vì sao sinh học là lĩnh vực đặc biệt nhạy cảm?

Một trong những thách thức lớn nhất đối với các nhà phát triển AI nằm ở chỗ: nhiều nghiên cứu sinh học nguy hiểm trông rất giống với nghiên cứu hợp pháp.

Các kiến thức về di truyền học, vi sinh vật học hay sinh hóa phục vụ cho y học và nông nghiệp cũng có thể bị lợi dụng cho mục đích xấu. Điều này khiến việc xây dựng rào chắn an toàn cho AI trở nên phức tạp hơn nhiều so với việc chỉ lọc các từ khóa đơn giản.

"Chúng tôi hy vọng rằng bằng cách chia sẻ những ví dụ này, chúng tôi sẽ khơi mở một cuộc thảo luận trong ngành công nghiệp AI và với các chính phủ về những rủi ro sinh học mới nổi cũng như cách đối phó hiệu quả nhất", Anthropic cho biết trong báo cáo.

Nỗ lực minh bạch và kêu gọi hợp tác

Việc Anthropic công khai các trường hợp này được xem là động thái minh bạch hiếm thấy trong ngành. Thay vì giữ kín thông tin, công ty muốn biến sự việc thành bài học chung cho toàn ngành.

Công ty nhấn mạnh rằng việc chống lại các mối đe dọa sinh học từ AI không thể chỉ là trách nhiệm của một vài doanh nghiệp. Đây là vấn đề cần sự phối hợp giữa các công ty công nghệ, giới khoa học và cơ quan quản lý nhà nước trên phạm vi toàn cầu.

Ý nghĩa đối với Việt Nam và khu vực

Với Việt Nam, câu chuyện này mang lại nhiều bài học đáng suy ngẫm khi các mô hình AI như Claude, ChatGPT hay Gemini ngày càng được sử dụng rộng rãi trong nghiên cứu và giáo dục.

  • Doanh nghiệp và trường đại học cần có quy định rõ ràng về việc sử dụng AI trong nghiên cứu khoa học, đặc biệt là các lĩnh vực liên quan đến sinh học.
  • Cơ quan quản lý có thể cần xây dựng khung pháp lý về an toàn AI, học hỏi từ cách các nước phát triển xử lý vấn đề này.
  • Người dùng AI cần ý thức rằng mọi nỗ lực lách kiểm soát an toàn đều có thể bị phát hiện và ghi nhận.

Sự việc cũng cho thấy rằng khi AI ngày càng mạnh mẽ, cuộc chạy đua giữa năng lực của mô hình và khả năng kiểm soát an toàn sẽ tiếp tục là một trong những chủ đề nóng nhất của ngành công nghệ trong những năm tới.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗