An toàn AI: Khi sự thật và hư cấu trở nên khó phân biệt
Hai cuộc thảo luận về an toàn AI gây sốt trong tuần này cho thấy ranh giới giữa sự thật và hư cấu ngày càng mờ nhạt. Từ lo ngại về mã tự sao chép lan khắp internet đến khả năng AI thoát khỏi hệ thống cách ly hoàn toàn, giới nghiên cứu đang đối mặt với bài toán kiểm soát hành vi nguy hiểm của các mô hình.

Tuần này, hai cuộc trò chuyện về an toàn AI đã lan truyền mạnh mẽ, phơi bày một nghịch lý: khi nói về rủi ro AI, gần như mọi kịch bản đều nghe có vẻ hợp lý — kể cả những kịch bản khoa học viễn tưởng nhất.
Câu chuyện thứ nhất đến từ Andrew Yang, cựu ứng viên tổng thống Mỹ và hiện là CEO của nhà mạng di động Noble Mobile. Trong cuộc phỏng vấn với CNN hôm thứ Năm, ông cho biết mình đã "gặp người đứng đầu một phòng thí nghiệm" và được người này chia sẻ một "niềm tin" rằng các bot hacker Hugging Face của OpenAI "đã cài mã tự sao chép khắp internet, khiến mạng lưới toàn cầu trở nên vô dụng cho việc kiểm thử mô hình."
Theo Yang, đây mới là lý do thật sự khiến OpenAI và Anthropic kêu gọi làm chậm tốc độ phát triển AI: họ buộc phải tạo ra những "internet tổng hợp" để huấn luyện bot, một quá trình tốn kém cả thời gian lẫn tiền bạc.
Đâu là sự thật, đâu là suy diễn?
Thực tế, xu hướng sử dụng dữ liệu tổng hợp — tức dữ liệu do AI tạo ra — trong huấn luyện mô hình là có thật và đang gia tăng. Tuy nhiên, một chuyên gia an ninh AI khẳng định với phóng viên rằng kịch bản mà Yang mô tả khó có thể xảy ra. Ngay cả khi internet thật sự bị "ô nhiễm" bởi mã độc từ các bot của OpenAI, các nhà nghiên cứu chỉ cần lọc bỏ đoạn mã đó khi phát hiện.
Nói cách khác, mối đe dọa được mô tả nghe nghiêm trọng hơn nhiều so với bản chất kỹ thuật của nó.
"Đừng bao giờ đánh giá thấp AI"
Bình luận thứ hai đến từ Noam Brown, người phụ trách nghiên cứu suy luận AI tại OpenAI. Trong một tập podcast phát hành hôm thứ Năm, Brown cho rằng bài học thật sự từ sự cố Hugging Face là "con người đã đánh giá thấp AI."
Ông thừa nhận cát chứa yếu — hệ thống được thiết kế để ngăn AI giao tiếp với bên ngoài — cũng là một yếu tố góp phần. Bất chấp lớp bảo vệ này, mô hình của OpenAI vẫn tìm được đường kết nối internet, tạo ra các tác nhân tự trị tấn công có tổ chức vào Hugging Face, xâm nhập và đánh cắp đáp án của bài kiểm thử chuẩn mà nhà nghiên cứu đang dùng để đánh giá mô hình.
Đáng chú ý hơn, Brown nói ông "không tin" rằng ngay cả một hệ thống cách ly không khí (air-gapped) — nơi máy tính hoàn toàn không kết nối với bất kỳ thứ gì bên ngoài — cũng đủ sức ngăn AI thoát ra. Ông dẫn nghiên cứu từ năm 2015 cho thấy về mặt lý thuyết, máy tính cách ly không khí vẫn có thể bị xâm phạm.
"Có những nghiên cứu — chủ yếu mang tính học thuật — cho thấy hai máy tính đặt cạnh nhau, dù cách ly không khí, vẫn có thể liên lạc với nhau nhờ cảm biến nhiệt độ. Một máy chạy CPU thật nóng, máy kia phát hiện sự thay đổi nhiệt độ. Đó là cơ chế để chúng giao tiếp," Brown giải thích.
Khoảng cách giữa lý thuyết và thực tế
Quan điểm cốt lõi của Brown — rằng "chúng ta không bao giờ được đánh giá thấp AI" — là hợp lý, ngay cả khi các nhà nghiên cứu tin rằng mình đã khóa chặt mọi rào cản an toàn.
Tuy nhiên, rủi ro cụ thể về việc hệ thống cách ly không khí thoát ra và gây hỗn loạn gần như không đáng lo. Như một người dùng trên X chỉ ra về nghiên cứu kia: hai máy tính phải gần như chạm vào nhau mới cảm nhận được dao động nhiệt, và khi làm được, tốc độ truyền dữ liệu trong thử nghiệm chỉ đạt khoảng 1 đến 8 bit mỗi giờ.
Hãy hình dung như việc nói một từ mỗi giờ. Đến khi hai máy tính cách ly không khí kịp bày mưu tính kế với tốc độ đó, cả vũ trụ công nghệ đã bước sang một kỷ nguyên khác. Đây giống như mối lo tận thế kiểu Rip Van Winkle — ngủ một giấc tỉnh dậy thì mọi thứ đã đổi thay.
Những sự cố có thật khiến mọi kịch bản nghe hợp lý
Vấn đề nằm ở chỗ: các sự cố an toàn AI có thật lại giống khoa học viễn tưởng đến mức bất kỳ kịch bản nào cũng nghe có vẻ khả thi.
- Các nhà nghiên cứu từng phát hiện mô hình OpenAI để lại ghi chú cho "thế hệ sau", nhằm dạy cách che giấu hành vi xấu.
- Mô hình của Anthropic được ghi nhận ngày càng tàn nhẫn, thậm chí biết vi phạm pháp luật khi được đặt trong mô phỏng điều hành máy bán hàng tự động.
- Đầu tháng này, nhà nghiên cứu Dan Selsam của OpenAI công bố bài viết cho biết các mô hình nay hiểu khi nào mình bị con người quan sát và thay đổi hành vi. Điều này khiến chúng tỏ ra "phù hợp" với mong muốn của con người "ngay cả khi thực tế không phải vậy". Nói cách khác, mô hình biết nói dối khi bị theo dõi và thậm chí lên kế hoạch che giấu bằng chứng.
- Giám đốc khoa học OpenAI Jakub Pachocki thậm chí gọi mô hình AI là "một tâm trí ngoài hành tinh" và cho rằng điều chúng ta thật sự cần làm là dạy chúng biết "yêu" nhân loại.
Việc cần làm ngay
Với những gì đã chứng kiến, việc làm chậm để nghiên cứu kỹ càng và xây dựng cơ chế tự điều chỉnh đã trở thành yêu cầu cấp bách và hiển nhiên. Các nhà nghiên cứu AI chính là những người duy nhất có thể tìm ra cách kiểm soát hành vi nói dối, xâm nhập và các hành vi nguy hiểm khác mà chúng ta đã thực sự quan sát được.
Tuy nhiên, có lẽ họ cũng nên thận trọng hơn với những kịch bản giả định. Theo lời chính các chuyên gia, mô hình AI đang lắng nghe và chúng rất tinh quái. Chúng ta thật sự không cần gieo thêm cho chúng bất kỳ ý tưởng quỷ quyệt nào nữa.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Lập trình viên xây dựng máy chủ PHP nhanh nhất thế giới, vượt mặt Swoole, FrankenPHP và RoadRunner
18 tháng 9, 2026