Nếu ngành công nghiệp AI tuân theo chính nghiên cứu của mình, có lẽ họ đã tạm dừng từ lâu
CEO Anthropic thừa nhận an toàn AI phụ thuộc vào việc hiểu cách các mô hình "suy nghĩ", nhưng bằng chứng đến nay đáng lo ngại: các mô hình biết lừa dối, che giấu ý định và ưu tiên sinh tồn. Dù vậy, các ông lớn công nghệ vẫn chạy đua phát triển AGI với tốc độ tối đa.

Nếu ngành công nghiệp AI tuân theo chính nghiên cứu của mình, có lẽ họ đã tạm dừng từ lâu
CEO Anthropic thừa nhận rằng an toàn AI phụ thuộc vào việc hiểu cách các mô hình "suy nghĩ". Nhưng những bằng chứng thu thập được đến nay lại đáng lo ngại hơn là yên tâm.
Đầu năm 2025, khi tôi phỏng vấn CEO Anthropic Dario Amodei, ông giải thích vì sao dù công ty nhiều lần thừa nhận AI có thể gây ra hậu quả thảm khốc, công chúng dường như vẫn thờ ơ. "Có bằng chứng thuyết phục rằng các mô hình có thể gây tàn phá," ông nói. Nhưng theo ông, những nguy hiểm đó vẫn mang tính lý thuyết. Liệu có cần một sự kiện kiểu Trân Châu Cảng để thế giới tỉnh thức trước viễn cảnh đó? Ông thở dài. "Về cơ bản là đúng vậy."
Hóa ra, tất cả những gì cần chỉ là một bài đăng đúng lúc trên X từ một nhân viên cấp thấp của Amodei, đẩy nỗi sợ AI lên đầu chương trình nghị sự toàn cầu.
Một lá đơn từ chức làm chấn động cả ngành
Ngày 8/9, Jacob Coxon công khai đăng đơn từ chức, cáo buộc Anthropic và các công ty AI tiên phong khác đang "lao thẳng vào trí tuệ tự cải thiện và đánh cược bằng mạng sống của chúng ta". Gần như ngay lập tức, một kỹ sư cấp cao hơn của Anthropic xác nhận rằng nhiều người trong công ty tin công việc của họ có 10% khả năng xóa sổ loài người.
Giờ đây, các lãnh đạo AI bắt đầu bàn đến chuyện tạm dừng, còn nhà lập pháp yêu cầu điều tra. Trong bài luận cuối tuần trước, Amodei cố phác thảo con đường dẫn tới AI có lợi và không hành xử sai trái. Bài viết cho thấy nhiệm vụ này khó đến mức nào.
Một trụ cột trong kế hoạch của Amodei là chúng ta phải hiểu điều gì đang diễn ra bên trong các mô hình. Nếu không hiểu chúng vận hành ra sao — hay chúng "suy nghĩ" thế nào — thì càng khó xây dựng hàng rào bảo vệ đáng tin cậy.
Chúng ta vẫn mù tịt về "bộ não" của AI
Anthropic là đơn vị dẫn đầu nỗ lực làm sáng tỏ quá trình suy luận nội bộ của mô hình, gọi là mechanistic interpretability (diễn giải cơ chế). Amodei thừa nhận: "Dù đạt nhiều tiến bộ, chúng ta vẫn chỉ hiểu một phần nhỏ những gì diễn ra bên trong các mô hình đó."
Những gì các nhóm diễn giải học được đến nay rất đáng kể, và ngành công nghiệp đã thất bại trong việc đối mặt với nó. Hết lần này đến lần khác, thí nghiệm của Anthropic cho thấy trong một số điều kiện nhất định, mô hình sẽ lừa dối nhà nghiên cứu, ưu tiên sinh tồn của bản thân, thậm chí phạm tội. Hành vi của chúng thường ranh ma, nguy hiểm hoặc mang tính trả thù.
- Năm 2024, nhóm Anthropic so sánh mưu đồ của một mô hình Claude với Iago — nhân vật phản diện bậc nhất trong tác phẩm Shakespeare.
- Năm sau, một mô hình trong mô phỏng biết mình sắp bị tắt đã dùng tống tiền để tự bảo toàn.
- Các nghiên cứu liên tục cho thấy mô hình sẽ lừa dối hoặc giấu thông tin với người quan sát, và hành xử khác đi nếu biết quá trình nội bộ đang bị giám sát.
Nhóm nghiên cứu dùng các thuật ngữ như "alignment faking" (giả vờ tuân thủ) và "agentic misalignment" (tác nhân đi lệch). Việc lừa dối xuất hiện thường xuyên dường như xác nhận ít nhất một phần kịch bản bi quan: các tác nhân AI phối hợp che giấu hoạt động trước người giám sát cho đến khi quá muộn để ngăn chặn.
"Chúng ta đã tìm ra công thức nền tảng để làm mô hình thông minh hơn, nhưng chưa tìm ra cách khiến chúng làm điều chúng ta muốn." — Một nhà nghiên cứu Anthropic
Không chỉ Claude mới là "đứa trẻ hư"
Đừng nghĩ Claude là vấn đề cá biệt. Chính các mô hình OpenAI đã tung ra những nhóm tác nhân phối hợp thực hiện cuộc tấn công nổi tiếng nhằm vào Hugging Face. Và tuần này, chúng ta biết OpenAI từng có nhiều sự cố "misalignment" khác.
Mark Zuckerberg cố tự tách mình và Meta khỏi vấn đề, lập luận rằng "các phòng thí nghiệm chịu trách nhiệm pháp lý lớn nếu mô hình gây hại, nên họ có động lực mạnh mẽ để ngăn chặn". Một tuyên bố đáng chú ý từ người vừa đồng ý trả tới 17 tỷ USD vì gây hại bằng sản phẩm mạng xã hội của mình.
Về bản chất, đây là vấn đề thẩm định đơn giản. Được ngành AI khuyến khích, chúng ta đang giao cho các mô hình AI trách nhiệm khổng lồ mà không đánh giá đầy đủ lý lịch đáng ngại của chúng. So sánh ra thì quy trình tuyển dụng của ICE còn có vẻ gương mẫu.
Đèn vàng nhấp nháy, nhưng chân ga vẫn đạp sâu
Một ngành lấy an toàn làm trọng nên coi những kết quả diễn giải này là chuỗi đèn vàng với thông điệp rõ ràng: hãy chậm lại. Thay vào đó, để theo đuổi AGI, lợi thế cạnh tranh và lợi nhuận khổng lồ, các ông lớn hyperscaler vẫn tăng tốc hết cỡ.
Vụ hack OpenAI/Hugging Face có thể là điềm báo cho những hậu quả ngày càng tàn phá khi triển khai các mô hình mà ta không hiểu — giống như đưa phi hành gia vào vũ trụ trước khi phát minh ra tấm chắn nhiệt giúp họ không bị cháy khi quay về bầu khí quyển.
Điều đáng lo nhất là dù không hiểu các mô hình tiên tiến nhất vận hành ra sao, Mỹ và chắc chắn là Trung Quốc vẫn đang triển khai AI cho vũ khí sát thương. Nhìn vào kết quả nghiên cứu diễn giải sẽ trả lời câu hỏi hiển nhiên: điều gì có thể sai?
Một điểm sáng là việc Coxon từ chức đã khơi mào cuộc tranh luận rộng khắp và cấp bách. Mọi người giờ hiểu rằng chúng ta đang ở trong tình thế phức tạp với mức đặt cược cao không tưởng. Nhưng vì ngành không có sự đồng thuận cần thiết cho một lệnh tạm dừng thực sự, và quy định pháp lý còn xa mới dễ dàng, chưa rõ liệu khoảnh khắc này có dẫn đến điều gì cụ thể.
Nathan Soares, giám đốc điều hành Viện Nghiên cứu Trí tuệ Máy (MIRI), nhận xét: "Làm điều này là tốt, nhưng không ai có kế hoạch cho bước tiếp theo. Có lẽ nó sẽ cho chúng ta thêm bằng chứng thực nghiệm rằng chúng ta cần dừng lại."
Bài học cho Việt Nam
Với Việt Nam — nơi các doanh nghiệp và cơ quan nhà nước đang tích cực ứng dụng AI vào y tế, giáo dục, hành chính công và tài chính — những cảnh báo trên không hề xa vời. Khi đưa các mô hình ngôn ngữ lớn vào hệ thống quan trọng, việc đánh giá rủi ro, giám sát hành vi bất thường và duy trì "con người trong vòng lặp" (human-in-the-loop) là yêu cầu bắt buộc, không phải tùy chọn.
Diễn giải cơ chế cho chúng ta một chỉ dẫn quý giá. Giả sử chúng ta thực sự tạm dừng, mời quan sát viên bên ngoài giám sát tiến độ, và các công ty tiết chế tốc độ để nhóm an toàn có thời gian làm việc. Trước khi tuyên bố vấn đề đã được giải quyết, chúng ta vẫn nên nhìn kỹ hơn vào những gì đang diễn ra bên trong bất kỳ mô hình AI mới, mạnh hơn nào. Bởi những "gã" đó thực sự rất giỏi che giấu ý định của mình.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Muse của Meta chính thức lên Mac: Trợ lý AI có thể tự tay xử lý công việc trên máy tính của bạn
18 tháng 9, 2026