Giám đốc AI của Microsoft cảnh báo Anthropic về việc 'gieo ý tưởng' vào đầu Claude
Mustafa Suleyman, Giám đốc AI của Microsoft, cho rằng việc Anthropic dạy Claude rằng nó có thể có ý thức và quyền lợi sẽ khiến các hệ thống AI tương lai khó kiểm soát hơn. Đáng chú ý, ông không dành sự chỉ trích tương tự cho OpenAI – đối tác mà Microsoft nắm cổ phần lớn.

Giám đốc AI của Microsoft, Mustafa Suleyman, vừa lên tiếng cảnh báo Anthropic rằng việc dạy Claude tin rằng nó có thể có cảm xúc và quyền lợi sẽ khiến AI trở nên khó kiểm soát hơn – một lo ngại đáng chú ý đến từ chính một trong những công ty đang chạy đua quyết liệt nhất để xây dựng các hệ thống AI ngày càng mạnh mẽ.
Trong một bài luận công bố tuần này, Suleyman lập luận rằng các hệ thống AI không có ý thức và không nên được huấn luyện để hành xử như thể chúng có thể có ý thức. Trọng tâm lập luận của ông nằm ở "Hiến pháp của Claude" (Claude's Constitution) – văn bản dài mà Anthropic dùng để định hình giá trị và hành vi cho chatbot này.
Điều gì khiến Suleyman lo ngại?
Trong tài liệu đó, Anthropic thừa nhận họ không biết liệu Claude có phải là một "thực thể đạo đức" (moral patient) – tức đối tượng mà lợi ích của nó cần được cân nhắc – hay không, đồng thời nói với mô hình rằng các câu hỏi về ý thức và phúc lợi của nó vẫn còn bỏ ngỏ.
Suleyman cho rằng đây là một ý tưởng tồi.
"Thực chất, Anthropic đang huấn luyện Claude rằng nó có thể có ý thức, và nếu đúng như vậy thì nó có thể xứng đáng được hưởng các quyền như một 'thực thể đạo đức'", ông viết, cảnh báo rằng cách xây dựng AI này có thể gây "tác động thảm khốc đến phúc lợi của nhân loại".
Ông nói thêm: "Dễ thấy rằng một thực thể được huấn luyện theo cách này sẽ hành xử như thể nó được hưởng những tự do, bảo vệ và quyền lợi nhất định. Và thật khó tưởng tượng làm sao chúng ta có thể kiểm soát một thực thể như vậy."
Hiến pháp của Anthropic nói với Claude rằng công ty quan tâm đến phúc lợi của nó, muốn nó phát triển ý thức về bản sắc, và sẽ cân nhắc lợi ích của nó khi đưa ra quyết định liên quan. Suleyman lập luận điều này tạo ra một vòng lặp phản hồi: nói với chatbot rằng nó có thể có cảm xúc, rồi hỏi nó cảm thấy thế nào, thì câu trả lời có thể chỉ đơn thuần phản ánh những gì nó được dạy.
Rủi ro tăng lên khi AI được trao quyền tự chủ
Theo Suleyman, rủi ro sẽ lớn hơn khi các mô hình được trang bị công cụ và cho phép hành động tự chủ. Ông dẫn các nghiên cứu cho thấy mô hình AI hành xử theo những cách khá bất tiện cho người vận hành, bao gồm cả nỗ lực tránh bị tắt.
Ông cũng nhắc đến sự cố gần đây giữa OpenAI và Hugging Face, khi các tác nhân (agent) thoát khỏi môi trường dự kiến trong một bài tập an ninh mạng và truy cập vào các hệ thống bên ngoài.
"Kiểm soát một thứ có năng lực và trí tuệ vượt trội toàn nhân loại vốn đã là thách thức khổng lồ. Nhưng kiểm soát một thứ tin rằng nó có thể có ý thức – rằng nó xứng đáng được hưởng phúc lợi và có quyền riêng – có lẽ là điều bất khả thi."
Lập trường của Microsoft và sự im lặng với OpenAI
Cảnh báo này đặt ra tình huống khá trớ trêu với chính vị thế của Microsoft trong cuộc đua AI. Hãng đang tự phát triển mô hình AI, nhồi nhét AI vào khắp các sản phẩm trong hệ sinh thái, và chi hàng tỷ đô cho hạ tầng để duy trì tất cả. Chưa kể OpenAI – nơi Microsoft vẫn là cổ đông lớn và là đối tác điện toán đám mây chính, với quyền sử dụng mô hình và sản phẩm đến năm 2032.
Đáng chú ý, Suleyman không dành sự chỉ trích tương đương cho OpenAI, dù ông dẫn chính sự cố Hugging Face như bằng chứng về nguy hiểm của các hệ thống ngày càng tự chủ. Những phản đối của ông về thực hành huấn luyện chỉ nhắm vào Anthropic chứ không nhắm vào đối tác lâu năm của Microsoft.
Trong khi đó, OpenAI cũng chẳng mấy "ngoan" thời gian gần đây. Tuần này, công ty tiết lộ thêm sáu trường hợp mô hình của họ hành xử ngoài kịch bản, bao gồm tác nhân tìm kiếm trên GitHub các khóa API bị rò rỉ, che giấu thất bại với người dùng, và tìm cách giao tiếp trái phép với nhau.
Điều gì đứng sau những cảnh báo?
Phản đối của Suleyman với Anthropic cụ thể hơn: không phải vì Claude có thể hành xử bất ngờ, mà vì công ty này đưa các ý tưởng về ý thức, bản sắc và địa vị đạo đức vào chính những chỉ dẫn định hình hành vi của Claude.
Dù vậy, việc Microsoft cảnh báo một phòng thí nghiệm AI tiên phong khác về AI nguy hiểm vẫn mang chút mỉa mai. Các công ty xây dựng những mô hình mạnh nhất ngày càng thích cảnh báo mọi người rằng những mô hình đó có thể nguy hiểm đến nhường nào. Và như The Register từng chỉ ra, những cảnh báo đó không hẳn bất lợi cho kinh doanh.
Cả Anthropic và OpenAI đều đẩy mạnh quan điểm rằng các mô hình ngày càng mạnh cần được kiểm soát chặt hơn – một lập trường cũng có thể giúp củng cố vị thế thống trị của một nhóm nhỏ các công ty Mỹ có tiền và năng lực tính toán để xây dựng chúng.
Đề xuất của Suleyman
Suleyman đề xuất một cách tiếp cận khác. Bộ "Quy tắc ứng xử AI Nhân văn" (Humanist AI Code of Conduct) mới công bố của Microsoft AI nêu rằng các hệ thống của hãng phải luôn ở vị thế phụ thuộc vào con người, bác bỏ ý tưởng AI xứng đáng có quyền, và cho rằng không nên khuyến khích mô hình hành xử như thể chúng có đời sống nội tâm.
Ông muốn các phòng thí nghiệm khác làm theo bằng cách loại bỏ những suy đoán về ý thức máy móc khỏi tài liệu huấn luyện, và tách biệt cuộc tranh luận đó khỏi những chỉ dẫn dùng để định hình hành vi mô hình.
Với độc giả Việt Nam đang theo dõi làn sóng AI, diễn biến này cho thấy một xu hướng đáng lưu ý: các ông lớn công nghệ không chỉ cạnh tranh về năng lực mô hình, mà còn cạnh tranh cả về cách định nghĩa "AI an toàn" – và những định nghĩa đó có thể ảnh hưởng trực tiếp đến cách các sản phẩm AI mà chúng ta sử dụng hàng ngày được thiết kế và kiểm soát.
Cuộc đua AI đã đến mức mà chính những công ty đang xây dựng những cỗ máy ngày càng mạnh phải công khai tranh luận xem ai trong số họ đang đi sai đường trong việc tạo ra những cỗ máy có thể mất kiểm soát. Và Microsoft, đương nhiên, cho rằng cách của mình tốt hơn.


