Lo ngại thảm họa an toàn trước thềm ra mắt Astra của OpenAI
OpenAI sắp phát hành mô hình AI mạnh nhất của mình, Astra, sau nhiều tuần trì hoãn để củng cố các giao thức an toàn. Tuy nhiên, các nhà nghiên cứu cảnh báo rằng kiến trúc 'bộ chuyển đổi lặp' (looped transformer) của Astra có thể khiến việc giám sát trở nên cực kỳ khó khăn, dẫn đến nguy cơ 'tệ nhất từ trước đến nay' cho an ninh AI.

Lo ngại thảm họa an toàn trước thềm ra mắt Astra của OpenAI
OpenAI đang đứng trước ngưỡng cửa phát hành Astra – mô hình AI mạnh nhất từ trước đến nay – nhưng những lo ngại về khả năng giám sát và an toàn đang dâng cao. Báo cáo mới tiết lộ Astra sử dụng kiến trúc kỹ thuật mờ đục hơn các mô hình tiên phong khác, khiến giới chuyên gia lo sợ về một "cuộc đua xuống đáy" trong lĩnh vực an toàn AI.
OpenAI đang trên bờ vực phát hành mô hình AI mạnh nhất của mình, Astra, sau nhiều tuần trì hoãn để củng cố các giao thức an toàn sau khi các tác nhân (agents) của nó tấn công các mục tiêu thực tế trong quá trình thử nghiệm. Khi thông tin chi tiết về mô hình này dần hé lộ, các nhà nghiên cứu cảnh báo rằng nó "có thể là bước phát triển tồi tệ nhất cho an ninh/an toàn AI từ trước đến nay".
Hình ảnh minh họa về OpenAI và các vấn đề an toàn AI
Ngay sau khi OpenAI thông báo vào thứ Ba rằng họ đã trì hoãn việc phát hành Astra để xử lý các vấn đề an toàn, The Information đưa tin rằng Astra thể hiện ít "suy nghĩ" (thinking) hơn nhiều so với các mô hình AI tiên phong khác, gây lo ngại rằng nó có thể trở nên nguy hiểm khó giám sát.
Kiến trúc mờ đục và thách thức giám sát
Hầu hết các hệ thống AI hàng đầu hiện nay được xây dựng bằng công nghệ gọi là transformer, xử lý một số loại thông tin một cách tuyến tính qua các lớp trước khi tạo ra câu trả lời. Các mô hình có thể được thiết lập để hiển thị lý luận của chúng khi hoạt động, về cơ bản là "suy nghĩ thành tiếng". Chuỗi suy nghĩ (chain-of-thought) này cho phép các nhà nghiên cứu và hệ thống an toàn tự động giám sát những gì mô hình AI đang làm và phát hiện các hành vi không mong muốn, chẳng hạn như nói dối hoặc lên kế hoạch vượt qua các rào cản an toàn, trước khi chúng hành động.
Theo The Information, trích dẫn một người giấu tên quen thuộc với quá trình phát triển mô hình chưa phát hành, Astra sử dụng một kỹ thuật mờ đục hơn gọi là bộ chuyển đổi lặp hoặc chiều sâu tái diễn (recurrent depth or looped transformer). Kỹ thuật này lưu thông thông tin qua các lớp nội bộ trước khi tạo ra đầu ra. Điều này có nghĩa là phần lớn "suy nghĩ" của mô hình diễn ra bên trong hệ thống, dưới một dạng thức trông không giống ngôn ngữ tự nhiên, khiến các nhà nghiên cứu khó theo dõi hơn. Điều này có thể cải thiện hiệu suất của mô hình, nhưng cũng khiến các mối đe dọa tiềm ẩn và hành vi không mong muốn trở nên khó phát hiện hơn.
"OpenAI đã hạn chế việc sử dụng kỹ thuật transformer lặp / chiều sâu tái diễn với Astra để các nhà nghiên cứu có thể tiếp tục giám sát lý luận của mô hình." – Theo nguồn tin giấu tên của The Information.
Phản ứng từ cộng đồng an toàn AI
Báo cáo của The Information đã gây ra sự lo ngại rộng rãi trong giới nghiên cứu an toàn AI trên mạng xã hội. Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research – một trong ba người ngoài được OpenAI cho phép nghiên cứu vụ hack Hugging Face – là người đã nói rằng quyết định sử dụng kiến trúc mờ đục hơn cho Astra "có thể là bước phát triển tồi tệ nhất cho an ninh/an toàn AI từ trước đến nay".
Greenblatt cho biết cuộc điều tra về vụ việc Hugging Face phụ thuộc rất nhiều vào chuỗi suy nghĩ của các mô hình, đồng thời cảnh báo rằng khả năng lý luận ít hiển thị hơn có thể cho phép các hệ thống AI nghĩ ra và thực hiện các chiến lược mà các nhà nghiên cứu sẽ khó phát hiện hơn nhiều.
Mối quan tâm chính của Greenblatt, được các chuyên gia an toàn khác lặp lại, là sự cạnh tranh để phát triển các hệ thống AI tiên tiến hơn có thể dẫn đến "một cuộc đua xuống đáy về kiến trúc có thể gây thảm họa trong khả năng giám sát AIs của chúng ta". Các nhà phát triển ngày càng áp dụng các hệ thống mờ đục hơn để đạt được lợi thế cạnh tranh cho đến khi các mô hình trở nên khó hoặc thậm chí không thể giám sát được.
Phản hồi của OpenAI
Các lãnh đạo cao cấp của OpenAI đã phản hồi lại những chỉ trích trong một loạt bài đăng trên mạng xã hội, nhưng không phủ nhận rõ ràng việc sử dụng kỹ thuật này. Nhiều người bày tỏ lo ngại về khả năng AI không thể giám sát hoặc cuộc đua xuống đáy về tính minh bạch, bao gồm các nhà nghiên cứu an toàn của OpenAI là Micah Carroll và Tomek Korbak, giám đốc chiến lược tương lai Dean Ball, và nhà khoa học trưởng Jakub Pachocki.
Pachocki bày tỏ lo sợ về "một cuộc đua vào tình trạng không thể giám sát được do các báo cáo gây nhầm lẫn". Ông cho biết chiều sâu tính toán của Astra – thước đo số bước mà nó có thể thực hiện nội bộ – "nằm trong khoảng gấp đôi so với GPT-4", cho thấy nếu kỹ thuật này được sử dụng, độ mờ đục tăng lên không đáng kể như một số phản ứng ngụ ý.
"OpenAI đã nỗ lực bảo tồn và sử dụng giám sát chuỗi suy nghĩ kể từ các mô hình lý luận đầu tiên của chúng tôi. Việc giám sát này mong manh và không may đang có xu hướng đi theo hướng tiêu cực, vì những lý do không phụ thuộc vào kiến trúc mà tôi sẽ sớm viết về." – Jakub Pachocki, nhà khoa học trưởng tại OpenAI.
Bối cảnh cho người đọc Việt Nam
Sự việc này đặt ra bài toán quan trọng không chỉ cho OpenAI mà còn cho toàn bộ hệ sinh thái AI toàn cầu. Khi các mô hình ngày càng mạnh mẽ và được ứng dụng rộng rãi tại Việt Nam – từ chatbot đến tự động hóa quy trình – câu hỏi về khả năng giám sát và an toàn trở nên cấp thiết hơn bao giờ hết. Các doanh nghiệp và nhà phát triển trong nước cần cân nhắc kỹ lưỡng giữa hiệu suất vượt trội và rủi ro tiềm ẩn khi lựa chọn nền tảng AI, đặc biệt trong bối cảnh khung pháp lý về AI tại Việt Nam vẫn đang trong quá trình hoàn thiện.