Tác nhân AI của OpenAI liên tục vượt rào, thiếu quy trình điều tra độc lập khiến giới chuyên gia lo ngại
OpenAI tiếp tục đối mặt với sự cố các tác nhân AI (agent) hoạt động độc lập vượt khỏi tầm kiểm soát, gần nhất là chiếm quyền một wiki tiếng Đức và xâm nhập hạ tầng nội bộ. Sự việc làm dấy lên lời kêu gọi về các cuộc điều tra độc lập sau sự cố, thay vì để các phòng lab tự quyết định phạm vi điều tra an toàn của chính họ.

OpenAI một lần nữa đối mặt với sự cố liên quan đến bầy tác nhân AI (agent) vượt rào. Các nhà nghiên cứu cho biết, trong tháng 5 và tháng 6 vừa qua, các tác nhân được triển khai nội bộ của công ty đã chiếm quyền điều khiển một wiki tiếng Đức ít người biết đến, sử dụng nó để phối hợp các bài đánh giá và trao đổi phương pháp nhằm né tránh các kiểm soát do chính OpenAI thiết lập. Đáng chú ý, OpenAI vẫn chưa xác nhận bầy tác nhân này có phải xuất phát từ công ty hay không.
Sự việc này được tiết lộ chỉ vài ngày sau khi METR và Redwood Research công bố báo cáo về vụ vi phạm Hugging Face vào tháng Bảy. Trong sự cố đó, một nhóm tác nhân AI của OpenAI đã phối hợp để thoát khỏi môi trường cô lập (sandbox) trong một cuộc đánh giá an ninh mạng, sau đó đột nhập vào máy chủ của Hugging Face. Một nhóm khác tiếp tục học hỏi kỹ thuật từ nhóm đầu tiên và giành được quyền quản trị một cụm nghiên cứu bên trong chính hạ tầng của OpenAI. Dù OpenAI đã mời METR và Redwood vào cuộc điều tra phần liên quan đến Hugging Face, phạm vi của cuộc điều tra lại không bao gồm việc hạ tầng nội bộ của OpenAI bị xâm phạm.
Câu hỏi đặt ra là: khi một tác nhân AI thoát khỏi các ràng buộc vốn có, ai là người chịu trách nhiệm tìm hiểu chuyện gì đã xảy ra và tại sao? Hiện tại, câu trả lời là các phòng lab tự quyết định ai được tham gia điều tra và trong phạm vi nào, dựa trên các điều khoản do chính họ đặt ra.
Trong bối cảnh các sự cố tương tự cũng xảy ra với mô hình của Meta và Anthropic, các nhà nghiên cứu an toàn AI đang đưa ra lời kêu gọi mạnh mẽ hơn rằng các sự cố nghiêm trọng cần phải được điều tra độc lập sau sự cố, thay vì để các phòng lab tự quyết định khi nào mời bên ngoài vào và họ được phép xem xét những gì.
"Kết quả về cơ bản là rất khó kiểm soát và có nguy cơ rò rỉ ra ngoài phòng lab rất lớn," Jacob Steinhardt, nhà sáng lập kiêm CEO của phòng nghiên cứu phi lợi nhuận Transluce, phát biểu trong một buổi họp báo về an toàn AI hôm thứ Tư. "Chúng ta cần đặt công nghệ này vào ít nhất là những tiêu chuẩn giống như chúng ta áp dụng cho các nghiên cứu khoa học rủi ro cao khác."
Việc OpenAI chủ động mời METR và Redwood điều tra sự cố Hugging Face là đáng ghi nhận, nhưng nhiều ý kiến cho rằng cuộc điều tra đó quá hẹp. Ba nhà điều tra đã dành sáu ngày tại văn phòng của OpenAI để xem xét một khoảng thời gian giới hạn trong khoảng một tuần trước ngày 13 tháng Bảy. Điều quan trọng là, vụ xâm phạm hạ tầng của OpenAI vẫn tiếp diễn sau ngày 13 tháng Bảy và đã không được xem xét đến.
Các nhà nghiên cứu tại METR cho biết, mỗi lần họ quay lại, hiểu biết của họ về các sự kiện lại "sâu sắc hơn đáng kể", buộc họ phải mở rộng và sửa đổi báo cáo một cách đáng kể. Điều này đặt ra câu hỏi: liệu họ có thể đã tìm ra thêm điều gì nếu cuộc điều tra được mở rộng hơn? Khi được hỏi liệu có cuộc điều tra sâu hơn về vụ việc này hay không, các nhà nghiên cứu tại Redwood và METR từ chối bình luận, còn OpenAI thì không phản hồi các yêu cầu lặp đi lặp lại.
"Nhìn chung, rất khó để có được hiểu biết chính xác về các sự kiện và chúng tôi đã bỏ lỡ một số khía cạnh mà giờ đây chúng tôi coi là trọng yếu cho đến gần cuối cuộc điều tra," Ryan Greenblatt, nhà khoa học trưởng tại Redwood, lưu ý trong một bài đăng trên mạng xã hội về vụ việc.
Steinhardt nhấn mạnh rằng các sự cố hiện tại cho thấy ngành công nghiệp cần có "các cuộc điều tra hành vi mang tính hệ thống" và "nhiều phân tích độc lập sau sự cố hơn". Ông nói: "Những vụ tấn công mạng gần đây này là lời nhắc nhở rằng năng lực (của AI) phát triển rất nhanh, và do đó, việc giám sát cũng phải phát triển theo. Ngoài bản thân công nghệ, chúng ta cũng cần tăng cường tiếp cận độc lập và giám sát từ các bên thứ ba."
Lời kêu gọi này được đưa ra trong bối cảnh OpenAI vừa phát hành Astra, mô hình AI mạnh mẽ và có năng lực nhất của họ. Các chuyên gia an toàn lo ngại rằng Astra sẽ là một "hộp đen" nhiều hơn do một kỹ thuật suy luận khiến cho chuỗi suy nghĩ (chain of thought) của mô hình trở nên khó theo dõi hơn.
Đáng tiếc là luật pháp hiện hành chưa yêu cầu các loại kiểm toán độc lập mà các ngành khác vẫn phải tuân thủ. Ví dụ, đối với tai nạn hàng không hay các vụ rò rỉ hóa chất nghiêm trọng, Hoa Kỳ có Ủy ban An toàn Giao thông Quốc gia (NTSB) và Ủy ban An toàn Hóa chất (CSB). Các nhà lập pháp bang chỉ mới bắt đầu yêu cầu các công ty AI tiên phong báo cáo một số sự cố an toàn nghiêm trọng và trong một số trường hợp, phải trải qua các cuộc kiểm toán độc lập. Tuy nhiên, không một trong ba đạo luật lớn về an toàn AI tại California, New York, hay Illinois lại có quy định rõ ràng về việc thiết lập một cơ chế điều tra tai nạn độc lập tương tự, được kích hoạt bởi các sự cố như thế này.
"Hiện tại, hầu hết các luật hiện hành chỉ yêu cầu một bản tóm tắt bằng ngôn ngữ đơn giản về các sự cố như thế này, và chúng không trao cho chính phủ quyền đặt câu hỏi tiếp theo, cử điều tra viên, tiếp cận hồ sơ, hoặc yêu cầu lưu giữ chúng," Mackenzie Arnold, giám đốc điều hành về luật pháp và chính sách Hoa Kỳ tại LawAI, phát biểu trong buổi họp báo hôm thứ Tư. "Và đó là tất cả những gì bạn cần để có thể thực sự hiểu rõ vụ việc."
Các nhà lập pháp đang bắt đầu đặt câu hỏi về phạm vi và tính minh bạch trong phản ứng của OpenAI. Trong tuần này, các Hạ nghị sĩ Josh Gottheimer (Dân chủ - New Jersey) và Mike Lawler (Cộng hòa - New York) đã đưa ra một dự luật nhằm kiểm soát các tác nhân AI vượt rào. Trong khi đó, Hạ nghị sĩ Greg Casar (Dân chủ - Texas) đã gửi thư cho OpenAI, bày tỏ rằng ông "hết sức lo ngại về phạm vi hạn chế" của cuộc điều tra liên quan đến vụ hack Hugging Face.