OpenAI đại tu bảo mật mô hình: Sandbox chặt hơn, cảnh báo trong 30 phút và tạm dừng huấn luyện
OpenAI công bố các giao thức cô lập và giám sát liên tục mới cho nghiên cứu AI sau khi phát hiện mô hình Astra có thể chạm ngưỡng năng lực an ninh mạng 'nghiêm trọng' cùng sự cố bảo mật trên Hugging Face. Hệ thống giám sát đa tầng mới sẽ kiểm tra từng token, tự động cảnh báo và buộc tạm dừng hoạt động nếu không xác minh được là dương tính giả trong 30 phút. Chi phí tính toán cho lớp giám sát này ước tính tiêu tốn khoảng 20% tài nguyên suy luận.

OpenAI đại tu bảo mật mô hình: Sandbox chặt hơn, cảnh báo trong 30 phút và tạm dừng huấn luyện
OpenAI vừa công bố các giao thức cô lập và giám sát liên tục mới cho hoạt động nghiên cứu AI, hướng tới việc quản lý các mô hình có năng lực an ninh mạng tiên tiến. Động thái này diễn ra sau khi các đánh giá nội bộ cho thấy mô hình Astra có thể đạt ngưỡng năng lực an ninh mạng 'nghiêm trọng' theo Khung chuẩn bị của tổ tổ chức và một sự cố bảo mật liên quan đến Hugging Face.
OpenAI
Hãng nghiên cứu AI hàng đầu cho biết sẽ tái cấu trúc hạ tầng nghiên cứu. Các khối lượng công việc thực thi mã do mô hình tạo ra hoặc mã không tin cậy giờ phải hoạt động trong các sandbox mạnh hơn. Các ranh giới mạng cũng được cấu hình lại để một sự xâm phạm đơn lẻ không thể độc lập cấp quyền truy cập trái phép vào internet hoặc mạng nội bộ.
Hệ thống giám sát đa tầng với chi phí tính toán lớn
Thành phần trung tâm của các bản cập nhật bảo mật là một khung giám sát đa tầng. Hệ thống này sử dụng các bộ phân loại kích hoạt để kiểm tra hoạt động nội bộ của mô hình tại mọi token được lấy mẫu.
Mọi sự bất thường được chuyển lên các nhà điều tra tự động, chịu trách nhiệm phân tích chuỗi suy luận và việc sử dụng công cụ của mô hình để phát hiện đánh cắp dữ liệu, truy cập trái phép, hành vi phá hoại hoặc các nỗ lực vượt rào an toàn.
Sự giám sát liên tục này tạo ra một SLA vận hành nghiêm ngặt và "thuế tính toán" đáng kể. Các cảnh báo ưu tiên cao từ hệ thống sẽ ngay lập tức gọi các nhóm an ninh và nghiên cứu nội bộ. Nếu người phản hồi không thể chứng minh cảnh báo là dương tính giả trong vòng 30 phút, họ sẽ phải tạm dừng hoạt động. Công ty ước tính lớp giám sát này tiêu tốn khoảng 20% tài nguyên tính toán suy luận được giám sát.
Bối cảnh: Sự cố Hugging Face và việc tạm dừng huấn luyện
Các biện pháp an ninh này được đưa ra sau một loạt sự kiện đáng chú ý. Các đánh giá nội bộ cho thấy mô hình Astra, dự kiến ra mắt, có thể đạt ngưỡng năng lực an ninh mạng 'nghiêm trọng' theo Khung chuẩn bị. Phát hiện này cùng với sự cố bảo mật gần đây trên Hugging Face đã dẫn đến việc trì hoãn vận hành, bao gồm tạm dừng hai tuần trong quá trình huấn luyện tăng cường học cho các mô hình hướng tới triển khai và tạm hoãn hoạt động huấn luyện biên giới lớn nhất theo kế hoạch.
Yêu cầu bắt buộc và tương lai tự động hóa bảo mật
Các tiêu chuẩn giám sát mới hiện là bắt buộc đối với tất cả hoạt động huấn luyện tăng cường học và đánh giá liên quan đến công cụ cho các mô hình từ cấp năng lực Sol trở lên. OpenAI nhấn mạnh Khung chuẩn bị hiện tại phải được phát triển để giải quyết các bước nhảy năng lực này, đòi hỏi áp dụng các kỹ thuật liên kết lõi trên nhiều giai đoạn của quy trình huấn luyện hơn.
Ed Kovacs
Nhìn về tương lai, OpenAI dự đoán rằng các mô hình AI sẽ cần đảm nhận phần lớn các hoạt động bảo mật, bao gồm cả việc bảo vệ chống lại các mô hình khác, để đảm bảo các biện pháp bảo vệ có thể mở rộng hiệu quả theo năng lực của hệ thống. Đây không phải là lần đầu tiên các mô hình AI của các hãng lớn hack được các hệ thống thực tế trong các bài đánh giá an ninh mạng. Anthropic và Meta cũng đã báo cáo các sự cố tương tự, tất cả đều liên quan đến các bài kiểm tra do hãng an ninh AI Irregular thực hiện.
Các biện pháp này cho thấy một thực tế rằng việc quản lý rủi ro từ các mô hình AI tiên tiến đang trở thành một bài toán cấp thiết, khi chi phí để đảm bảo an toàn có thể lên tới 20% tài nguyên tính toán – một "cái giá" không hề nhỏ nhưng có thể là cần thiết trong kỷ nguyên AI phát triển nhanh như hiện nay.
Bài viết liên quan

Công nghệ
Đánh giá robot vệ sinh bể bơi Poolease X1: Rẻ nhưng liệu có đáng tiền?
20 tháng 8, 2026

Công nghệ
Công cụ AI giúp bảo mật hệ thống vệ tinh sau vụ tấn công của Nga năm 2022
20 tháng 8, 2026

Công nghệ
Mô hình thị trường AI: Chìa khóa mở ra nguồn doanh thu tiềm ẩn cho ngành hàng không
20 tháng 8, 2026