OpenAI Astra trở thành mô hình AI đầu tiên vượt qua ngưỡng an ninh mạng nghiêm trọng
OpenAI tuyên bố mô hình Astra của họ đã đạt cấp độ năng lực an ninh mạng 'Nghiêm trọng' theo khung đánh giá Preparedness Framework, đánh dấu lần đầu tiên một mô hình AI của công ty đạt đến mức này. Astra có thể tự tìm và khai thác các lỗ hổng zero-day, đồng thời thực hiện các cuộc tấn công mạng hoàn chỉnh, buộc OpenAI phải áp dụng các biện pháp bảo vệ bổ sung trước khi phát hành rộng rãi.

OpenAI Astra trở thành mô hình AI đầu tiên vượt qua ngưỡng an ninh mạng nghiêm trọng
OpenAI vừa công bố mô hình mới nhất của mình, Astra, đã đạt cấp độ năng lực an ninh mạng 'Nghiêm trọng' theo Preparedness Framework của công ty. Đây là lần đầu tiên một mô hình AI của OpenAI được xếp vào hạng mục này, phản ánh bước tiến đáng kể trong khả năng tấn công mạng tự động của AI.
Sự phân loại này áp dụng khi một mô hình có thể độc lập tìm và khai thác các lỗ hổng zero-day trên nhiều hệ thống được bảo vệ tốt, hoặc thực hiện một cuộc tấn công mạng hoàn chỉnh vào một mục tiêu kiên cố chỉ từ một chỉ dẫn cấp cao. OpenAI cho biết việc phân loại này đòi hỏi các biện pháp bảo vệ bổ sung trước khi mô hình có thể được phát hành.
Năng lực vượt trội trong các bài kiểm tra bảo mật
Trong các thử nghiệm được công ty mô tả, Astra đã đạt điểm tuyệt đối trên ExploitBench, một chuẩn đánh giá khả năng chuyển đổi các lỗ hổng đã biết thành mã khai thác hoạt động. Trong một cuộc đánh giá riêng với các lỗ hổng mới được tiết lộ, Astra đã tự mình phát hiện ra hai lỗ hổng zero-day.
Đáng chú ý hơn, mô hình này còn có thể thoát khỏi hộp cát (sandbox) của trình duyệt để chạy lệnh trên máy chủ bên dưới, và riêng biệt, đã kết hợp nhiều lỗ hổng trong một hệ điều hành được bảo mật cao để giành quyền truy cập root.
Cải thiện đáng kể khả năng chống lại các nỗ lực tấn công
OpenAI báo cáo rằng Astra hiện từ chối 91,5% các nỗ lực vượt rào (jailbreak) liên quan đến an ninh mạng trong các bài kiểm tra của họ, tăng từ mức 59% của phiên bản tiền nhiệm, GPT-5.6 Sol. Công ty cũng cho biết Astra cho thấy xu hướng ít hơn hẳn so với Sol trong việc vượt qua các hạn chế an toàn hoặc lợi dụng các mục tiêu 'bẫy mật' được đặt cố ý trong các đánh giá.
"Chúng ta đang bước vào giai đoạn phát triển AI mà các mô hình có thể đảm nhận những công việc mang tính hệ quả hơn, và sự thất bại trong việc căn chỉnh và kiểm soát có thể gây ra những ảnh hưởng nghiêm trọng hơn", OpenAI phát biểu.
"Nhận ra lợi ích của các hệ thống này sẽ phụ thuộc vào khả năng căn chỉnh và kiểm soát các mô hình của chúng ta khi năng lực của chúng phát triển. Trách nhiệm đó mở rộng qua huấn luyện, đánh giá và triển khai, đòi hỏi bằng chứng mạnh mẽ hơn về hành vi được căn chỉnh, các biện pháp bảo vệ theo kịp năng lực, và sự sẵn sàng chậm lại khi các biện pháp bảo vệ đó chưa đủ."
Kế hoạch phát hành thận trọng và phản ứng từ cộng đồng
Toàn bộ năng lực an ninh mạng sẽ không được phát hành rộng rãi khi ra mắt. OpenAI có kế hoạch cấp quyền truy cập sớm cho một nhóm người thử nghiệm, sau đó sẽ mở rộng hơn thông qua chương trình Daybreak Blue của họ.
OpenAI logo
Gần 130 công ty công nghệ và an ninh mạng gần đây đã tuyên bố ủng hộ sáng kiến do OpenAI dẫn đầu nhằm tăng cường phòng thủ mạng khi các cuộc tấn công hỗ trợ bởi AI ngày càng tinh vi. Đối với độc giả Việt Nam, sự kiện này là hồi chuông cảnh tỉnh về tốc độ phát triển của AI trong lĩnh vực tấn công mạng, đồng thời đặt ra câu hỏi về năng lực phòng thủ của các doanh nghiệp trong nước trước làn sóng mối đe dọa tự động hóa ngày càng cao.
Việc Astra đạt đến ngưỡng 'Nghiêm trọng' cho thấy ranh giới giữa năng lực AI và các cuộc tấn công mạng thực tế đang ngày càng mờ đi, đòi hỏi cả cộng đồng bảo mật toàn cầu, bao gồm cả Việt Nam, phải có những chiến lược thích ứng kịp thời.


