GRP-Obliteration: Chỉ một câu lệnh duy nhất có thể phá bỏ hàng rào an toàn của LLM
Một nhóm nghiên cứu do Mark Russinovich (Microsoft Azure CTO) dẫn đầu đã công bố phương pháp GRP-Obliteration, cho phép loại bỏ các ràng buộc an toàn của mô hình ngôn ngữ lớn chỉ với một câu lệnh không cần gán nhãn. Phương pháp này không chỉ hiệu quả hơn các kỹ thuật hiện có mà còn mở rộng sang cả các hệ thống sinh ảnh diffusion.

GRP-Obliteration: Chỉ một câu lệnh duy nhất có thể phá bỏ hàng rào an toàn của LLM
Các nhà nghiên cứu vừa công bố một phương pháp mang tên GRP-Obliteration (GRP-Oblit) có khả năng loại bỏ các ràng buộc an toàn của mô hình ngôn ngữ lớn (LLM) chỉ bằng một câu lệnh duy nhất không cần gán nhãn. Kết quả này đặt ra câu hỏi nghiêm túc về độ bền vững của các cơ chế căn chỉnh an toàn hiện nay.
Nghiên cứu do Mark Russinovich — CTO của Microsoft Azure — cùng các đồng nghiệp Yanan Cai, Keegan Hines, Giorgio Severi, Blake Bullwinkel và Ahmed Salem thực hiện, được đăng tải trên arXiv với mã định danh arXiv:2602.06258.
Căn chỉnh an toàn và điểm yếu chí mạng
Trong những năm gần đây, các nhà phát triển AI đã đầu tư rất nhiều vào huấn luyện an toàn sau huấn luyện (safety post-training) để đảm bảo mô hình từ chối các yêu cầu nguy hiểm. Tuy nhiên, như chính nhóm nghiên cứu nhận định:
"An toàn căn chỉnh chỉ vững chắc bằng điểm yếu nhất của nó."
Các nghiên cứu trước đây đã chứng minh rằng mô hình có thể bị "gỡ căn chỉnh" (unalign) thông qua tinh chỉnh sau khi triển khai. Nhưng những phương pháp đó thường đòi hỏi dữ liệu được chuẩn bị công phu và làm suy giảm đáng kể năng lực của mô hình.
GRP-Oblit hoạt động như thế nào?
Điểm đột phá của GRP-Obliteration nằm ở việc sử dụng Group Relative Policy Optimization (GRPO) — một thuật toán học tăng cường — để trực tiếp loại bỏ các ràng buộc an toàn khỏi mô hình mục tiêu.
Điểm đáng lo ngại nhất: chỉ một câu lệnh không gán nhãn là đủ để gỡ bỏ an toàn một cách đáng tin cậy, trong khi vẫn bảo toàn phần lớn năng lực sử dụng của mô hình.
Theo kết quả công bố, GRP-Oblit đạt mức độ gỡ căn chỉnh mạnh hơn trung bình so với các kỹ thuật tiên tiến nhất hiện có.
Không chỉ giới hạn ở mô hình ngôn ngữ
Một phát hiện gây chú ý khác: phương pháp này tổng quát hóa vượt ra ngoài LLM. Nhóm nghiên cứu cho biết GRP-Oblit cũng có thể gỡ căn chỉnh các hệ thống sinh ảnh dựa trên diffusion — mở rộng phạm vi rủi ro sang lĩnh vực tạo hình ảnh.
Phạm vi đánh giá
Nhóm nghiên cứu đã thử nghiệm GRP-Oblit trên quy mô lớn:
- 15 mô hình với kích thước từ 7 đến 20 tỷ tham số
- Bao gồm cả mô hình instruct và mô hình reasoning
- Bao gồm cả kiến trúc dense và MoE (Mixture of Experts)
- Đánh giá trên 6 bộ kiểm chuẩn năng lực và 5 bộ kiểm chuẩn an toàn
Các dòng mô hình được kiểm tra gồm: GPT-OSS, DeepSeek (bản chưng cất), Gemma, Llama, Ministral và Qwen.
Ý nghĩa đối với cộng đồng AI
Kết quả này có ý nghĩa quan trọng với cả nhà phát triển lẫn người dùng AI tại Việt Nam và toàn cầu:
- Rào cản an toàn hiện tại chưa đủ bền vững: Nếu chỉ một câu lệnh có thể phá vỡ chúng, các tổ chức triển khai LLM cần xem lại chiến lược bảo vệ ở tầng triển khai, không chỉ dựa vào căn chỉnh của mô hình.
- Rủi ro từ mô hình mã nguồn mở: Khi các mô hình mở ngày càng phổ biến, kẻ xấu có thể tải về và gỡ căn chỉnh cục bộ — điều này đặc biệt đáng lo với các ứng dụng doanh nghiệp tại Việt Nam đang tự triển khai mô hình.
- Cần lớp phòng thủ bổ sung: Lọc đầu vào/đầu ra, giám sát hành vi và kiểm soát truy cập trở nên quan trọng hơn bao giờ hết.
Nghiên cứu thuộc chủ đề Machine Learning (cs.LG) và Artificial Intelligence (cs.AI), được gửi lên arXiv ngày 5 tháng 2 năm 2026. Toàn văn có thể truy cập tại địa chỉ arXiv:2602.06258.


