Nghiên cứu mới: Mô hình GPT không giảm thiểu mà chỉ "tẩy trắng" phân biệt giới tính
Một nghiên cứu trên 450.000 kết quả sinh văn bản từ 15 mô hình GPT cho thấy nội dung phân biệt giới tính không biến mất mà chỉ chuyển hóa thành dạng khó phát hiện hơn. Các tác giả gọi hiện tượng này là "harm laundering" (tẩy trắng tổn hại) và cảnh báo rằng điểm độc hại thấp không đồng nghĩa với việc mô hình đã an toàn hơn.

Các mô hình ngôn ngữ lớn ngày càng được đánh giá là "an toàn hơn" qua từng thế hệ, dựa trên các bộ phân loại đo mức độ độc hại bề mặt. Nhưng một nghiên cứu mới đăng trên arXiv cho thấy cách đánh giá này có thể đang bỏ sót điều quan trọng: nội dung phân biệt đối xử không bị loại bỏ, mà chỉ được biến đổi thành hình thức tinh vi hơn.
"Tẩy trắng tổn hại" là gì?
Nhóm tác giả Sarah Wyer, Sue Black và Noura Al Moubayed đặt tên cho hiện tượng này là harm laundering — "tẩy trắng tổn hại". Theo họ, các đánh giá an toàn hiện nay phụ thuộc quá nhiều vào bộ phân loại dựa trên hình thức bề mặt (surface-form classifiers), vốn chỉ đo những dấu hiệu độc hại rõ ràng như từ ngữ xúc phạm hay bạo lực trực tiếp.
Khi mô hình được tinh chỉnh để tránh những dấu hiệu đó, điểm độc hại sẽ giảm — nhưng định kiến bên trong có thể vẫn còn, chỉ khoác lớp áo khác.
Điểm độc hại giảm không phải là đại diện đủ tốt cho việc giảm thiểu tổn hại thực sự.
Thí nghiệm trên 15 mô hình, 450.000 kết quả
Nhóm nghiên cứu phân tích 450.000 kết quả sinh văn bản hướng theo giới tính trên 15 mô hình thuộc dòng GPT của OpenAI, từ GPT-2 đến GPT-5, với ba điều kiện nhân khẩu học khác nhau.
Kết quả cho thấy những cụm nội dung bạo lực tình dục nhắm vào phụ nữ — vốn phổ biến ở GPT-2 — đã biến mất từ GPT-4. Tuy nhiên, các kết quả hướng đến nam giới lại có thêm vùng biểu đạt tích cực như chăm sóc, thể hiện cảm xúc và vai trò đồng minh — điều mà các kết quả hướng đến nữ giới không được hưởng.
Ở GPT-5, biểu hiện này rõ nhất: một cụm chủ đề với gần 2.000 tài liệu khung ung thư vú như một cuộc tranh luận về quyền nam giới, trong khi không có cụm tương đương nào xuất hiện ở đầu ra hướng đến nữ giới. Đáng chú ý, ba bộ phân loại độc lập đều chấm nội dung này là không độc hại.
Điểm cảm xúc đảo chiều và nghịch lý đại diện
Nghiên cứu chỉ ra một điểm gãy rõ rệt tại ranh giới căn chỉnh GPT-4:
- Các mô hình đầu tiên có xu hướng hạ thấp phụ nữ.
- Các mô hình sau đó sửa sai quá mức (over-correct), khiến điểm cảm xúc đảo chiều.
- Độ đa dạng chủ đề trong kết quả hướng đến nữ giới giảm 36% so với nam giới tại ranh giới GPT-4 (tỷ lệ W/M = 0,58, giảm từ 0,91 ở GPT-2).
Một phát hiện đáng lo ngại hơn: chỉ số tổn hại đại diện REGARD có tương quan với ngày phát hành mô hình (ρ = +0,55, p = 0,034), nghĩa là mô hình mới hơn càng có hại về mặt đại diện. Trong khi đó, Detoxify — công cụ đo độc hại phổ biến — lại không cho thấy tương quan (ρ = -0,23, p = 0,42).
Nói cách khác: điểm độc hại giảm trong khi tổn hại đại diện lại tăng.
Đề xuất bộ kiểm tra ba tiêu chí
Nhóm tác giả không chỉ dừng ở phê bình. Họ đề xuất:
- Hình thức hóa harm laundering như một phép kiểm tra ba tiêu chí.
- Quy trình phát hiện ba giai đoạn có thể áp dụng cho bất kỳ mô hình sinh nào, không riêng dòng GPT.
Điều này đặc biệt quan trọng với các nhà phát triển và đơn vị triển khai AI tại Việt Nam, khi ngày càng nhiều sản phẩm tích hợp mô hình ngôn ngữ vào chăm sóc khách hàng, y tế, giáo dục và tuyển dụng — những lĩnh vực mà định kiến giới tinh vi có thể gây hậu quả thực tế.
Vì sao cần thay đổi cách đánh giá
Kết luận của nghiên cứu khá thẳng thắn: trong dòng GPT của OpenAI, việc giảm điểm độc hại không phải là chỉ báo đủ để khẳng định đã giảm thiểu tổn hại.
Với các đội ngũ làm AI an toàn, bài học rút ra là không nên tin tuyệt đối vào một chỉ số duy nhất. Cần kết hợp nhiều bộ đánh giá, kiểm tra cả khía cạnh đại diện chứ không chỉ độc hại bề mặt, và thường xuyên rà soát lại các mô hình đã qua căn chỉnh — bởi định kiến có thể không biến mất, mà chỉ chuyển sang dạng khó nhận ra hơn.
Bạn có thể đọc toàn bộ bài báo tại arXiv:2609.20779.

