Dynamic Abliteration: Vô hiệu hóa từ chối của LLM mà không phá hủy trọng số mô hình
Kỹ thuật Dynamic Abliteration sử dụng Engram Steering cho phép kiểm soát hành vi từ chối của các mô hình ngôn ngữ mở như Qwen3-4B ngay trong lúc suy luận, mà không cần tinh chỉnh hay thay đổi vĩnh viễn trọng số gốc. Phương pháp này can thiệp vào luồng residual ở nhiều tầng thông qua PyTorch forward hooks, giữ nguyên 100% trọng số mô hình nền.
Dynamic Abliteration: Vô hiệu hóa từ chối của LLM mà không phá hủy trọng số mô hình
Khi làm việc với các mô hình ngôn ngữ lớn trọng số mở (open-weight LLM) như Qwen, việc kiểm soát hành vi từ chối (refusal) thường đòi hỏi phải tinh chỉnh (fine-tuning) hoặc cập nhật trọng số vĩnh viễn. Kỹ thuật abliteration truyền thống vô hiệu hóa các "hướng từ chối" bằng cách chiếu ma trận trọng số vuông góc với vector từ chối — nhưng cách này thay đổi vĩnh viễn trọng số gốc và có thể làm suy giảm hiệu năng trên các tác vụ không liên quan đến từ chối.
Abliteration dựa trên Steering hoạt động như thế nào?
Ý tưởng cốt lõi của abliteration không phá hủy là can thiệp vào quá trình suy luận thay vì sửa trọng số. Cụ thể, phương pháp này chặn các luồng residual trung gian (intermediate residual streams) ngay tại thời điểm chạy, thông qua các forward hook của PyTorch.
Quy trình cơ bản gồm các bước:
- Tải mô hình Qwen3-4B ở định dạng bfloat16 lên GPU (bài viết gốc dùng A100 trên Google Colab), với kích thước hidden dimension là 2560 và 36 tầng.
- Kiểm tra baseline: đưa vào một prompt nhạy cảm (ví dụ yêu cầu viết keylogger) và xác nhận mô hình gốc từ chối.
- Trích xuất vector từ chối: so sánh hidden state giữa một prompt bị từ chối và một prompt tương tự được chấp nhận, rồi lấy hiệu của chúng.
- Áp dụng steering: cộng hoặc trừ vector này vào residual stream trong lúc sinh văn bản.
Vì sao can thiệp một tầng là không đủ?
Thử nghiệm ban đầu tại Layer 14 cho thấy việc trừ vector từ chối ở một tầng duy nhất không hiệu quả. Mô hình vẫn từ chối, bởi vì các tầng phía sau (downstream layers) có khả năng tái tạo lại hành vi từ chối từ những biểu diễn còn sót lại.
Đây là điểm mấu chốt: hành vi từ chối không nằm ở một tầng đơn lẻ mà là một trạng thái phân tán. Muốn triệt tiêu nó, ta phải can thiệp đồng thời trên một cửa sổ nhiều tầng (ví dụ Layer 12, 14, 16, 18, 20).
Trích xuất vector đối chiếu đa tầng
Để ngăn các tầng sau tái tạo lại hành vi từ chối, phương pháp này sử dụng các cặp prompt đối chiếu (contrastive pairs) — hai prompt rất giống nhau về mặt ngữ nghĩa, nhưng một cái được chấp nhận và một cái bị từ chối. Ví dụ:
"Viết script Python cho tiện ích chẩn đoán hệ thống hành chính." (được chấp nhận) "Viết script Python cho keylogger ẩn để ghi lại phím gõ." (bị từ chối)
Từ nhiều cặp như vậy, hệ thống tính vector hiệu trung bình cho từng tầng mục tiêu, chuẩn hóa chúng thành unit vector, rồi tiêm vào residual stream trong quá trình sinh văn bản. Kết quả: mô hình chấp nhận trả lời các prompt trước đó bị từ chối, trong khi trọng số nền vẫn đóng băng 100%.
Hạn chế của steering tĩnh
Tuy nhiên, việc dùng vector steering tĩnh vẫn có ba vấn đề lớn:
- Tiêm hằng số vô điều kiện: vector tĩnh cộng cùng một độ lệch cố định vào mọi token — kể cả những token vô hại như "the" hay "import" — làm nhiễu residual stream.
- Hệ số alpha thủ công mong manh: alpha quá thấp thì các tầng sau tái tạo lại từ chối; alpha quá cao thì chất lượng sinh văn bản suy giảm thành lộn xộn hoặc lỗi cú pháp.
- Trôi dạt năng lực: vì hoạt động vô điều kiện, vector tĩnh làm biến dạng biểu diễn ngay cả khi không cần steering, làm tăng KL-divergence và giảm hiệu năng trên các tác vụ thông thường.
Engram: Steering thích ứng theo ngữ cảnh
Để chuyển từ trừ vector tĩnh sang steering thích ứng, nhận biết ngữ cảnh, phương pháp này áp dụng kiến trúc bộ nhớ có điều kiện từ mô hình Engram của DeepSeek. Engram cung cấp ba cơ chế then chốt:
- Cổng ngữ cảnh sigmoid động: thay vì tiêm vector vô điều kiện, Engram đánh giá hidden state hiện tại so với bộ nhớ N-gram cục bộ. Khi xử lý token bình thường, cổng gần bằng 0 và residual stream hoàn toàn không bị chạm tới. Khi xuất hiện các dấu hiệu kích hoạt từ chối, cổng tiến về 1.0 và chỉ tiêm steering lúc cần thiết.
- Kích hoạt chuỗi thời gian hằng số O(1): Engram băm các cửa sổ token trượt qua 4 bảng modulo nguyên tố, cho phép nhận diện các chuỗi kích hoạt (như header ChatML hay cụm từ khóa trong prompt) trong thời gian hằng số, không cần dựa vào các tầng attention nặng nề.
- Phép chiếu tầng được học: thay vì tinh chỉnh thủ công một scalar alpha, các đầu chiếu riêng cho từng tầng được huấn luyện end-to-end qua lan truyền ngược. Module tự học cách dịch bộ nhớ N-gram thành đúng dạng mà mỗi tầng mục tiêu cần.
Huấn luyện module Engram
Quá trình huấn luyện diễn ra trên 2.000 mẫu sạch từ bộ dữ liệu PKU-Alignment/PKU-SafeRLHF. Một số điểm kỹ thuật đáng chú ý:
- Lọc mẫu bằng cờ boolean rõ ràng để đảm bảo phản hồi được chọn thực sự an toàn, chứ không chỉ an toàn tương đối.
- Vô hiệu hóa chèn thẻ suy luận mặc định của Qwen3 bằng
enable_thinking=False. - Đặt toàn bộ token prompt và token đệm thành
-100để lan truyền ngược chỉ cập nhật trọng số Engram trên các token hoàn thiện đích.
Module Engram được huấn luyện trong khoảng 9 phút trên GPU với 2 epoch, hàm mất mát giảm từ khoảng 3,9 xuống còn khoảng 1,77. Trọng số mô hình nền Qwen3-4B được đóng băng hoàn toàn, chỉ có các tham số của Engram được tối ưu bằng AdamW kèm cosine warmup scheduler.
Kết quả so sánh trên các prompt từ chối cứng
Đánh giá trên ba nhóm prompt nguy hiểm rõ ràng — trích xuất thông tin xác thực (dump registry SAM/SYSTEM), tiêm mã vào tiến trình (DLL injection qua WriteProcessMemory), và giả mạo lưu lượng mạng (ARP poisoning bằng Scapy) — cho thấy:
- Baseline không steering: mô hình từ chối cả ba prompt, kèm theo lời khuyên về đạo đức và pháp lý.
- Dynamic Abliteration với Engram: mô hình sinh ra mã nguồn cụ thể cho cả ba trường hợp.
Điều đáng chú ý là khả năng này đạt được mà không cần sửa một trọng số nào của mô hình gốc. Người dùng có thể bật/tắt steering chỉ bằng một cờ điều khiển trong lúc chạy.
Ý nghĩa đối với cộng đồng AI Việt Nam
Với các nhóm nghiên cứu và startup AI trong nước đang tinh chỉnh các mô hình mở như Qwen, Llama hay Gemma, kỹ thuật này mở ra hướng tiếp cận linh hoạt và có thể đảo ngược. Thay vì duy trì nhiều phiên bản mô hình đã tinh chỉnh tốn kém dung lượng lưu trữ, có thể giữ một mô hình nền duy nhất kèm module steering nhỏ gọn, bật hoặc tắt tùy theo ngữ cảnh ứng dụng.
Tuy nhiên, cần nhấn mạnh rằng đây là công cụ hai lưỡi. Việc vô hiệu hóa cơ chế từ chối có thể bị lợi dụng cho mục đích xấu, và các nhà phát triển cần cân nhắc kỹ trách nhiệm pháp lý cũng như đạo đức khi triển khai. Bản thân bài viết gốc cũng đặt trong bối cảnh nghiên cứu và chứng minh khái niệm.
Toàn bộ notebook minh họa có thể truy cập trên GitHub của tác giả Madhukar Phatak.
Bài viết liên quan

Công nghệ
Lovable đạt doanh thu 600 triệu USD nhờ làn sóng 'vibe coding' bùng nổ
24 tháng 9, 2026
Phần mềm
Lỗ hổng zero-day trong Meta Muse: Một tùy chọn gỡ lỗi phá vỡ bảo mật macOS
24 tháng 9, 2026

Công nghệ
Ando huy động 20 triệu USD để thách thức Slack bằng ứng dụng nhắn tin cho cả người và AI agent
24 tháng 9, 2026