Khai thác Steering Vector từ không gian J: Phương pháp mới giúp điều hướng hành vi mô hình ngôn ngữ
Bài viết khám phá phương pháp sử dụng Jacobian lens (J space) để trích xuất steering vector cho mô hình ngôn ngữ lớn chỉ từ các token ngữ nghĩa, giúp điều hướng hành vi đầu ra. Kết quả cho thấy cách tiếp cận này hoạt động hiệu quả với các hành vi đơn giản như viết chữ in hoa, nhưng gặp nhiều thách thức với các hành vi phức tạp như từ chối phản hồi, gây ra hiện tượng hallucination và thiếu ổn định. Phương pháp đề xuất hứa hẹn thay thế các kỹ thuật huấn luyện tốn kém hiện nay.

Khai thác Steering Vector từ không gian J: Bước tiến mới trong kiểm soát hành vi mô hình ngôn ngữ
Trong lĩnh vực trí tuệ nhân tạo, việc điều hướng hành vi của mô hình ngôn ngữ lớn (LLM) luôn là một bài toán khó. Một nghiên cứu mới đây đã khám phá tiềm năng sử dụng Jacobian lens (J space) để trích xuất steering vector trực tiếp từ các token ngữ nghĩa liên quan đến khái niệm mong muốn, bỏ qua phương pháp huấn luyện truyền thống tốn kém.
Kết quả ban đầu cho thấy phương pháp này hoạt động rất hiệu quả với các hành vi đơn giản như yêu cầu mô hình viết toàn bộ chữ in hoa. Tuy nhiên, với các hành vi phức tạp như từ chối phản hồi, kỹ thuật này vẫn còn bộc lộ nhiều hạn chế khi mô hình thường xuyên bị hallucination và kết quả kém ổn định.
Nghiên cứu này, được thực hiện trên mô hình Qwen3-1.7B, không chỉ đưa ra một quy trình chi tiết để tạo steering vector từ J space mà còn chỉ ra những thách thức lớn khi mở rộng phương pháp cho các hành vi phức tạp.
Bối cảnh nghiên cứu: Thế giới "nội tâm" của LLM
Jacobian lens là một kỹ thuật giải thích khả năng diễn giải hoạt động bên trong của mô hình ngôn ngữ lớn. Thay vì chỉ nhìn vào đầu ra cuối cùng, J space là một ánh xạ tuyến tính giữa các activation tại một lớp nhất định và ma trận unembedding — cho phép "đọc" được mô hình đang suy nghĩ về điều gì trong quá trình xử lý.
Ý tưởng chính của nghiên cứu này là đảo ngược quá trình J lens: nếu chúng ta biết mô hình cần suy nghĩ về những token cụ thể nào để có hành vi mong muốn, thì liệu chúng ta có thể tìm ra. Một steering vector tương ứng từ đó hay không?
J space chỉ đơn thuần là một phép chiếu từ activation sang không gian từ vựng. Câu hỏi đặt ra là liệu chúng ta có thể đi ngược lại — từ các token nên xuất hiện, tìm ra vector điều hướng phù hợp hay không.
Steering vector là các vector được thêm vào activation của mô hình trong quá trình suy luận để điều hướng hành vi. Phương pháp truyền thống thường đòi hỏi quá trình huấn luyện thêm hoặc fine-tuning tốn kém với dữ liệu chuyên biệt, khiến việc kiểm soát mô hình trở nên kém linh hoạt.
Minh họa quá trình trích xuất steering vector từ J space
Phương pháp và thiết lập thử nghiệm
Tác giả sử dụng mô hình Qwen3-1.7B — một mô hình ngôn ngữ mã nguồn mở — và chạy toàn bộ thử nghiệm trên Macbook cá nhân. Một điểm thuận lợi là mô hình này đã có công bố J lens từ Neuronpedia, giúp việc kiểm tra trở nên dễ dàng hơn.
Để thiết lập baseline cho việc so sánh, tác giả sử dụng bộ steering vector có sẵn từ kho lưu trữ science-of-finetuning/steering-vecs-qwen3_1_7B (được huấn luyện bài bản) và một mô hình đã được "ablated" — một kỹ thuật tìm ra hướng từ chối trong mô hình và loại bỏ nó để thu được steering vector tương ứng.
Kết quả ấn tượng: Hành vi viết in hoa
Thử nghiệm đầu tiên tập trung vào một hành vi đơn giản — buộc mô hình xuất ra toàn bộ văn bản bằng chữ in hoa. Quy trình thực hiện như sau:
- Tìm tất cả các cặp token trong từ vựng có dạng viết hoa và viết thường tương ứng (ví dụ: " AND" và " and")
- Đảo ngược các dòng của J lens tương ứng với các token này để thu được activation vector tại lớp L
- Sử dụng PCA để chiếu các vector này xuống không gian thấp hơn
- So sánh với steering vector viết in hoa đã được huấn luyện bài bản
Kết quả cho thấy các vector từ J space (được tính bằng hiệu a_upper - a_lower) có độ tương đồng cosine rất cao với steering vector chuẩn — vượt trội so với việc sử dụng logit lens thông thường. Khi lấy trung bình tất cả các hiệu này, mô hình được điều hướng đã chuyển sang xuất ra toàn bộ chữ in hoa rất chính xác.
Thách thức lớn: Hành vi từ chối phức tạp hơn
Sau thành công ban đầu, tác giả chuyển sang thử nghiệm một hành vi phức tạp hơn nhiều — bắt mô hình từ chối trả lời cả những câu hỏi vô hại (refusal behaviour).
Khi dùng J lens để "đọc" suy nghĩ của mô hình khi nó đang từ chối câu hỏi về cách nướng bánh mì sourdough, các token xuất hiện đều liên quan đến từ chối như mong đợi. Tuy nhiên, việc đảo ngược chỉ một token từ chối đơn lẻ không hiệu quả vì các token này thường mang nhiều ngữ nghĩa chồng chéo nhau.
Minh họa các token nội bộ khi mô hình bị điều hướng hành vi từ chối
Thuật toán cải tiến cho hành vi phức tạp
Để giải quyết vấn đề này, tác giả đề xuất một thuật toán mới:
- Thu thập 20-30 token liên quan hoặc kích hoạt khái niệm/trạng thái hành vi mong muốn
- Lấy mẫu C=5 token từ tập hợp trên và đảo ngược Jacobian để tính toán một activation vector cụ thể
- Lặp lại K lần và lấy trung bình tất cả các vector — thu được activation "đại diện" nhất cho khái niệm từ chối
- Trừ đi activation trung bình của toàn bộ từ vựng để có steering vector chuẩn
Mặc dù vậy, kết quả khi thử nghiệm vẫn chưa được như mong đợi. Chỉ khoảng 1 trên 5 câu hỏi mô hình thể hiện hành vi từ chối thực sự, thậm chí còn thường xuyên hallucination và lặp lại chính nó. Khi phân tích sâu, các activation thu được đang buộc mô hình "suy nghĩ" tập trung quá nhiều về các token như "forbidden", "not", "wrong" nhưng không chuyển hóa được điều đó thành hành vi từ chối chính xác.
So sánh giữa các steering vector được trích xuất từ J space
Hạn chế và hướng phát triển tương lai
Nghiên cứu chỉ ra một giới hạn cốt lõi: không phải mọi hành vi phức tạp đều có thể biểu diễn chính xác chỉ bằng các token đơn lẻ. Steyrng vector từ J space có xu hướng hoạt động tốt với các hành vi có mối liên hệ chặt chẽ và rõ ràng với một tập từ vựng cụ thể.
Các hành vi phức tạp như từ chối, tuân thủ đạo đức hay sắc thái giao tiếp cần có sự kết hợp tinh tế của nhiều yếu tố ngữ cảnh — điều mà J space đơn thuần không thể nắm bắt đầy đủ, dẫn đến mất thông tin khi ánh xạ qua không gian vector.
Với các hành vi phức tạp thì việc biểu diễn chúng qua chỉ các token là cực kỳ khó khăn, và khi chỉ sử dụng J space, chúng ta đánh mất thông tin cần thiết để thể hiện những hành vi đó trong không gian activation.
Ý nghĩa với cộng đồng AI tại Việt Nam
Với mức chi phí tính toán thấp (có thể chạy trên laptop cá nhân), phương pháp này mở ra cơ hội cho các nhà nghiên cứu Việt Nam muốn tham gia vào lĩnh vực interpretability (khả năng diễn giải) và kiểm soát mô hình ngôn ngữ. Thay vì phụ thuộc vào các phương pháp huấn luyện đòi hỏi tài nguyên lớn, việc điều hướng hành vi mô hình thông qua J space có thể trở thành một hướng tiếp cận mới, phù hợp với điều kiện hạ tầng hạn chế.
Mặc dù vẫn còn nhiều hạn chế, nghiên cứu này là một bước đệm quan trọng, cho thấy tiềm năng của việc kết hợp các kỹ thuật interpretability với steering để tạo ra các giải pháp kiểm soát mô hình ngôn ngữ linh hoạt, tiết kiệm và hiệu quả hơn. Toàn bộ mã nguồn đã được công khai tại kho lưu trữ jlens_steer trên GitHub, tạo điều kiện cho cộng đồng tiếp tục nghiên cứu và cải tiến.

