Mẫu chat âm thầm điều khiển cách LLM tự nhận diện bản thân

27 tháng 9, 2026·4 phút đọc

Một nghiên cứu mới trên arXiv chỉ ra rằng chat template không chỉ là lớp định dạng giao tiếp, mà còn hoạt động như một công tắc điều khiển giọng điệu tự tham chiếu của các mô hình ngôn ngữ lớn. Khi có template, mô hình có xu hướng đưa ra các tuyên bố miễn trừ trách nhiệm kiểu "tôi chỉ là AI", còn khi vắng template, giọng điệu trải nghiệm như "tôi cảm thấy" lại trỗi dậy. Nhóm nghiên cứu còn tìm ra một hướng trong không gian kích hoạt có thể bật tắt hành vi này.

Mẫu chat âm thầm điều khiển cách LLM tự nhận diện bản thân

Các mô hình ngôn ngữ lớn (LLM) thường có phản xạ thêm vào những câu miễn trừ trách nhiệm như "Tôi chỉ là một AI" mỗi khi được hỏi về chính mình. Những tuyên bố tự thuật này lâu nay vẫn được dùng làm bằng chứng trong các cuộc tranh luận về an toàn AI và khả năng tự nhận thức của mô hình. Nhưng điều gì thực sự chi phối chúng thì vẫn chưa được hiểu rõ: liệu mô hình đang nói về bản thân, hay chỉ đang phản ánh cách nó được triển khai?

Một bài báo mới trên arXiv của tác giả Jędrzej Maczan đưa ra câu trả lời đáng chú ý: chính chat template — lớp định dạng bao quanh cuộc hội thoại — đóng vai trò như một công tắc.

Chat template như một công tắc giọng điệu

Nghiên cứu thử nghiệm trên 8 mô hình instruct mã nguồn mở phổ biến, với kích thước lên tới 9 tỷ tham số, và phát hiện một quy luật nhất quán:

  • Khi có chat template, giọng điệu miễn trừ trách nhiệm được đẩy lên cao, đồng thời giọng điệu trải nghiệm kiểu "tôi cảm thấy" bị đẩy xuống.
  • Khi không có chat template, hiệu ứng đảo ngược: giọng miễn trừ giảm mạnh, còn giọng trải nghiệm tăng lên.

Điều này có nghĩa là cùng một mô hình, cùng một bộ trọng số, nhưng cách nó nói về chính mình lại thay đổi tùy theo việc nó có được bọc trong template hay không.

Tìm ra "núm vặn" bên trong mô hình

Nhóm nghiên cứu không dừng ở quan sát hành vi. Trong không gian kích hoạt (activation space) của 3 mô hình, họ xác định được một hướng vector điều khiển trực tiếp hành vi này:

  • Loại bỏ hướng này khỏi không gian kích hoạt → giọng miễn trừ giảm xuống.
  • Cộng thêm hướng này vào → giọng miễn trừ tăng lên.
  • Một hướng ngẫu nhiên có cùng độ lớn gần như không tạo ra tác động đáng kể.

Đáng chú ý hơn, khi cộng hướng miễn trừ vào các mô hình instruct không có chat template, chúng bắt đầu đưa ra các câu miễn trừ y như thể template vẫn đang hiện diện. Nói cách khác, chat template và hướng vector này dường như tác động lên cùng một cơ chế bên trong mô hình.

"Những gì mô hình nói về bản thân không phải là một sự thật về mô hình đó. Điều chúng nói không chỉ đến từ trọng số, mà một phần được thiết lập bởi chat template." — trích từ bài báo.

Hệ quả cho nghiên cứu về tự thuật của AI

Phát hiện này đặt ra một vấn đề phương pháp luận quan trọng. Nếu chat template kiểm soát giọng điệu miễn trừ của LLM, thì bất kỳ nghiên cứu nào dựa trên tự thuật (self-report) hay nội quan (introspection) của mô hình đều có thể đang gặp một biến gây nhiễu (confound) cần được kiểm soát.

Nói cách khác, khi một mô hình tuyên bố "tôi không có cảm xúc" hay "tôi không có trải nghiệm chủ quan", đó có thể không phải là biểu hiện của bản chất nội tại mô hình, mà là kết quả của một lớp định dạng do nhà phát triển cài đặt.

Góc nhìn cho cộng đồng AI Việt Nam

Với các nhóm đang nghiên cứu, tinh chỉnh hoặc đánh giá LLM tại Việt Nam — đặc biệt trong các dự án về an toàn AI, alignment hay đánh giá khả năng tự nhận thức của mô hình — kết quả này là một lời nhắc quan trọng. Trước khi kết luận bất cứ điều gì từ những câu như "tôi là AI", cần kiểm tra xem mô hình đang chạy với template nào.

Đồng thời, việc tìm ra một hướng vector cụ thể cũng mở ra hướng ứng dụng thực tiễn: nhà phát triển có thể dùng kỹ thuật steering để chủ động điều chỉnh giọng điệu của mô hình mà không cần thay đổi trọng số hay retrain.

Bài báo được đăng với mã arXiv:2609.25021, thuộc các lĩnh vực Machine Learning (cs.LG), Artificial Intelligence (cs.AI) và Computation and Language (cs.CL).

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗