Không gian đoạn văn uốn cong: Góc nhìn hình học về cách LLM xử lý văn bản
Bên trong một transformer, chỉ số token thực chất chỉ là một tọa độ thô. Chính cấu trúc đoạn văn mới là yếu tố biến tọa độ đó thành một độ đo thực sự, tạo nên không gian uốn cong mà mô hình ngôn ngữ lớn phải "đi lại" bên trong.
Các mô hình ngôn ngữ lớn (LLM) thường được hình dung như những cỗ máy dự đoán token tiếp theo dựa trên một chuỗi tuyến tính. Nhưng nhìn từ góc độ hình học, cách chúng ta đánh số thứ tự token chỉ là một tọa độ — chưa phải là một thước đo có ý nghĩa.
Từ tọa độ thô đến độ đo thực sự
Khi một câu văn được đưa vào transformer, mỗi token nhận một chỉ số vị trí. Ban đầu, đó chỉ là một con số đơn thuần: token thứ 3, token thứ 47, token thứ 812. Con số này cho biết vị trí, nhưng không cho biết khoảng cách giữa các đơn vị ý nghĩa.
Trong hình học, một tập hợp các tọa độ chỉ trở thành không gian metric khi ta định nghĩa được khoảng cách giữa các điểm. Và trong văn bản, chính cấu trúc đoạn văn đóng vai trò định nghĩa khoảng cách ấy.
Đoạn văn làm thay đổi hình học bên trong mô hình
Một đoạn văn không chỉ là tập hợp các câu nằm cạnh nhau. Nó tạo ra:
- Ranh giới ngữ nghĩa: Token ở cuối đoạn gần nhau về ý nghĩa hơn so với token ở đoạn kế tiếp, dù khoảng cách chỉ số có thể tương đương.
- Trọng số chú ý (attention): Cơ chế self-attention học cách ưu tiên các token trong cùng đoạn, khiến "khoảng cách hiệu dụng" giữa chúng bị nén lại.
- Cấu trúc phi Euclid: Kết quả là một không gian mà khoảng cách không còn tỉ lệ tuyến tính với số bước token — tức là một không gian uốn cong.
Nói cách khác, hai token cách nhau 500 vị trí nhưng nằm trong cùng một đoạn có thể "gần" nhau hơn hai token cách nhau 50 vị trí nhưng bị ngăn bởi ranh giới đoạn.
Vì sao điều này quan trọng với người làm kỹ thuật
Hiểu LLM dưới dạng không gian uốn cong giúp lý giải nhiều hiện tượng thực tế:
- Vì sao định dạng đầu vào lại ảnh hưởng lớn: Đặt câu hỏi và ngữ cảnh trong cùng một đoạn, hay tách thành các đoạn riêng, có thể cho kết quả rất khác nhau.
- Vì sao thứ tự và nhóm nội dung quan trọng: Khi xây dựng prompt cho các ứng dụng tại Việt Nam — từ chatbot hỗ trợ khách hàng đến hệ thống tóm tắt văn bản pháp lý — việc chia đoạn hợp lý giúp mô hình "nhìn" đúng mối quan hệ giữa các phần.
- Vì sao cửa sổ ngữ cảnh dài không tự động giải quyết mọi thứ: Tăng số token tối đa không đồng nghĩa với việc mô hình đo khoảng cách ngữ nghĩa tốt hơn nếu cấu trúc đoạn bị phá vỡ.
Hướng ứng dụng cho cộng đồng phát triển
Với các kỹ sư và nhà phát triển sản phẩm AI tại Việt Nam, góc nhìn này gợi mở vài thực hành cụ thể:
- Thiết kế prompt có phân đoạn rõ ràng, dùng tiêu đề và dấu ngắt để định hình không gian ngữ nghĩa.
- Kiểm thử A/B giữa các cách chia đoạn khác nhau thay vì chỉ tinh chỉnh từ ngữ.
- Khi xây dựng pipeline RAG, cân nhắc kích thước và ranh giới của chunk — vì mỗi chunk là một "vùng không gian" riêng mà mô hình phải diễn giải.
Việc coi LLM là một hệ thống hình học thay vì một hộp đen dự đoán token không chỉ là một cách nhìn đẹp về mặt lý thuyết. Nó là công cụ thực dụng để xây dựng các ứng dụng AI ổn định và hiệu quả hơn.

