Quản lý ngữ cảnh cho AI agent: Khi bộ nhớ và chi phí trở thành bài toán kiến trúc
Bài nghiên cứu mới từ arXiv đề xuất khái niệm Agentic Context Management (ACM) - xem việc quản lý bộ nhớ của AI agent không chỉ là bài toán lưu trữ mà là vòng đời và kiến trúc. Hệ thống này hứa hẹn giảm chi phí token theo cấp số nhân thay vì tăng theo cấp số lũy thừa, đồng thời duy trì độ chính xác cao qua các benchmark LongMemEval và LoCoMo.

Trong quá trình phát triển các AI agent cho sản xuất thực tế, thất bại thường không đến từ khả năng suy luận kém mà đến từ việc không quản lý được những gì nằm trong ngữ cảnh suy luận: lịch sử hội thoại, prompt lớn, định nghĩa công cụ phình to và output công cụ ngày càng phồng lên.
Các agent đang "chết đuối" trong chính lịch sử tích lũy của mình, trả chi phí token tăng theo từng lượt, dẫn đến việc không thể truy xuất thông tin cần thiết trong và giữa các cuộc hội thoại. Cách tiếp cận hiện tại xem đây là bài toán lưu trữ và truy xuất, nhưng tác giả Gaurav Dadhich cho rằng khung nhìn này quá hẹp.
Khái niệm mới: Agentic Context Management (ACM)
Chủ động quản lý những gì agent "giữ trong đầu" là một vòng đời, không chỉ là một kho chứa. Vòng đời này bao trùm nhiều giai đoạn: quyết định nên nhớ gì, trích xuất và cấu trúc thông tin, chọn kho lưu trữ phù hợp cho từng loại dữ liệu, hợp nhất và quên đi trong khi vẫn bảo toàn nguồn gốc, quyết định điều gì cần thiết hiện tại và dự đoán điều gì cần tiếp theo, cuối cùng là nén ngữ cảnh theo ngân sách mà không làm mất đi những gì quan trọng.
Trong môi trường sản xuất nghiêm túc, việc này không chỉ hoạt động trên một người dùng duy nhất mà trải dài trên một hệ thống phân cấp phạm vi tổ chức. Nhóm nghiên cứu đặt tên cho kỷ luật này là Quản lý ngữ cảnh tác nhân (ACM) và phân rã thành năm nguyên thủy:
- Kiến trúc (Architecting): Thiết kế hệ thống quản lý ngữ cảnh phù hợp
- Nạp vào (Ingesting): Tiếp nhận và xử lý dữ liệu đầu vào
- Phạm vi hóa (Scoping): Xác định phạm vi ngữ cảnh cần thiết
- Dự đoán (Anticipating): Dự đoán nhu cầu thông tin tương lai
- Nén và hợp nhất (Compacting & Consolidation): Giảm kích thước ngữ cảnh hợp nhất
Mỗi nguyên thủy này đòi hỏi cách xử lý riêng biệt và đúng đắn theo từng loại dữ liệu, thay vì áp dụng một giải pháp chung cho mọi tình huống.
Vấn đề chi phí: Tăng bậc hai vs. Tuyến tính
Phần kinh tế học của bài báo đưa ra một phát hiện quan trọng. Tích lũy ngữ cảnh ngây thơ khiến chi phí token tăng theo cấp bậc hai (bình phương) theo độ dài hội thoại. Nói cách khác, cuộc hội thoại dài gấp đôi sẽ tốn gấp bốn lần chi phí.
Tóm tắt thô (crude summarization) giúp giảm xuống chi phí tuyến tính nhưng phải trả giá bằng một "vách đứng độ chính xác" - nghĩa là chất lượng suy giảm đột ngột khi nội dung bị mất đi. Chỉ có nén có kiểm chứng mới đạt được chi phí tuyến tính mà vẫn giữ được độ chính xác.
Điều này đặc biệt quan trọng trong bối cảnh các doanh nghiệp Việt Nam đang bắt đầu triển khai AI agent vào vận hành, khi ngân sách token thường bị đội lên nhanh chóng sau vài tuần thử nghiệm mà không kiểm soát được.
Giải pháp tham chiếu: Maximem Synap
Bài báo mô tả một triển khai tham chiếu có tên Maximem Synap, hiện thực hóa năm nguyên thủy trên dưới dạng dịch vụ đa người thuê (multi-tenant). Kết quả đo được khá ấn tượng:
- 92% trên benchmark LongMemEval
- 93.2% trên benchmark LoCoMo
Đây là các benchmark đánh giá khả năng ghi nhớ và truy xuất thông tin ngữ cảnh dài hạn của AI agent.
Hướng đi tương lai
Tác giả cũng chỉ ra những khía cạnh mà các benchmark hiện tại chưa đo lường được, bao gồm:
- Độ trễ (latency) khi thực hiện các nguyên thủy ACM
- Hiệu quả token (token efficiency) trong thực tế
- Khả năng chống "thối ngữ cảnh" (context-rot resistance) - tức là mức độ duy trì chất lượng theo thời gian
Ngoài ra, nghiên cứu mở ra biên giới mới cho việc quản lý ngữ cảnh ở cấp độ quyết định và cấp độ tổ chức, vượt xa phạm vi một phiên hội thoại đơn lẻ.
Đối với cộng đồng phát triển AI tại Việt Nam, ý tưởng ACM cho thấy rằng việc tối ưu chi phí vận hành agent không chỉ là chuyện chọn model rẻ hơn hay gọi API ít hơn, mà còn là thiết kế lại cách agent lưu trữ, truy xuất và "quên" thông tin trong kiến trúc tổng thể.