Kiến trúc tầng dữ liệu cho AI Agent: Từ hệ thống giao dịch đến MCP và mô hình ngữ nghĩa

29 tháng 8, 2026·4 phút đọc

Fabiane Nardon từ TOTVS chia sẻ cách chuẩn bị dữ liệu doanh nghiệp cho các AI Agent 'ngốn token'. Bài trình bày tập trung vào cân bằng logic xác định và LLM không xác định, sử dụng data mesh, kiến trúc cơ sở dữ liệu độ trễ thấp, ontology ngữ nghĩa và lựa chọn công cụ MCP động để tối ưu cửa sổ ngữ cảnh và giảm chi phí token. Đây là hướng dẫn thiết thực cho các doanh nghiệp muốn triển khai AI Agent trong hệ thống giao dịch.

Kiến trúc tầng dữ liệu cho AI Agent: Từ hệ thống giao dịch đến MCP và mô hình ngữ nghĩa

Fabiane Nardon, kiến trúc sư dữ liệu hàng đầu tại TOTVS, vừa có bài trình bày quan trọng về cách chuẩn bị dữ liệu doanh nghiệp cho các AI Agent trong kỷ nguyên "token hóa" toàn diện. Bài nói tập trung vào bài toán cân bằng giữa logic xác định từ hệ thống truyền thống và tính không xác định của LLM, đồng thời đề xuất các giải pháp cụ thể để tối ưu hiệu suất và chi phí.

Vấn đề cốt lõi: Token là tài nguyên đắt đỏ

Trong các hệ thống giao dịch (transactional systems) của doanh nghiệp, mỗi lần AI Agent xử lý yêu cầu, lượng token tiêu thụ có thể tăng vọt nếu không có chiến lược dữ liệu hợp lý. Nardon nhấn mạnh rằng việc đưa toàn bộ dữ liệu thô vào cửa sổ ngữ cảnh (context window) là cách tiếp cận sai lầm, gây tốn kém về tài chínhchậm về hiệu suất.

"Chúng ta không thể đối xử với dữ liệu AI Agent như cách chúng ta làm với báo cáo BI truyền thống. Mỗi byte đi vào mô hình đều có giá trị và cần được chọn lọc kỹ lưỡng."

Giải pháp: Kết hợp Data Mesh và kiến trúc độ trễ thấp

Nardon đề xuất mô hình data mesh - nơi mỗi domain trong doanh nghiệp tự quản lý dữ liệu của mình, thay vì tập trung hóa vào một data lake khổng lồ. Điều này giúp:

  • Giảm độ trễ khi truy xuất dữ liệu phục vụ Agent
  • Tăng tính chủ động cho các đội nghiệp vụ trong việc định nghĩa ngữ nghĩa dữ liệu
  • Cho phép triển khai các cơ sở dữ liệu chuyên dụng (low-latency databases) phù hợp với từng loại nghiệp vụ

Bên cạnh đó, việc sử dụng ontology ngữ nghĩa (semantic ontologies) đóng vai trò quan trọng. Thay vì đưa dữ liệu thô, Agent được cung cấp các khái niệm, mối quan hệ và ngữ cảnh đã được chuẩn hóa, giúp mô hình hiểu đúng ý định của người dùng mà không cần xử lý quá nhiều văn bản.

MCP và chiến lược chọn công cụ động

Một điểm nổi bật trong bài trình bày là việc sử dụng Model Context Protocol (MCP) kết hợp với cơ chế chọn công cụ động (dynamic tool selection). Thay vì tải toàn bộ danh sách công cụ vào mỗi lần gọi, TOTVS thiết kế hệ thống cho phép Agent:

  • Tự xác định công cụ cần thiết dựa trên ngữ cảnh yêu cầu
  • Chỉ truyền tải phần dữ liệu liên quan trực tiếp
  • Giảm thiểu token overhead phát sinh từ việc mô tả không cần thiết

Chiến lược này đặc biệt hữu ích trong môi trường ERP phức tạp, nơi hàng trăm công cụ và dịch vụ tồn tại song song.

Cân bằng logic xác định và phi xác định

Điểm kỹ thuật đáng chú ý nhất: Nardon nhấn mạnh không nên để AI Agent xử lý mọi tác vụ. Trong các nghiệp vụ nhạy cảm như tài chính, kế toán, cần giữ luồng logic xác định (deterministic) từ hệ thống cũ, chỉ dùng LLM cho phần tương tác và hiểu ngôn ngữ tự nhiên. Cách tiếp cận hybrid này giúp:

  • Đảm bảo độ chính xác tuyệt đối trong tính toán
  • Tăng cường bảo mật khi xử lý dữ liệu nhạy cảm
  • Kiểm soát chi phí token đáng kể

Góc nhìn cho doanh nghiệp Việt Nam

Kinh nghiệm từ TOTVS rất đáng tham khảo cho các doanh nghiệp Việt đang chuyển đổi số. Thay vì chạy theo phong trào "AI hóa mọi thứ", cần:

  • Bắt đầu từ việc lựa chọn dữ liệu sạch cho các tác vụ cụ thể
  • Đầu tư vào ontology và chuẩn hóa dữ liệu ngay từ đầu
  • Xây dựng system lựa chọn công cụ thông minh để tiết kiệm chi phí vận hành

Bài học quan trọng nhất: Kiến trúc dữ liệu quyết định 80% thành công của dự án AI Agent, mô hình mạnh mẽ đến đâu cũng vô dụng nếu nguồn dữ liệu không được tối ưu đúng cách.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗