Strata: Lớp ngữ nghĩa biết nói "không" với LLM của bạn
Strata là nền tảng BI (Business Intelligence) full-stack do cựu kỹ sư Netflix phát triển, kết hợp lớp ngữ nghĩa chặt chẽ với dashboard tự động và khả năng định tuyến truy vấn thông minh. Điểm nổi bật là lớp ngữ nghĩa này có thể từ chối các truy vấn sai thay vì trả về kết quả không chính xác, giúp AI agent hoạt động an toàn và đáng tin cậy hơn.

Trong bối cảnh các mô hình ngôn ngữ lớn (LLM) ngày càng được tích hợp vào quy trình phân tích dữ liệu, một vấn đề nan giải vẫn tồn tại: làm sao đảm bảo AI đưa ra câu trả lời chính xác thay vì bịa ra những con số sai lệch. Strata — nền tảng Business Intelligence mới ra mắt trên Hacker News — đang đề xuất một hướng tiếp cận đáng chú ý: xây dựng lớp ngữ nghĩa đủ chặt chẽ để từ chối truy vấn thay vì trả lời sai.
Bảng điều khiển tự động của Strata
Xuất phát từ bài toán tại Netflix
Tác giả Ajo chia sẻ anh đã dành 4 năm tại Netflix để giải bài toán self-service cho người dùng nghiệp vụ không chuyên về kỹ thuật. Thách thức cốt lõi nằm ở việc cân bằng giữa tính biểu đạt (expressiveness) và tính dễ dùng (ease of use). Điều thú vị là chính sự tập trung vào người dùng phi kỹ thuật này lại giúp Strata tương thích rất tốt với LLM.
"Strata là một giải pháp full-stack. Nó bao gồm lớp ngữ nghĩa, dashboard, subscription, và xuất Google Sheets. Tất cả đều có thể thực hiện qua hội thoại với agent hoặc qua MCP." — Ajo, tác giả Strata.
Triết lý thiết kế: Đặt tên nghiêm ngặt
Điểm khác biệt căn bản của Strata nằm ở quy tắc đặt tên nghiêm ngặt. Trong một dự án, chỉ có duy nhất một thực thể được gọi là "Revenue". Nếu doanh thu được ánh xạ tới nhiều bảng, grain của truy vấn kết hợp với yếu tố tốc độ sẽ quyết định bảng nào được chọn.
Chính quy ước đặt tên chặt chẽ này mở ra khả năng tự động trộn dữ liệu giữa các miền fact (fact domain) mà không lo trùng lặp. Đây là điều mà nhiều công cụ BI truyền thống thường xử lý sai, dẫn đến việc tính trùng số liệu — một lỗi cực kỳ nguy hiểm trong báo cáo doanh nghiệp.
Strata được thiết kế đẹp mặc định
Định tuyến ngữ nghĩa theo phân vùng và tổng hợp
Một trong những tính năng kỹ thuật ấn tượng nhất của Strata là định tuyến ngữ nghĩa nhận biết phân vùng và tổng hợp (partition and aggregate aware semantic routing). Cơ chế này cho phép:
- Tầng nóng (hot tier): Nạp một phần dữ liệu gần đây vào các engine tính toán nhanh như ClickHouse hoặc Druid để có kết quả dưới một giây.
- Tầng ấm (warm tier): Giữ dữ liệu trên Snowflake cho các truy vấn phức tạp hơn.
- Tầng lạnh (cold tier): Lưu toàn bộ lịch sử trên các hệ thống rẻ hơn như AWS Athena hoặc Trino.
Engine truy vấn sẽ tự động chọn tầng nhanh nhất có thể giải quyết được câu hỏi, giúp giảm đáng kể chi phí warehouse mà vẫn đảm bảo tốc độ phản hồi cho agent và dashboard.
Năm loại measure và khả năng tùy biến
Strata hỗ trợ năm loại measure sẵn có: Standard, Complex, Snapshot, Exclusion LOD (LoD - Level of Detail) và Inclusion LOD. Tất cả đều được tính toán ở đúng grain. Người dùng cũng có thể tạo tính toán tùy chỉnh xuyên miền fact, cũng như tạo cohort và áp dụng chúng như bộ lọc cho toàn bộ truy vấn hoặc cho một measure đơn lẻ.
Điều đáng chú ý là Strata cố tình không xây dựng lớp ngữ nghĩa để các công cụ BI khác kết nối vào. Tác giả gọi hướng đi đó là "ngõ cụt" và thay vào đó cung cấp API cùng MCP cho bất kỳ ai muốn xây dựng giải pháp tùy chỉnh.
An toàn cho AI: Vòng lặp xác thực thay vì phỏng đoán
Điểm then chốt khiến Strata phù hợp với kỷ nguyên AI là vòng lặp xác thực. Khi một agent đề xuất một phần truy vấn, Strata sẽ kiểm tra tính hợp lệ ngữ nghĩa và phản hồi ngay lập tức. Quá trình này lặp lại cho đến khi có câu trả lời được "quản trị" (governed). Nếu truy vấn sai về mặt ngữ nghĩa, nó sẽ bị từ chối trước khi chạy — thay vì trả về một con số sai.
Trường hợp khách hàng điển hình của Strata
Kết quả thực tế
Một khách hàng trong lĩnh vực dịch vụ khách hàng thuộc một tập đoàn giải trí toàn cầu đã cấp quyền truy cập dữ liệu sâu cho 800 người dùng phi kỹ thuật. Kết quả: số người dùng self-service hàng tuần tăng từ 5 lên hơn 100, yêu cầu dữ liệu đột xuất giảm 90%, và thời gian onboarding đối tác chỉ còn 10 phút.
Dùng thử và lưu ý
Strata hiện đang ở giai đoạn beta sớm và không phải mã nguồn mở. Tuy nhiên, gói miễn phí cho phép tới 25 người dùng, và bạn có thể chạy toàn bộ hệ thống trên máy cá nhân thông qua Docker. Tác giả đặc biệt mong nhận phản hồi từ những người đang làm việc với Looker và Cube.
Với các đội ngũ dữ liệu tại Việt Nam đang tìm cách đưa AI vào quy trình phân tích mà vẫn đảm bảo độ chính xác, Strata là một cái tên đáng để theo dõi — đặc biệt khi bài toán "LLM trả lời sai số liệu" vẫn là nỗi lo lớn của nhiều doanh nghiệp.
