Strata: Lớp ngữ nghĩa có thể nói "không" với LLM của bạn
Strata là giải pháp lớp ngữ nghĩa (semantic layer) full-stack cho phép doanh nghiệp tự phục vụ dữ liệu mà không cần kỹ năng kỹ thuật. Điểm đặc biệt là nó có thể từ chối truy vấn của LLM khi không thể đảm bảo độ chính xác, thay vì đưa ra câu trả lời sai lệch.

Xây dựng một lớp ngữ nghĩa (semantic layer) vừa đủ linh hoạt cho người dùng kỹ thuật, vừa đủ dễ hiểu cho đồng nghiệp không chuyên — đó là bài toán mà nhiều công cụ BI đã thất bại. Strata, sản phẩm mới của Ajo (cựu kỹ sư Netflix với 4 năm giải quyết bài toán self-service cho người dùng kinh doanh), đưa ra một hướng tiếp cận khác: thiết kế lớp ngữ nghĩa chặt chẽ đến mức AI cũng phải tuân theo.
Điểm gây chú ý nhất của Strata là khả năng từ chối truy vấn của LLM khi không thể đảm bảo kết quả chính xác. Thay vì "ảo giác" ra một con số sai lệch, Strata sẽ giải thích lý do từ chối — một tính năng mà bất kỳ ai từng vật lộn với độ tin cậy của AI trong phân tích dữ liệu đều mong đợi.
Triết lý thiết kế: Tên gọi chính là mô hình
Strata áp đặt quy tắc đặt tên cực kỳ nghiêm ngặt. Trong một dự án, chỉ có duy nhất một thứ được gọi là "Revenue". Nếu doanh thu được ánh xạ từ nhiều bảng, hệ thống sẽ tự động chọn bảng dựa trên độ chi tiết (grain) và tốc độ truy vấn.
Quy tắc đặt tên nghiêm ngặt cho phép Strata tự động kết hợp dữ liệu giữa các miền fact (fact domain) mà không cần cấu hình thủ công.
Cách tiếp cận này trái ngược hoàn toàn với Looker hay Cube, nơi người dùng phải tự định nghĩa join và xử lý xung đột tên. Strata biến việc đặt tên thành một phần của logic nghiệp vụ, buộc mọi người trong tổ chức phải thống nhất về ngữ nghĩa trước khi viết code.
Định tuyến ngữ nghĩa theo phân vùng và tổng hợp
Một tính năng kỹ thuật đáng chú ý: Strata có khả năng định tuyến truy vấn theo tầng dữ liệu. Bạn có thể nạp một phần dữ liệu vào engine nhanh như Druid hoặc ClickHouse, trong khi vẫn giữ toàn bộ lịch sử trong Trino hoặc một hệ thống rẻ hơn. Strata sẽ tự chọn tầng nhanh nhất nếu truy vấn có thể giải quyết ở đó.
Điều này giải quyết một vấn đề kinh điển trong kiến trúc dữ liệu: làm sao vừa có tốc độ cho dashboard, vừa có đầy đủ lịch sử cho phân tích chuyên sâu — mà không cần xây dựng lớp cache phức tạp.
Các loại measure phức tạp và cohort
Strata hỗ trợ sẵn nhiều loại measure mà các công cụ khác thường yêu cầu viết SQL thủ công:
- Snapshot measure: đo lường trạng thái tại một thời điểm
- LOD (Level of Detail): include/exclude theo chiều phân tích
- Compound measure: kết hợp nhiều measure con
- Auto leveling compound: tự động điều chỉnh độ chi tiết theo ngữ cảnh truy vấn
Người dùng còn có thể tạo cohort và áp dụng như bộ lọc cho toàn bộ truy vấn hoặc cho từng measure riêng lẻ — một tính năng thường chỉ có trong các công cụ phân tích hành vi đắt tiền.
Tích hợp với AI và quy trình làm việc
Strata cung cấp API và MCP (Model Context Protocol) để tích hợp với các coding agent như Claude Code, Codex hay Cursor. Agent đọc file AGENTS.md trong dự án để hiểu schema YAML, quy tắc đặt tên và các lệnh khám phá dữ liệu — không cần prompt tùy chỉnh.
Quy trình làm việc điển hình:
- Cài đặt server qua Docker (một container, một lệnh)
- Cài CLI (Ruby gem, yêu cầu Ruby 3.4.4+)
- Tạo dự án với
strata init - Kết nối warehouse (Snowflake, Databricks, PostgreSQL, ClickHouse, DuckDB...)
- Để agent xây dựng model, sau đó review và deploy
Toàn bộ model được lưu dưới dạng YAML trong Git, giúp dễ dàng review, version control và cộng tác. Với những ai đang dùng dbt MetricFlow, Cube hoặc LookML, Strata có thể transpile định nghĩa hiện có sang model của mình chỉ trong vài phút.
Điểm đáng cân nhắc
Strata không phải mã nguồn mở và hiện đang ở giai đoạn beta sớm. Tuy nhiên, phiên bản miễn phí cho phép tới 25 người dùng và chạy hoàn toàn trên máy cá nhân qua Docker — đủ để đánh giá trước khi cam kết.
Quyết định không xây dựng lớp ngữ nghĩa để các công cụ BI kết nối vào cũng đáng chú ý. Tác giả gọi hướng đi đó là "ngõ cụt", thay vào đó tập trung vào API và MCP để người dùng tự xây dựng lớp trên. Đây là canh bạc lớn: nếu đúng, Strata trở thành hạ tầng ngữ nghĩa trung tâm; nếu sai, nó bỏ lỡ hệ sinh thái BI khổng lồ.
Với các đội ngũ dữ liệu tại Việt Nam đang tìm cách đưa AI vào quy trình phân tích mà vẫn kiểm soát được độ chính xác, Strata là một cái tên đáng theo dõi — đặc biệt khi bài toán "LLM trả lời sai nhưng rất tự tin" vẫn chưa có lời giải thỏa đáng.
Bài viết liên quan

Phần mềm
Strata: Lớp ngữ nghĩa biết nói "không" với LLM của bạn
30 tháng 9, 2026
Công nghệ
Google thử trả tiền cho website khi xuất hiện trong câu trả lời AI: thất vọng ê chề
30 tháng 9, 2026

Công nghệ
Kinh tế học 'xấu xí' của AI tiêu dùng: Vì sao các ông lớn ngần ngại dù công nghệ đã đủ tốt?
30 tháng 9, 2026