Strata: Lớp ngữ nghĩa có thể nói "không" với LLM của bạn

Phần mềm30 tháng 9, 2026·4 phút đọc

Strata là giải pháp lớp ngữ nghĩa (semantic layer) full-stack cho phép doanh nghiệp tự phục vụ dữ liệu mà không cần kỹ năng kỹ thuật. Điểm đặc biệt là nó có thể từ chối truy vấn của LLM khi không thể đảm bảo độ chính xác, thay vì đưa ra câu trả lời sai lệch.

Strata: Lớp ngữ nghĩa có thể nói "không" với LLM của bạn

Xây dựng một lớp ngữ nghĩa (semantic layer) vừa đủ linh hoạt cho người dùng kỹ thuật, vừa đủ dễ hiểu cho đồng nghiệp không chuyên — đó là bài toán mà nhiều công cụ BI đã thất bại. Strata, sản phẩm mới của Ajo (cựu kỹ sư Netflix với 4 năm giải quyết bài toán self-service cho người dùng kinh doanh), đưa ra một hướng tiếp cận khác: thiết kế lớp ngữ nghĩa chặt chẽ đến mức AI cũng phải tuân theo.

Điểm gây chú ý nhất của Strata là khả năng từ chối truy vấn của LLM khi không thể đảm bảo kết quả chính xác. Thay vì "ảo giác" ra một con số sai lệch, Strata sẽ giải thích lý do từ chối — một tính năng mà bất kỳ ai từng vật lộn với độ tin cậy của AI trong phân tích dữ liệu đều mong đợi.

Triết lý thiết kế: Tên gọi chính là mô hình

Strata áp đặt quy tắc đặt tên cực kỳ nghiêm ngặt. Trong một dự án, chỉ có duy nhất một thứ được gọi là "Revenue". Nếu doanh thu được ánh xạ từ nhiều bảng, hệ thống sẽ tự động chọn bảng dựa trên độ chi tiết (grain) và tốc độ truy vấn.

Quy tắc đặt tên nghiêm ngặt cho phép Strata tự động kết hợp dữ liệu giữa các miền fact (fact domain) mà không cần cấu hình thủ công.

Cách tiếp cận này trái ngược hoàn toàn với Looker hay Cube, nơi người dùng phải tự định nghĩa join và xử lý xung đột tên. Strata biến việc đặt tên thành một phần của logic nghiệp vụ, buộc mọi người trong tổ chức phải thống nhất về ngữ nghĩa trước khi viết code.

Định tuyến ngữ nghĩa theo phân vùng và tổng hợp

Một tính năng kỹ thuật đáng chú ý: Strata có khả năng định tuyến truy vấn theo tầng dữ liệu. Bạn có thể nạp một phần dữ liệu vào engine nhanh như Druid hoặc ClickHouse, trong khi vẫn giữ toàn bộ lịch sử trong Trino hoặc một hệ thống rẻ hơn. Strata sẽ tự chọn tầng nhanh nhất nếu truy vấn có thể giải quyết ở đó.

Điều này giải quyết một vấn đề kinh điển trong kiến trúc dữ liệu: làm sao vừa có tốc độ cho dashboard, vừa có đầy đủ lịch sử cho phân tích chuyên sâu — mà không cần xây dựng lớp cache phức tạp.

Các loại measure phức tạp và cohort

Strata hỗ trợ sẵn nhiều loại measure mà các công cụ khác thường yêu cầu viết SQL thủ công:

  • Snapshot measure: đo lường trạng thái tại một thời điểm
  • LOD (Level of Detail): include/exclude theo chiều phân tích
  • Compound measure: kết hợp nhiều measure con
  • Auto leveling compound: tự động điều chỉnh độ chi tiết theo ngữ cảnh truy vấn

Người dùng còn có thể tạo cohort và áp dụng như bộ lọc cho toàn bộ truy vấn hoặc cho từng measure riêng lẻ — một tính năng thường chỉ có trong các công cụ phân tích hành vi đắt tiền.

Tích hợp với AI và quy trình làm việc

Strata cung cấp API và MCP (Model Context Protocol) để tích hợp với các coding agent như Claude Code, Codex hay Cursor. Agent đọc file AGENTS.md trong dự án để hiểu schema YAML, quy tắc đặt tên và các lệnh khám phá dữ liệu — không cần prompt tùy chỉnh.

Quy trình làm việc điển hình:

  1. Cài đặt server qua Docker (một container, một lệnh)
  2. Cài CLI (Ruby gem, yêu cầu Ruby 3.4.4+)
  3. Tạo dự án với strata init
  4. Kết nối warehouse (Snowflake, Databricks, PostgreSQL, ClickHouse, DuckDB...)
  5. Để agent xây dựng model, sau đó review và deploy

Toàn bộ model được lưu dưới dạng YAML trong Git, giúp dễ dàng review, version control và cộng tác. Với những ai đang dùng dbt MetricFlow, Cube hoặc LookML, Strata có thể transpile định nghĩa hiện có sang model của mình chỉ trong vài phút.

Điểm đáng cân nhắc

Strata không phải mã nguồn mở và hiện đang ở giai đoạn beta sớm. Tuy nhiên, phiên bản miễn phí cho phép tới 25 người dùng và chạy hoàn toàn trên máy cá nhân qua Docker — đủ để đánh giá trước khi cam kết.

Quyết định không xây dựng lớp ngữ nghĩa để các công cụ BI kết nối vào cũng đáng chú ý. Tác giả gọi hướng đi đó là "ngõ cụt", thay vào đó tập trung vào API và MCP để người dùng tự xây dựng lớp trên. Đây là canh bạc lớn: nếu đúng, Strata trở thành hạ tầng ngữ nghĩa trung tâm; nếu sai, nó bỏ lỡ hệ sinh thái BI khổng lồ.

Với các đội ngũ dữ liệu tại Việt Nam đang tìm cách đưa AI vào quy trình phân tích mà vẫn kiểm soát được độ chính xác, Strata là một cái tên đáng theo dõi — đặc biệt khi bài toán "LLM trả lời sai nhưng rất tự tin" vẫn chưa có lời giải thỏa đáng.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗