Ollaya – Giải pháp chạy mô hình quyết định mã nguồn mở kiểu Jev trên máy cá nhân
Ollaya là dự án mã nguồn mở cho phép chạy các mô hình quyết định (decision model) ngay trên phần cứng của bạn, lấy cảm hứng từ Jev nhưng không phụ thuộc vào API đám mây. Công cụ này trả về câu trả lời có xác suất hiệu chuẩn chỉ trong vài mili-giây, hỗ trợ đa ngôn ngữ và tương thích với SDK TypeSafe, giúp bảo vệ dữ liệu nhạy cảm của doanh nghiệp.

Ollaya – Chạy mô hình quyết định mã nguồn mở ngay trên máy của bạn
Ollaya là một dự án mã nguồn mở mới cho phép chạy các mô hình quyết định (decision model) ngay trên phần cứng cá nhân, lấy cảm hứng từ Jev nhưng không cần gửi dữ liệu lên đám mây. Công cụ này trả về câu trả lời có xác suất hiệu chuẩn chỉ trong vài mili-giây, hỗ trợ hơn 100 ngôn ngữ và tương thích với SDK TypeSafe.
Mô hình quyết định là gì và Ollaya giải quyết bài toán nào?
Khác với các mô hình ngôn ngữ lớn (LLM) truyền thống vốn sinh văn bản từng token một, mô hình quyết định đưa ra câu trả lời chỉ trong một lượt lan truyền (forward pass) duy nhất. Điều này có nghĩa là tốc độ nhanh hơn rất nhiều và không tốn kém chi phí tính toán.
Ollaya cho phép bạn đặt những câu hỏi có cấu trúc (typed questions) về bất kỳ đoạn văn bản hay JSON nào, rồi nhận về câu trả lời kèm xác suất. Ví dụ điển hình:
$ ollaya run laya --preset triage "I was charged twice this month and want a refund."
Kết quả trả về các trường như intent=refund (xác suất 1.00), is_urgent=no (0.87), frustration=1.59/3 (0.36), refund_requested=yes (0.88), churn_risk=no (0.89). Toàn bộ quá trình chỉ mất 8,9 ms trên GPU RTX 4090.
Hiệu năng vượt trội nhờ chạy cục bộ
Điểm mạnh lớn nhất của Ollaya là tốc độ. Trên GPU RTX 4090, một yêu cầu gồm năm câu hỏi tới mô hình Laya chỉ mất khoảng 10 ms tính cả thời gian qua HTTP API. So sánh với API TypeSafe Jev được lưu trữ (hosted), vốn có độ trễ trung bình 236–276 ms do phải cộng thêm độ trễ mạng.
Bảng so sánh độ trễ trung bình (càng thấp càng tốt):
- laya:multilingual – 8,1 ms
- laya:en – 9,6 ms
- gliclass – 14,7 ms
- nli – 20,4 ms
- decider:0.8b – 155 ms
- decider:2b – 190 ms
- TypeSafe Jev (hosted API) – 236–276 ms
Lưu ý: các thiết lập đo khác nhau, nên con số này chỉ mang tính so sánh theo bậc độ lớn.
Tương thích hoàn toàn với TypeSafe API
Một trong những điểm đáng chú ý nhất của Ollaya là khả năng thay thế trực tiếp (drop-in compatible) cho TypeSafe. Ollaya phục vụ các endpoint /v1/systemone và /v1/models với đúng cấu trúc request và response của TypeSafe. Điều này có nghĩa là SDK Python chính thức của TypeSafe phiên bản 0.7.1 hoạt động nguyên vẹn khi trỏ vào server cục bộ.
# Trỏ SDK TypeSafe vào Ollaya
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local # giá trị bất kỳ đều được
export TYPESAFE_DEFAULT_MODEL=laya
Bạn cũng có thể gọi trực tiếp endpoint tương thích:
curl http://localhost:11435/v1/systemone -d '{
"model": "laya",
"state": "Can I get an invoice for last month?",
"questions": {
"intent": {
"type": "choice",
"instructions": "What does the customer want?",
"criteria": {
"invoice": "Needs an invoice or receipt",
"refund": "Wants money back",
"other": "Anything else"
}
}
}
}'
Kết quả trả về cho thấy mô hình xác định ý định là invoice với độ tin cậy 0,9547.
Các mô hình mã nguồn mở sẵn có
Ollaya cung cấp sẵn nhiều mô hình mở, sẵn sàng tải về:
- Laya (Convai Innovations): mô hình tiếng Anh, mô hình hơn 100 ngôn ngữ, mô hình tinh chỉnh cho quyết định có cấu trúc, và một router tự động chọn mô hình phù hợp. Kích thước 322M – 421M tham số.
- decider (Mapika trên nền Qwen3.5): mô hình đọc câu trả lời từ logit của chữ cái lựa chọn trong một lượt lan truyền. Đây là mô hình quyết định mở chính xác nhất mà Ollaya cung cấp. Kích thước 0,75B – 1,9B.
- nli (Moritz Laurer): bộ phân loại zero-shot, mỗi lựa chọn trở thành một giả thuyết được chấm điểm entailment. Kích thước 396M – 435M.
- gliclass (Knowledgator): bộ phân loại zero-shot tuân theo hướng dẫn, chấm điểm tất cả lựa chọn trong một lượt, nên chi phí gần như không tăng theo số lượng lựa chọn. Kích thước 439M.
Ngoài ra, dự án còn dự kiến bổ sung mô hình von – các mô hình quyết định dựa trên LLM qua llama.cpp với định dạng GGUF.
Bảo mật dữ liệu – điểm cộng cho doanh nghiệp Việt Nam
Với các doanh nghiệp Việt Nam đang phải xử lý lượng lớn dữ liệu khách hàng nhạy cảm như ticket hỗ trợ, email hay tin nhắn người dùng, Ollaya mang lại lợi ích rõ rệt:
- Chạy cục bộ: hoạt động trên máy của bạn với ONNX Runtime, trên CPU hoặc GPU NVIDIA. Server mặc định chỉ lắng nghe trên
127.0.0.1. - Trọng số mở: tải từ kho Hugging Face của tác giả gốc, ghim theo commit và kiểm tra sha256. Ollaya không lưu trữ lại, runtime dùng giấy phép Apache-2.0.
- Không phí theo token: chạy bao nhiêu quyết định tùy theo phần cứng, không tính phí đo lường và không có hóa đơn API.
- Xác suất hiệu chuẩn: có thể đặt ngưỡng tin cậy. Sai số hiệu chuẩn (ECE) của Laya là 0,081 sau khi tinh chỉnh temperature, so với 0,246 của Jev.
Nền tảng được hỗ trợ
Ollaya có mặt trên hầu hết các hệ điều hành phổ biến:
- macOS: ứng dụng desktop (Apple silicon), ứng dụng menu bar (.dmg), dòng lệnh. Chỉ chạy CPU.
- Windows 10/11 (x64): ứng dụng desktop (.exe hoặc .msi), dòng lệnh PowerShell. Hỗ trợ GPU NVIDIA qua WSL 2.
- Linux (x86-64): ứng dụng desktop (AppImage, .deb, .rpm), dòng lệnh, dịch vụ systemd. Hỗ trợ GPU NVIDIA, CUDA 13.
- Linux (ARM64): dòng lệnh, dịch vụ systemd. Chỉ chạy CPU.
- Docker (amd64 và arm64): image trên GHCR, hỗ trợ GPU NVIDIA qua image
:cuda.
GPU NVIDIA cần driver R580 trở lên; bộ cài đặt chỉ tải thư viện CUDA khi phát hiện có GPU. Trên GPU Apple, AMD và Intel, mô hình chạy bằng CPU.
Cách bắt đầu
Chỉ cần một tệp nhị phân và một dòng lệnh:
ollaya run laya
Bạn có thể tải về cho macOS, Windows, Linux và Docker. Dự án phát hành theo giấy phép Apache-2.0 và mã nguồn có sẵn trên GitHub.
Với xu hướng AI chạy cục bộ ngày càng phổ biến, Ollaya là một lựa chọn đáng cân nhắc cho các đội phát triển phần mềm và doanh nghiệp muốn triển khai phân loại, định tuyến hoặc ra quyết định tự động mà không phải lo lắng về chi phí API hay quyền riêng tư dữ liệu.

