Strands Decider 2B: Mô hình ra quyết định nhỏ gọn, mã nguồn mở
Strands vừa ra mắt Strands Decider 2B, một mô hình ra quyết định (decision model) chỉ với 2 tỷ tham số, chuyên biệt cho việc lựa chọn giữa các phương án thay vì sinh văn bản. Mô hình chạy được trên CPU hoặc GPU cục bộ với độ trễ chỉ vài chục mili-giây, mở ra hướng đi mới cho các tác tử AI (AI agent) tiết kiệm chi phí và nhanh nhạy hơn.

Trong bối cảnh các mô hình ngôn ngữ lớn (LLM) ngày càng phình to về kích thước, một hướng tiếp cận mới đang thu hút sự chú ý: mô hình ra quyết định (decision model). Strands vừa công bố Strands Decider 2B, một mô hình mã nguồn mở chỉ với 2 tỷ tham số, được thiết kế để đưa ra quyết định nhanh chóng thay vì sinh văn bản tự do.
Mô hình ra quyết định chuyên biệt cho tác tử AI
Mô hình ra quyết định là gì?
Khác với LLM có khả năng sinh ra bất kỳ đoạn văn bản nào, mô hình ra quyết định chỉ làm một việc: chọn giữa các phương án có sẵn. Ví dụ, nó có thể trả lời câu hỏi "Chuỗi 'bật đèn lên' có liên quan đến máy pha cà phê không? Có hay Không." hoặc "Câu 'sihamba ngokushesha' thuộc ngôn ngữ nào? Tiếng Anh, tiếng Zulu, hay tiếng Hà Lan."
Đổi lại việc mất đi tính linh hoạt, mô hình ra quyết định có những lợi thế rõ rệt:
- Nhanh hơn và mạnh hơn ở cùng kích thước tham số
- Luôn trả về câu trả lời nằm trong tập phương án đã chọn
- Độ trễ rất thấp, phù hợp với các tác vụ thời gian thực
- Điểm tin cậy cao cho từng quyết định, điều mà các API LLM hiện tại chưa cung cấp
Tuy nhiên, mô hình ra quyết định không phù hợp cho lập trình, chatbot, tóm tắt tài liệu hay các tác vụ sinh văn bản phổ biến khác. Điểm mạnh của nó nằm ở việc điều khiển các luồng công việc tác tử (agentic workflow) — nơi mà việc đưa ra quyết định nhanh và rẻ quan trọng hơn khả năng viết lách.
Độ chính xác và độ hiệu chuẩn theo quá trình huấn luyện
Kiến trúc và hiệu năng
Strands Decider 2B được xây dựng bằng cách lấy một LLM đã huấn luyện sẵn (Qwen3.5-2B), loại bỏ phần đầu ra ngôn ngữ (LM head) và thay bằng một pointer head chỉ hơn một triệu tham số. Phần thân mô hình được tinh chỉnh với LoRA rank-16.
Kết quả đạt được khá ấn tượng:
- Độ chính xác: xếp thứ 3 trong số 33 mô hình cùng lớp 2B trên bộ dữ liệu JevBench, và đứng đầu nếu loại trừ các mô hình vừa nhỉnh hơn 2B
- Độ hiệu chuẩn (Brier score): đứng thứ nhất trong 30 mô hình cùng nhóm
- Độ trễ: trung vị khoảng 115ms trên GPU Nvidia RTX 3090, và khoảng 153ms trên MacBook M3 với các tác vụ nhỏ
Độ trễ tăng gần như tuyến tính theo kích thước tác vụ
Tại sao lại chọn 2B?
Strands chọn kích thước 2 tỷ tham số vì hai lý do chính. Thứ nhất, mô hình đủ nhỏ để chạy thử nghiệm trên phần cứng sẵn có — bạn có thể dùng, thậm chí huấn luyện lại mô hình ngay trên máy cá nhân. Thứ hai, 2B dường như là điểm cân bằng lý tưởng: đủ nhỏ để thử nghiệm, đủ lớn để làm việc thực sự. Mô hình xử lý chính xác 100% các tác vụ dễ trên JevBench.
Ứng dụng thực tế
Các nhà phát triển đang sử dụng mô hình ra quyết định cho nhiều mục đích:
- Định tuyến mô hình (model routing) — quyết định gọi LLM nào cho tác vụ nào
- Chọn công cụ (tool selection) trong các tác tử AI
- Đánh giá (evaluations) và rào chắn bảo vệ (guardrails)
- Quản lý ngữ cảnh và bộ nhớ của tác tử
- Phân loại chính sách (policy classification)
Một ví dụ thú vị trong kho mã nguồn: tác tử có công cụ get_weather với prompt hệ thống được thiết kế để "háo hức" — khi người dùng hỏi "Thời tiết thế nào?" mà không nói thành phố, tác tử sẽ đoán bừa một thành phố và gọi công cụ. Trước khi lệnh gọi chạy, Strands Decider 2B đọc cuộc hội thoại và trả lời hai câu hỏi có/không: các tham số có dựa trên điều người dùng thực sự nói không, và có quá sớm để gọi công cụ này không. Kết quả là tác tử quay lại hỏi thành phố thay vì báo thời tiết ở nơi không ai nhắc đến.
Một quyết định có chi phí rẻ như vậy có thể nằm trong những luồng mà trước đây một lệnh gọi LLM không thể nào đảm nhiệm được.
Bắt đầu sử dụng
Cách đơn giản nhất là cài đặt qua CLI:
pip install strands-decider
Sau đó có thể đặt câu hỏi lựa chọn dựa trên trạng thái:
strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 \
--state "Cứu! Lệnh chi trả của tôi bị lỗi suốt 3 ngày nay!" \
--choice "Đội nào nên xử lý việc này?=billing,sales,retail"
Kết quả trả về dạng xác suất cho từng phương án, kèm điểm tin cậy. Toàn bộ mã nguồn, dữ liệu huấn luyện và script đều được công bố mở trên GitHub, trọng số mô hình có sẵn trên Hugging Face.
Với các nhà phát triển Việt Nam đang xây dựng tác tử AI, Strands Decider 2B là cơ hội tốt để thử nghiệm mà không cần đầu tư hạ tầng đắt đỏ — chỉ cần một chiếc laptop là có thể bắt đầu. Xu hướng mô hình ra quyết định nhỏ gọn nhiều khả năng sẽ còn phát triển mạnh trong thời gian tới, đặc biệt khi các doanh nghiệp tìm cách tối ưu chi phí vận hành tác tử AI.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Endeavor Catalyst gọi vốn 320 triệu USD để đầu tư cho các founder ngoài Thung lũng Silicon
07 tháng 10, 2026