Kolibri: Mô hình AI mở, có chủ quyền của Aleph Alpha với 78 tỷ tham số

Công nghệ03 tháng 10, 2026·8 phút đọc

Aleph Alpha vừa ra mắt Kolibri, mô hình ngôn ngữ Mixture-of-Experts 78 tỷ tham số (chỉ 3 tỷ tham số hoạt động) hỗ trợ ngữ cảnh lên tới 1 triệu token. Đây là mô hình mở theo giấy phép Apache 2.0, tập trung vào chủ quyền dữ liệu và khả năng chống ảo giác cho các lĩnh vực được quản lý chặt chẽ.\n\nĐiểm nhấn là quy trình xây dựng "Model Factory" cho phép Aleph Alpha tạo ra hai mô hình chỉ cách nhau ba tháng, cùng khả năng xử lý tiếng Đức và tiếng Anh đặc biệt hiệu quả.

Kolibri: Mô hình AI mở, có chủ quyền của Aleph Alpha với 78 tỷ tham số

Kolibri: Mô hình AI mở, có chủ quyền của Aleph Alpha với 78 tỷ tham số

Kolibri - mô hình AI mở có chủ quyềnKolibri - mô hình AI mở có chủ quyền

Aleph Alpha vừa công bố Kolibri, một mô hình ngôn ngữ lớn dạng Mixture-of-Experts (MoE) với 78 tỷ tham số tổng cộng nhưng chỉ khoảng 3 tỷ tham số hoạt động cho mỗi token. Mô hình hỗ trợ cửa sổ ngữ cảnh lên tới 1 triệu token, được phát hành mở trên Hugging Face theo giấy phép Apache 2.0.

Điểm đáng chú ý nhất của Kolibri không nằm ở kích thước, mà ở triết lý xây dựng: chủ quyền (sovereignty) và khả năng triển khai tại chỗ (on-premise) cho các tổ chức chính phủ và doanh nghiệp trong lĩnh vực được quản lý chặt chẽ.

Kolibri là gì và nhắm tới ai?

Kolibri là mô hình song ngữ Anh – Đức, được thiết kế cho các công việc "nhiệm vụ trọng yếu" (mission-critical) trong những lĩnh vực có yêu cầu tuân thủ cao như:

  • Hành chính công (đặc biệt là khu vực công của Đức)
  • Công nghiệp sản xuất và sản xuất bán dẫn
  • Hàng không vũ trụ
  • Công nghiệp ô tô và công nghệ truyền động công nghiệp

Khác với nhiều mô hình mở khác vốn tối ưu cho các bài kiểm tra học thuật, Kolibri được tinh chỉnh hướng tới những gì khách hàng thực sự cần trong môi trường sản xuất: lý luận (reasoning), toán học, hành vi tác tử (agentic) và đặc biệt là khả năng từ chối trả lời khi không có đủ thông tin (abstention).

Điểm khác biệt cốt lõi: Kolibri được huấn luyện để nói "Tôi không biết" khi câu trả lời không có trong ngữ cảnh, thay vì đoán bừa.

Hiệu năng: nhỏ nhưng mạnh

Với chỉ 3 tỷ tham số hoạt động trên tổng 78 tỷ, Kolibri nằm trên đường biên Pareto về chất lượng so với chi phí phục vụ (serving cost), cho cả tiếng Anh và tiếng Đức. Nói cách khác, không có mô hình nào trong nhóm so sánh đạt chất lượng cao hơn ở cùng chi phí, hoặc cùng chất lượng với chi phí thấp hơn.

Một số kết quả nổi bật trên các bài kiểm tra chuẩn:

  • AIME 2025 (toán, tiếng Anh): 96.9 điểm, vượt qua nhiều mô hình lớn hơn
  • AIME 2025 (tiếng Đức): 87.5 điểm
  • GPQA Diamond (kiến thức): 84.3 điểm
  • LiveCodeBench v6 (lập trình): 85.9 điểm
  • HumanEval+ (lập trình): 92.7 điểm

Đáng chú ý, ở các bài kiểm tra tác tử (agentic) như τ²-bench telecom, Kolibri đạt 94.7 điểm, cao hơn cả những mô hình có số tham số hoạt động gấp bốn lần.

Chống ảo giác: điểm mạnh then chốt

Vấn đề lớn nhất khiến nhiều doanh nghiệp không thể triển khai AI là ảo giác (hallucination). Các mô hình thông thường được huấn luyện để luôn đưa ra câu trả lời, vì đoán mò vẫn có xác suất đúng, còn từ chối thì không.

Aleph Alpha xử lý vấn đề này theo hai hướng:

  1. Huấn luyện với dữ liệu từ chối: Đưa vào các mẫu dữ liệu mà đáp án đúng chính là "Tôi không biết"
  2. Giao thức Merlin-Arthur: Một quy trình huấn luyện nội bộ tạo ra các ví dụ phủ định tổng hợp, buộc mô hình phải đọc kỹ câu hỏi và ngữ cảnh để xác định khi nào cần từ chối

Kết quả rất rõ rệt: trên bài kiểm tra AA-Omniscience, Kolibri từ chối trả lời thay vì trả lời sai ở 44% các câu, so với chỉ 15% của phiên bản tiền nhiệm Kolibri Origin. Trên bộ RGB, mô hình "kiềm chế" nhiều hơn (86% so với 74%) và tạo ra ít thông tin sai lệch hơn (87% so với 76%).

Xây dựng nhanh: từ 30B lên 78B trong ba tháng

Điểm thú vị về mặt kỹ thuật là tốc độ phát triển. Aleph Alpha xây dựng một "Model Factory" — quy trình huấn luyện được viết dưới dạng code, có thể tái lập hoàn toàn.

  • Kolibri Origin (30B tổng, 3B hoạt động) hoàn thành tiền huấn luyện ngày 11/6/2026
  • Kolibri (78B tổng) hoàn thành ngày 11/9/2026

Chỉ trong ba tháng, nhóm đã tăng số tham số từ 30B lên 78B, mở rộng cửa sổ ngữ cảnh từ 65k lên 256k token (hỗ trợ tới 1M), và tăng dữ liệu huấn luyện từ 7,5 nghìn tỷ lên 20 nghìn tỷ token.

Mô hình được huấn luyện trên 768 GPU B200 trong ba giai đoạn: tiền huấn luyện 20T token với độ dài chuỗi 16k (21 ngày), huấn luyện giữa 3,44T token ở 64k, và thích ứng ngữ cảnh dài 200B token ở 256k.

Điều đáng nể là trong suốt 21 ngày tiền huấn luyện, hệ thống gặp 38 lần gián đoạn không mong muốn do lỗi phần cứng hoặc kết nối — nhưng tất cả đều được xử lý tự động mà không cần con người can thiệp.

Xử lý tiếng Đức: không phải bản dịch

Một trong những đóng góp kỹ thuật quan trọng của Kolibri là cách xử lý tiếng Đức. Aleph Alpha lập luận rằng năng lực ngôn ngữ phải đến từ văn bản gốc chất lượng cao, không phải dịch máy — vì dịch máy mang theo "dấu vân tay văn hóa" của ngôn ngữ nguồn (ví dụ: dịch "Drive safe!" thành "Fahre sicher!" thay vì "Komm gut an!" tự nhiên hơn).

Chiến lược của họ gồm ba phần:

  • Tự lọc dữ liệu tiếng Đức từ Common Crawl: điều chỉnh tham số lọc riêng cho tiếng Đức (ví dụ: không loại bỏ văn bản có từ dài, vì tiếng Đức hành chính vốn dùng nhiều từ ghép dài)
  • Diễn giải lại (rephrasing): dùng LLM viết lại tài liệu tiếng Đức sang nhiều dạng khác nhau, giữ nguyên nội dung văn hóa
  • Dịch thuật: chỉ dùng hạn chế (6% tổng lượng), và không dùng cho Kolibri

Kết quả: 21,3% token tiền huấn luyện là tiếng Đức — khoảng 4,3 nghìn tỷ token. Đây là một trong những tỷ lệ tiếng Đức cao nhất trong các mô hình mở hiện nay.

Kiến trúc Mixture-of-Experts của KolibriKiến trúc Mixture-of-Experts của Kolibri

Tokenizer chuyên biệt cho Anh – Đức

Aleph Alpha cũng phát triển UniBPE, một phương pháp huấn luyện tokenizer mới kết hợp BPE và Unigram. Tokenizer này tôn trọng hình thái học (morphology) của ngôn ngữ tốt hơn, đặc biệt là cấu trúc từ ghép của tiếng Đức.

Ví dụ với từ "Bundessozialgerichtes" (Tòa án Xã hội Liên bang, dạng sở hữu cách):

  • Kolibri: tách thành Bundes | sozial | gericht | es (4 đơn vị có nghĩa)
  • GPT-5, Qwen, Gemini: tách thành Bund | ess | oz | ial | gericht | es (6 đơn vị, cắt ngang ranh giới hình vị)

Việc tách từ theo hình thái giúp giảm số token cần thiết, từ đó giảm chi phí suy luận và tăng tốc độ phản hồi.

Ý nghĩa với người dùng Việt Nam

Dù Kolibri tập trung vào thị trường châu Âu, sự xuất hiện của nó mang lại một số bài học và cơ hội cho cộng đồng công nghệ Việt Nam:

  • Mô hình MoE hiệu quả: kiến trúc 78B tổng nhưng chỉ 3B hoạt động cho thấy cách tối ưu chi phí triển khai, phù hợp với hạ tầng hạn chế
  • Ưu tiên chủ quyền dữ liệu: xu hướng xây dựng mô hình "có chủ quyền" đang lan rộng, và Việt Nam cũng đang có những nỗ lực tương tự với các mô hình ngôn ngữ tiếng Việt
  • Chống ảo giác là yếu tố quyết định: với các ứng dụng trong lĩnh vực pháp lý, y tế, hành chính, khả năng từ chối trả lời đúng lúc quan trọng hơn việc luôn đưa ra đáp án
  • Giấy phép Apache 2.0: cho phép sử dụng thương mại tự do, mở ra khả năng tinh chỉnh cho tiếng Việt

Cách bắt đầu sử dụng

Kolibri có sẵn trên Hugging Face với giấy phép Apache 2.0. Để chạy mô hình, cần cài đặt gói aleph-alpha-inference cung cấp plugin vLLM cho Kolibri:

pip install "aleph-alpha-inference>=1.0"

Sau đó phục vụ mô hình với tính năng lý luận và gọi công cụ:

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Tham số lấy mẫu được khuyến nghị: temperature=1.0, top_p=0.97, top_k=128.

Với ngữ cảnh vượt quá 262.144 token, cần thêm --max-model-len 1048576 cùng các tùy chỉnh tương ứng.

Kết luận

Kolibri là minh chứng cho một hướng đi khác trong phát triển AI: không chạy đua về kích thước thuần túy, mà tập trung vào hiệu quả, chủ quyền và độ tin cậy. Việc Aleph Alpha công bố toàn bộ trọng số theo giấy phép Apache 2.0 — trong khi vẫn nhấn mạnh quy trình xây dựng minh bạch và tuân thủ EU AI Act — cho thấy mô hình mở có thể đi đôi với trách nhiệm pháp lý và chất lượng cao.

Với cộng đồng AI Việt Nam, Kolibri là một mô hình đáng nghiên cứu, đặc biệt về cách xử lý ngữ cảnh dài, kiến trúc MoE tiết kiệm, và các kỹ thuật chống ảo giác có thể áp dụng cho các mô hình tiếng Việt trong tương lai.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗