Kolibri: Mô hình AI chủ quyền của Đức với 78 tỷ tham số, chỉ dùng 3,5 tỷ mỗi token

Công nghệ03 tháng 10, 2026·12 phút đọc

Aleph Alpha vừa ra mắt Kolibri, mô hình ngôn ngữ lớn mã nguồn mở dành riêng cho tiếng Đức và tiếng Anh, được huấn luyện hoàn toàn trên hạ tầng tại Đức và Phần Lan. Với kiến trúc mixture of experts 78 tỷ tham số nhưng chỉ kích hoạt khoảng 3,5 tỷ tham số mỗi token, Kolibri đặt mục tiêu cân bằng giữa đổi mới sáng tạo và tuân thủ quy định của Liên minh châu Âu.

Kolibri: Mô hình AI chủ quyền của Đức với 78 tỷ tham số, chỉ dùng 3,5 tỷ mỗi token

Kolibri: Mô hình AI chủ quyền của Đức với 78 tỷ tham số, chỉ dùng 3,5 tỷ mỗi token

Aleph Alpha vừa chính thức ra mắt Kolibri, một mô hình ngôn ngữ lớn (LLM) mã nguồn mở dành cho tiếng Đức và tiếng Anh, được huấn luyện hoàn toàn trên hạ tầng đặt tại Đức và Phần Lan. Đây được xem là câu trả lời trực tiếp của châu Âu trước làn sóng mô hình AI đến từ Mỹ và Trung Quốc. Với kiến trúc mixture of experts 78 tỷ tham số nhưng chỉ kích hoạt khoảng 3,5 tỷ tham số cho mỗi token, Kolibri hứa hẹn mang lại hiệu năng cao trong khi vẫn đảm bảo tính chủ quyền dữ liệu.

Kolibri là gì?

Kolibri là mô hình ngôn ngữ lớn với trọng số mở, phát hành ngày 3 tháng 10 năm 2026 theo giấy phép Apache 2.0. Trọng số mô hình được công bố trên Hugging Face, cho phép bất kỳ ai cũng có thể tải về, chạy thử, tinh chỉnh và xây dựng sản phẩm dựa trên đó.

Một số thông số kỹ thuật đáng chú ý:

  • Tổng tham số: 78,1 tỷ, nhưng chỉ 3,46 tỷ (khoảng 4,4%) được dùng cho mỗi token
  • Ngôn ngữ: Tiếng Đức và tiếng Anh
  • Ngữ cảnh: 262.144 token gốc, đã kiểm thử lên tới 1.048.576 token
  • Giấy phép: Apache 2.0 cho trọng số và tệp cấu hình
  • Bộ nhớ: khoảng 78 GB trọng số ở định dạng FP8
  • Khả năng suy luận: 4 mức — none, low, medium và high
  • Gọi công cụ: Có hỗ trợ
  • Mốc kiến thức: 18 tháng 6 năm 2026
  • Huấn luyện: khoảng 24 nghìn tỷ token, hơn một phần năm là tiếng Đức, trên 768 GPU NVIDIA B200

Aleph Alpha gọi Kolibri là mô hình "chủ quyền", theo hai nghĩa. Thứ nhất là cách nó được xây dựng: các nhóm kỹ sư làm việc tại Đức, huấn luyện trên hạ tầng tại Đức và Phần Lan, tuân theo luật châu Âu và luật Đức, không chịu sự kiểm soát từ bên ngoài. Thứ hai là những gì khách hàng nhận được: quyền tự do triển khai hoàn toàn và an toàn về sở hữu trí tuệ.

Nói một cách đơn giản, một cơ quan chính phủ hay một nhà cung cấp ô tô có thể chạy Kolibri trên máy chủ riêng của mình, dữ liệu không bao giờ rời khỏi tòa nhà, và không ai có thể thay đổi hay tắt mô hình sau lưng họ. Aleph Alpha cũng đã ký Bộ Quy tắc Thực hành cho AI Đa dụng (GPAI) của Liên minh châu Âu.

"Chủ quyền" không có nghĩa là không có gì từ bên ngoài châu Âu tham gia vào quá trình xây dựng. Thẻ mô hình nói rõ: văn bản web tiếng Anh được diễn đạt lại bằng Gemma 4 của Google, tiếng Đức bằng Mistral-NeMo, và Qwen3-32B dán nhãn dữ liệu cho các bộ lọc chất lượng.

Cách Kolibri hoạt động

Kolibri là sự kết hợp của 6 ý tưởng kỹ thuật, mỗi ý tưởng đều nhằm mục đích làm cho tiếng Đức trở nên rẻ hơn, dài hơn hoặc trung thực hơn.

1. 384 chuyên gia, mỗi token chỉ gặp 6

Trong một mô hình dày (dense) thông thường, mỗi token đi qua toàn bộ tham số. Với kiến trúc mixture of experts (MoE), mỗi lớp có một tập hợp các mạng con nhỏ gọi là "chuyên gia" cùng một bộ định tuyến (router) chọn ra một vài chuyên gia cho mỗi token.

Kolibri có 50 lớp, mỗi lớp gồm 384 chuyên gia cộng thêm 1 chuyên gia chia sẻ mà mọi token đều đi qua. Bộ định tuyến gửi mỗi token đến 6 trong số 384 chuyên gia. Đó là cách 78,1 tỷ tham số biến thành chỉ 3,46 tỷ tham số thực sự hoạt động cho mỗi token.

Tuy nhiên, cần lưu ý một điểm quan trọng: các chuyên gia không phải là những chủ đề rõ ràng như "luật Đức". Khi các nhà nghiên cứu mổ xẻ mô hình MoE, họ thường thấy các chuyên gia chuyên về các mẫu token, ví dụ như dấu câu hay danh từ riêng. Và mô hình vẫn phải giữ tất cả 384 chuyên gia trong bộ nhớ, dù mỗi lần chỉ dùng 6. Nghĩa là Kolibri tính toán như một mô hình 3,5 tỷ tham số nhưng cần bộ nhớ của một mô hình 78 tỷ tham số.

2. Tokenizer đọc được từ ghép dài tiếng Đức

Mô hình không đọc chữ cái hay từ, mà đọc token — những mảnh văn bản từ một từ vựng cố định. Tiếng Đức có đặc điểm ghép nhiều từ lại thành từ ghép dài, và một tokenizer học chủ yếu từ tiếng Anh sẽ cắt chúng thành nhiều mảnh vụn.

Ví dụ với tên tiếng Đức của Tòa án Hiến pháp Liên bang:

  • Tokenizer của GPT-5 (o200k_base): Bundes | es | ver | fass | ungs | gericht — 6 token
  • Tokenizer của Kolibri: Bundes | verfassungsgericht — 2 token

Tokenizer của Kolibri có 128.000 token, được huấn luyện bằng thuật toán mới gọi là UniBPE, giữ cách gộp từ dưới lên của byte-pair encoding (BPE) nhưng chọn mỗi lần gộp bằng một quy tắc tính điểm khác. Theo báo cáo kỹ thuật, tokenizer này cần ít hơn 11,2% token cho văn bản tiếng Đức so với tokenizer của GPT-5.

Khi chạy thử nghiệm trên toàn bộ Luật Cơ bản của Cộng hòa Liên bang Đức (185 KB văn bản pháp lý tiếng Đức), kết quả cho thấy Kolibri cần ít hơn khoảng 15% token so với tokenizer của GPT-5.

3. Hầu hết các lớp chỉ nhìn gần

40 trong số 50 lớp của Kolibri sử dụng sliding-window attention: mỗi token chỉ nhìn vào 512 token phía trước nó. Cứ mỗi lớp thứ 5 thì mô hình lại nhìn toàn bộ những gì phía trước. Cách này giống như đọc một hợp đồng dài, chủ yếu tập trung vào câu đang đọc, và cứ vài trang lại dừng lại để suy nghĩ tổng thể. Đây chính là yếu tố giúp ngữ cảnh 1 triệu token trở nên khả thi về mặt chi phí.

Một chi tiết thông minh nữa: chỉ các lớp sliding-window mới biết vị trí của token (thông qua rotary position embeddings), còn các lớp attention đầy đủ thì không. Nhờ đó, ngữ cảnh có thể vượt qua mốc 262.144 token mà mô hình được huấn luyện mà không cần thêm thủ thuật vị trí nào. Aleph Alpha đã kiểm chứng lên tới 1.048.576 token.

4. Suy luận bằng tiếng Đức

Các mô hình suy luận thường "nghĩ" trước khi trả lời, nhưng ngay cả với câu hỏi tiếng Đức, chúng phần lớn vẫn nghĩ bằng tiếng Anh. Aleph Alpha đã tạo ra khoảng 800.000 ví dụ suy luận tiếng Đức và phát hiện ra một điều thú vị: một chút dữ liệu suy luận tiếng Đức còn tệ hơn là không có gì.

Điểm toán tiếng Đức của mô hình giảm từ 70,2 xuống 48,3, vì những suy nghĩ tiếng Đức cứ luẩn quẩn vòng vo và không bao giờ đi đến kết luận. Chỉ khi có thêm rất nhiều dữ liệu tiếng Đức, điểm số mới leo trở lại mức 67,3.

Kolibri được huấn luyện với lượng dữ liệu đó. Nó suy luận bằng tiếng Đức khi gặp câu hỏi tiếng Đức, và điểm toán tiếng Đức của nó cao nhất trong nhóm mô hình có khoảng 3 tỷ tham số hoạt động: 87,5 trên kỳ thi AIME 2025 bằng tiếng Đức, so với 84,4 của mô hình xếp sau là Nemotron 3 Nano của NVIDIA.

5. Được huấn luyện để nói "Tôi không biết"

Ảo giác (hallucination) là một trong những vấn đề lớn nhất của AI tạo sinh. Giải pháp phổ biến là retrieval augmented generation (RAG): tra cứu thông tin tốt, có thẩm quyền và đưa vào câu lệnh. Nhưng RAG chỉ hiệu quả nếu mô hình biết thừa nhận khi tài liệu không có câu trả lời.

Aleph Alpha đã huấn luyện Kolibri theo một phương pháp riêng gọi là giao thức Merlin-Arthur. Nó hoạt động như một trò chơi có 3 người chơi:

  • Arthur là mô hình, nhận câu hỏi với một phần tài liệu hỗ trợ bị ẩn đi
  • Merlin ẩn các phần sao cho câu trả lời đúng trở nên dễ tìm hơn, và Arthur được huấn luyện để trả lời những câu đó
  • Morgana ẩn bằng chứng mà câu trả lời phụ thuộc vào, và Arthur được huấn luyện để nói rằng nó không biết

Arthur không bao giờ biết mình đang đối mặt với ai, nên cách duy nhất để thắng là thực sự kiểm tra xem bằng chứng trước mắt có ủng hộ câu trả lời hay không.

Kết quả khá rõ rệt: trên bài kiểm tra Omniscience của Artificial Analysis, khi Kolibri không biết câu trả lời, nó thừa nhận (hoặc trả lời một phần) tới 44% số lần thay vì bịa ra. Qwen3.5 35B-A3B chỉ đạt 11,1% và GPT-OSS 120B đạt 23,7%.

6. Người dùng chọn mức độ suy luận

Mỗi yêu cầu có thể đặt tham số reasoning_effort thành none, low, medium hoặc high. Nhờ đó, một câu hỏi tra cứu nhanh sẽ được trả lời ngay, còn một câu hỏi khó sẽ được suy nghĩ lâu hơn — tất cả từ cùng một mô hình trên cùng một máy chủ.

Kolibri mạnh ở điểm nào?

Theo đánh giá của Aleph Alpha, Kolibri dẫn đầu các mô hình mở cùng kích cỡ ở những hạng mục sau:

  • Điểm tổng thể tiếng Anh: 75,5 (so với 74,7 của Qwen3.5 35B-A3B)
  • Điểm tổng thể tiếng Đức: 70,8 (so với 69,8 của Qwen3.5 35B-A3B)
  • AIME 2025 tiếng Anh: 96,9 (so với 89,6 của Nemotron 3 Nano)
  • AIME 2025 tiếng Đức: 87,5 (so với 84,4 của Nemotron 3 Nano)
  • Câu hỏi về tài liệu công ty chưa từng thấy, tiếng Anh: 89,7 (so với 87,0 của Qwen3.5 35B-A3B)
  • Ngữ cảnh dài 1 triệu token (mô hình gốc): 63,2 (so với 58,5 của Nemotron 3 Nano)

Điểm nổi bật nhất là toán học: trên AIME 2025 và 2026 bằng tiếng Anh, Kolibri đánh bại mọi mô hình MoE trong so sánh, kể cả những mô hình có 12 tỷ tham số hoạt động. Chỉ có Qwen3.8 27B dạng dense mới đạt điểm cao hơn.

Kolibri yếu ở điểm nào?

Aleph Alpha công bố cả những hạng mục yếu nhất bên cạnh những hạng mục mạnh nhất trong thẻ mô hình:

  • Kiến thức từ bộ nhớ hạn chế: Đứng cuối trong 12 mô hình ở bài kiểm tra "sách đóng" (51,0 điểm), và chỉ trả lời đúng 14,8% câu hỏi Omniscience, so với 22,2% của Qwen3.5 35B-A3B. Nó biết khi nào mình không biết, nhưng cũng biết ít hơn.
  • Gọi công cụ nhiều lượt còn yếu: Đạt 39,8 điểm trên bài kiểm tra nhiều lượt của Berkeley Function Calling Leaderboard, so với 58,2 của GLM-4.7 Flash.
  • Không phải agent lập trình tốt nhất: Đạt 27,7 điểm trên Terminal-Bench 2.1, so với 39,7 của Qwen3.5 35B-A3B.
  • Ngữ cảnh dài bị hụt ở giữa: Ở mức 128.000 token trên RULER, Qwen3.5 đạt 89,9 còn Kolibri chỉ đạt 67,9. Kolibri chỉ vượt lên ở đoạn cực dài.
  • Yêu cầu bộ nhớ lớn: 78 GB trọng số đồng nghĩa với việc cần một hoặc hai GPU trung tâm dữ liệu, không bao giờ chạy được trên laptop.
  • Hệ sinh thái còn mới: Cần plugin vLLM của Aleph Alpha, hiện chỉ hỗ trợ một phiên bản vLLM tại một thời điểm.
  • Chỉ hỗ trợ 2 ngôn ngữ: Đây là lựa chọn có chủ đích — thẻ mô hình gọi đó là "ưu tiên chiều sâu hơn chiều rộng".

Cách chạy Kolibri

Bạn cần khoảng 78 GB bộ nhớ GPU: tối thiểu 2 GPU NVIDIA A100 hoặc H100 loại 80 GB, hoặc một chiếc H200, B200 hay B300. Cài đặt plugin và khởi chạy máy chủ tương thích OpenAI:

pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Thẻ mô hình khuyến nghị đặt temperature=1.0, top_p=0.97, top_k=128, và giới hạn ngữ cảnh ở mức tối đa 262.144 token cho những tác vụ nhạy cảm về độ trễ. Muốn dùng đủ 1 triệu token thì thêm hai cờ:

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --max-model-len 1048576 \
  --hf-overrides '{"max_position_embeddings": 1048576}'

Khi nào nên dùng Kolibri?

Kolibri là lựa chọn phù hợp khi cả văn bản tiếng Đức lẫn phần cứng của chính bạn đều quan trọng: một cơ quan nhà nước, ngân hàng, nhà sản xuất hay nhà cung cấp hàng không vũ trụ cần giữ tài liệu trong nội bộ, muốn câu trả lời tiếng Đức được suy luận bằng tiếng Đức, và thà nghe "Tôi không biết" còn hơn nhận một câu trả lời sai đầy tự tin.

RAG trên các tài liệu tiếng Đức dài (luật, hợp đồng, sách hướng dẫn) phát huy mọi điểm mạnh của Kolibri: tokenizer, ngữ cảnh 1 triệu token và khả năng từ chối trả lời.

Ngược lại, đây là lựa chọn sai trong các trường hợp sau: làm agent lập trình (Qwen3.6 35B-A3B dẫn đầu), trả lời câu hỏi từ bộ nhớ, xử lý ngôn ngữ khác ngoài tiếng Đức và tiếng Anh, hoặc khi bạn không thể dành ra 78 GB bộ nhớ GPU.

Ý nghĩa đối với người dùng Việt Nam

Sự ra đời của Kolibri mang đến một bài học đáng suy ngẫm cho cộng đồng công nghệ Việt Nam. Trong khi các mô hình lớn đến từ Mỹ và Trung Quốc thống trị thị trường, một quốc gia có thể xây dựng mô hình AI riêng, tối ưu cho ngôn ngữ và văn hóa bản địa, đồng thời đảm bảo chủ quyền dữ liệu.

Đối với các doanh nghiệp và tổ chức tại Việt Nam đang cân nhắc xây dựng mô hình AI tiếng Việt, Kolibri cho thấy một lộ trình khả thi: tập trung vào chiều sâu ngôn ngữ thay vì cố gắng cạnh tranh về quy mô tổng thể, tối ưu tokenizer cho đặc thù ngôn ngữ, và xây dựng cơ chế từ chối trả lời đáng tin cậy.

Mã nguồn mở theo giấy phép Apache 2.0 cũng có nghĩa là các nhà phát triển Việt Nam có thể nghiên cứu, học hỏi và thậm chí tinh chỉnh Kolibri cho các bài toán riêng — một cơ hội quý giá để tiếp cận công nghệ AI tiên tiến mà không bị ràng buộc về mặt thương mại hay địa chính trị.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗