Strata: Chạy mô hình AI 125 tỷ tham số trên PC chơi game với tốc độ 100 token/giây

Công nghệ04 tháng 10, 2026·7 phút đọc

Strata là dự án mã nguồn mở cho phép chạy mô hình Qwen3.8-Flash-Next 125 tỷ tham số ngay trên PC chơi game thông thường với card đồ họa 12GB VRAM. Công cụ này đạt tốc độ ấn tượng 100+ token/giây trên RTX 4090, mang AI mạnh mẽ đến gần hơn với người dùng cá nhân mà không cần máy chủ đắt tiền.

Strata: Chạy mô hình AI 125 tỷ tham số trên PC chơi game với tốc độ 100 token/giây

Strata: Chạy mô hình AI 125 tỷ tham số trên PC chơi game với tốc độ 100 token/giây

Trong bối cảnh các mô hình AI ngày càng phình to và đòi hỏi hạ tầng máy chủ đắt đỏ, một dự án mã nguồn mở mang tên Strata đang gây chú ý khi chứng minh rằng bạn hoàn toàn có thể chạy mô hình ngôn ngữ lớn 125 tỷ tham số ngay trên chiếc PC chơi game của mình. Không cần đến trung tâm dữ liệu, không cần thuê cloud — chỉ với một card đồ họa từ 12GB VRAM trở lên, bạn đã có thể trò chuyện, viết code và xử lý hình ảnh với một trong những mô hình thông minh nhất hiện nay.

Minh họa Strata chạy trên phần cứng tiêu dùngMinh họa Strata chạy trên phần cứng tiêu dùng

Strata là gì?

Strata là công cụ mã nguồn mở cho phép chạy mô hình Qwen3.8-Flash-Next — vốn thường cần hệ thống máy chủ với hàng trăm GB bộ nhớ đồ họa — trên PC cá nhân. Mô hình này có khả năng trò chuyện, viết code, đọc hình ảnh và tích hợp với các ứng dụng lập trình, và đặc biệt: mọi thứ đều diễn ra cục bộ trên máy bạn, không có dữ liệu nào rời khỏi PC.

Điểm đáng chú ý nhất là Strata hỗ trợ cả card NVIDIA và AMD, chạy trên Windows hoặc Linux, và hoàn toàn miễn phí theo giấy phép MIT.

Hiệu năng thực tế: Nhanh đến mức nào?

Nhóm phát triển đã đo hiệu năng trên hai cấu hình PC chơi game thông thường:

Cấu hình NVIDIA (RTX 5070 12GB, Ryzen 5 7600, 64GB RAM):

  • Q2_0: 94 token/giây khi viết, 2.650 token/giây khi đọc prompt
  • IQ2_XS: 79 token/giây
  • IQ3_XXS: 62 token/giây
  • IQ3_S: 53 token/giây
  • Coder: 55 token/giây

Cấu hình AMD (RX 9070 XT 16GB, Ryzen 9 3900X, 47GB RAM):

  • Q2_0: 60 token/giây
  • IQ2_XS: 52 token/giây
  • Coder: 44 token/giây

Một token tương đương khoảng 3/4 từ. Tốc độ 60 token/giây đã nhanh hơn tốc độ đọc của con người.

Đáng chú ý, theo tài liệu của dự án, card RTX 3090 (24GB) có thể đạt 100-140 token/giây — con số mà tiêu đề bài viết đề cập. Card càng nhiều VRAM thì tốc độ càng cao.

Cách Strata hoạt độngCách Strata hoạt động

Yêu cầu phần cứng

Để chạy Strata, bạn cần:

  • Card đồ họa: NVIDIA GeForce RTX 20/30/40/50 series, hoặc AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700, hoặc RX 6800/6900 series — tối thiểu 12GB VRAM
  • RAM: Từ 32GB trở lên (64GB chạy được mọi kích cỡ mô hình)
  • Ổ cứng: Khoảng 80GB trống, nên dùng SSD
  • Hệ điều hành: Windows 10/11 hoặc Linux với driver đồ họa mới nhất

Strata cũng hỗ trợ đa GPU — có thể chia sẻ mô hình giữa hai hoặc ba card.

Cài đặt: Đơn giản hơn bạn nghĩ

Bạn có hai cách để cài đặt:

Cách 1 — Để AI tự cài: Nếu bạn đang dùng trợ lý lập trình AI như Claude Code, Cursor, Codex hay GitHub Copilot, chỉ cần dán đoạn prompt sau vào:

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

Trợ lý sẽ tự kiểm tra card đồ họa, RAM và ổ đĩa, chọn mô hình phù hợp rồi cài đặt hoàn chỉnh.

Cách 2 — Tự cài đặt:

  1. Tải Strata và giải nén (hoặc git clone)
  2. Windows: nhấp đúp vào START-HERE.bat. Linux: chạy ./setup.sh
  3. Trả lời vài câu hỏi về mô hình và ngữ cảnh (nhấn Enter để dùng giá trị đề xuất)
  4. Chờ tải mô hình (khoảng 70GB) và khởi động

Lưu ý: Trong lần khởi động đầu tiên, PC có thể chậm hoặc không phản hồi trong 1-3 phút. Đây là hiện tượng bình thường khi Strata nạp 35-55GB vào RAM. Hãy kiên nhẫn và đừng đóng cửa sổ.

Sau khi khởi động, trình duyệt sẽ tự mở ứng dụng Strata tại http://127.0.0.1:8080.

Chọn mô hình nào phù hợp?

Mô hình Qwen3.8-Flash-Next có nhiều kích cỡ khác nhau, nén ở mức độ khác nhau — kích cỡ nhỏ hơn thì nhanh hơn, lớn hơn thì thông minh hơn:

RAM của bạnNên chọnLý do
32GBCoderVừa với 32GB, tối ưu cho code
48GBIQ2_XS hoặc Q2_0Các kích cỡ lớn hơn không vừa
64GBIQ2_XS, IQ3_XXS hoặc IQ3_SMọi kích cỡ đều vừa, IQ3_S tốt nhất
96GB+IQ3_S hoặc Unsloth UD-IQ4_XSĐủ chỗ cho kích cỡ lớn nhất

Phiên bản Coder là bản tối ưu cho lập trình, đạt 91% điểm SWE-bench Verified của mô hình gốc nhưng yếu hơn ở các tác vụ ngoài lập trình, bao gồm cả tiếng Trung và các ngôn ngữ CJK khác.

Cơ chế đoán và kiểm tra của StrataCơ chế đoán và kiểm tra của Strata

Cách Strata hoạt động: Bí quyết nằm ở đâu?

Đây là phần thú vị nhất về mặt kỹ thuật. Mô hình 125 tỷ tham số thường cần hàng trăm GB VRAM, nhưng card đồ họa của bạn chỉ có 12-24GB. Strata giải quyết bài toán này bằng cách chia sẻ công việc trên toàn bộ PC, giống như nhà bếp: những gì dùng thường xuyên để trên quầy, phần còn lại cất trong tủ.

Cụ thể:

  • Mô hình gồm 24.576 chuyên gia nhỏ, mỗi từ chỉ cần khoảng 10 chuyên gia
  • Card đồ họa giữ vài nghìn chuyên gia được dùng nhiều nhất
  • RAM chứa tất cả chúng
  • CPU xử lý phần còn lại song song
  • SSD lưu bảng tra cứu lớn

Công nghệ "đoán rồi kiểm tra" (guess and check) cũng đóng vai trò quan trọng: một trợ lý nhỏ đoán vài từ tiếp theo, mô hình lớn kiểm tra tất cả cùng lúc — cho kết quả giống hệt nhưng nhanh hơn 1,6-1,8 lần.

Các văn bản dài được đọc thành khối lớn (tới 8.192 token mỗi lần) với tốc độ trên 1.000 token/giây.

Sử dụng hàng ngày

Strata cung cấp giao diện web tại http://127.0.0.1:8080 với ba phần chính: Chat, Monitor (theo dõi mô hình và tài nguyên GPU/CPU/RAM theo thời gian thực) và About (thông tin cấu hình).

Để tích hợp với ứng dụng bên ngoài, bạn thêm provider "OpenAI-compatible" với URL cơ sở http://127.0.0.1:8080/v1. Với các ứng dụng dùng API Anthropic, dùng http://127.0.0.1:8080/v1/messages. Codex CLI và các ứng dụng dùng OpenAI Responses API thì dùng /v1/responses.

Bạn cũng có thể truy cập từ điện thoại hoặc PC khác trong mạng LAN bằng cách chạy START-HERE.bat --setup --host 0.0.0.0 --api-key. Luôn đặt API key khi mở ra mạng ngoài.

Một số lưu ý quan trọng

  • Mỗi lần một yêu cầu: Mặc định Strata xử lý tuần tự. Để xử lý song song, đặt "parallel": 2 — nhưng trên card 12GB sẽ làm chậm từng câu trả lời
  • Prompt dài: Strata đọc tin nhắn đầu tiên đầy đủ, mất khoảng 1 phút mỗi 30.000 token
  • Card AMD trên Windows hiện chưa đọc được hình ảnh; trên Linux thì đọc qua CPU

Xử lý sự cố thường gặp

PC đơ lần đầu khởi động: Đây là hiện tượng bình thường khi nạp mô hình. Nếu sau 10 phút vẫn đơ, hãy khởi động lại, đóng bớt ứng dụng hoặc chọn kích cỡ nhỏ hơn.

Tải xuống bị dừng: Chạy lại lệnh khởi động — quá trình sẽ tiếp tục từ chỗ dừng.

Chạy rất chậm, đèn ổ cứng nhấp nháy liên tục: PC không đủ RAM trống. Đóng bớt trình duyệt hoặc chọn kích cỡ nhỏ hơn (Q2_0 hoặc IQ2_XS).

Báo lỗi cổng 8080 đã được dùng: Strata đang chạy rồi — tìm cửa sổ của nó.

Điểm đáng chú ý cho người dùng Việt Nam

Với cộng đồng yêu công nghệ và lập trình viên Việt Nam, Strata mở ra cơ hội thực sự hấp dẫn: chạy AI mạnh ngay trên máy cá nhân mà không tốn chi phí API hàng tháng, không phụ thuộc vào kết nối internet và đảm bảo quyền riêng tư dữ liệu tuyệt đối. Một chiếc PC với RTX 3090 cũ (hiện có giá khá hợp lý trên thị trường đồ cũ) có thể trở thành "trạm AI" tại gia với tốc độ 100+ token/giây — đủ nhanh cho hầu hết nhu cầu lập trình và viết lách hàng ngày.

Dự án sử dụng các thành phần từ llama.cpp/ggml, mô hình gốc thuộc nhóm Qwen, được nén bởi ISTA-DASLab, UkisAI và Unsloth. Strata phát hành theo giấy phép MIT, miễn phí và mã nguồn mở.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗