Cha đẻ Redis ra mắt ds4: Chạy mô hình AI khổng lồ ngay trên máy cá nhân

Phần mềm02 tháng 10, 2026·4 phút đọc

Salvatore Sanfilippo (antirez), cha đẻ của Redis, vừa giới thiệu ds4 — engine suy luận viết bằng C cho phép chạy các mô hình ngôn ngữ lớn như DeepSeek V4, GLM 5.x và Qwen3.8 ngay trên máy Mac, NVIDIA hay AMD. Dự án nổi bật với kỹ thuật lượng tử hóa bất đối xứng 2-bit và cơ chế KV cache lưu trên SSD, giúp tiết kiệm đáng kể bộ nhớ RAM.

Cha đẻ Redis ra mắt ds4: Chạy mô hình AI khổng lồ ngay trên máy cá nhân

Salvatore Sanfilippo — cái tên quen thuộc với giới lập trình viên với biệt danh antirez, cha đẻ của cơ sở dữ liệu Redis — vừa công bố một dự án mới mang tên ds4 (DwarfStar 4). Đây là một engine suy luận (inference engine) viết bằng ngôn ngữ C, cho phép chạy các mô hình ngôn ngữ lớn mã nguồn mở ngay trên máy cá nhân có bộ nhớ lớn, thay vì phải phụ thuộc vào các dịch vụ đám mây.

Dự án hỗ trợ DeepSeek V4/V4.1 Flash, GLM 5.x và Qwen3.8 Flash Next, bao gồm cả mô hình văn bản lẫn thị giác, kèm theo API cục bộ, giao diện dòng lệnh (CLI) và một tác nhân (agent) gốc — tất cả trong cùng một hệ thống. Mã nguồn được phát hành theo giấy phép MIT.

Điểm cốt lõi: nén mô hình thay vì "cắt bỏ não"

ds4 giải quyết bài toán quen thuộc của giới AI: các mô hình hàng đầu ngày càng lớn, không thể chạy nổi trên phần cứng phổ thông. Thay vì tìm cách phục vụ từ xa, dự án bắt đầu từ hướng ngược lại.

Ba trụ cột kỹ thuật chính của ds4 gồm:

  • Lượng tử hóa bất đối xứng 2-bit (Asymmetric 2-bit quantization): nén các chuyên gia định tuyến (routed experts) trong kiến trúc MoE, trong khi vẫn giữ độ chính xác cao cho các đường dẫn quan trọng. Nhờ đó, mô hình trở nên khả thi trên máy bộ nhớ lớn.
  • KV cache lưu trên ổ cứng: các tiền tố (prefix) dài được lưu vào SSD và khôi phục theo mã băm của prompt. Nghĩa là khi khởi động lại, hệ thống không cần tính toán lại toàn bộ tiền tố.
  • Một engine, ba giao diện: dùng ./ds4 để trò chuyện, ./ds4-server để mở API cục bộ tương thích OpenAI và Anthropic, và ./ds4-agent cho các phiên lập trình kéo dài.

KV cache được khóa theo mã SHA1 của tiền tố prompt và lưu xuống đĩa, nên một tiền tố trùng khớp sẽ được nạp lại thay vì tính toán từ đầu.

Cài đặt chỉ với vài lệnh

Quy trình thiết lập được thiết kế tối giản. Trước tiên, tải mã nguồn và mô hình:

$ git clone https://github.com/antirez/ds4
$ cd ds4 && ./download_model.sh ds4f-q2

Sau đó biên dịch theo backend phù hợp — make cho macOS với Metal, hoặc make cuda-spark cho Linux với DGX Spark. Cuối cùng, chỉ cần chạy ./ds4 để bắt đầu tương tác, hoặc ./ds4-server --ctx 100000 nếu muốn dựng một máy chủ API cục bộ.

Yêu cầu phần cứng và hiệu năng thực tế

ds4 hoạt động trên Apple Silicon, NVIDIA (DGX Spark/CUDA) và AMD Strix Halo (ROCm). Về bộ nhớ, cấu hình tối thiểu được khuyến nghị là 32 GB, còn mức lý tưởng nằm trong khoảng 64 GB đến 256 GB. Theo tài liệu dự án:

  • Ở mức 128 GB, các bản GLM 5.3 Q2 và Qwen Q4 đều chạy được, trong khi V4.1 Q2 sẽ truyền dữ liệu trực tiếp từ SSD.
  • Với cấu hình 512 GB, hoặc hai máy 512 GB ghép lại, người dùng có thể chạy những mô hình lớn nhất một cách thoải mái.

Về tốc độ, dự án công bố bảng benchmark trên M5 Max 128 GB với ngữ cảnh 65.536 token đạt khoảng 27,6 token/giây khi sinh văn bản, và gần 400 token/giây ở giai đoạn prefill. Trên DGX Spark, con số sinh văn bản thấp hơn, khoảng 13,8 token/giây ở ngữ cảnh dài.

Vì sao điều này đáng chú ý với người dùng Việt Nam?

Với các lập trình viên và đội ngũ phát triển tại Việt Nam, ds4 mở ra một lựa chọn hấp dẫn: sở hữu hoàn toàn quá trình suy luận AI thay vì phụ thuộc vào API nước ngoài. Điều này đặc biệt có ý nghĩa khi chi phí gọi API tích lũy theo thời gian, khi dữ liệu cần được giữ kín vì lý do bảo mật, hoặc khi đường truyền quốc tế gặp sự cố.

Tất nhiên, rào cản lớn nhất vẫn là phần cứng. Một chiếc Mac với 128 GB RAM hoặc một máy DGX Spark không phải là khoản đầu tư nhỏ. Tuy nhiên, với đà giảm giá và sự phổ biến của các dòng máy bộ nhớ lớn thời gian gần đây, bài toán kinh tế đang dần thay đổi.

Dự án cũng cho thấy một xu hướng rõ rệt trong cộng đồng mã nguồn mở: sau nhiều năm tập trung vào việc huấn luyện mô hình, trọng tâm đang dịch chuyển sang tối ưu hóa suy luận — làm sao để những mô hình khổng lồ này chạy được trên thiết bị mà người dùng thực sự sở hữu. Với ds4, antirez một lần nữa chứng minh rằng những giải pháp tinh gọn, viết bằng C ở tầng thấp, vẫn có thể tạo ra khác biệt lớn.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗