Kimi K3 2.8T chạy trên MacBook Pro: 1 token mỗi giây, phát trực tiếp từ 4 ổ SSD
Dự án ARGODRIVE Deltafin vừa gây chú ý khi biến một chiếc MacBook Pro M1 Max thành nơi vận hành mô hình ngôn ngữ lớn Kimi K3 với 2.8 nghìn tỷ tham số. Đáng chú ý, toàn bộ trọng số mô hình gốc 1.7TB được lưu trên SSD và phát trực tiếp, không cần đến cụm GPU hàng triệu đô la. Mặc dù tốc độ chỉ đạt khoảng 1 token mỗi giây, nỗ lực này mở ra một hướng đi mới cho việc tự lưu trữ các mô hình AI tiên phong trên phần cứng tiêu dùng.

Chạy Kimi K3 2.8T trên MacBook Pro: Bước đột phá trong việc tự lưu trữ AI?
Việc sở hữu và chạy một mô hình ngôn ngữ lớn (LLM) hàng đầu ngay tại nhà luôn là giấc mơ của cộng đồng AI tự lưu trữ. Tuy nhiên, với những mô hình "khủng" như Kimi K3 của Moonshot AI với 2.8 nghìn tỷ tham số, giấc mơ đó dường như là bất khả thi trên phần cứng tiêu dùng. Nhưng một dự án mới có tên ARGODRIVE Deltafin vừa thách thức giới hạn đó bằng cách chạy toàn bộ mô hình này ngay trên một chiếc MacBook Pro M1 Max.
Tham vọng chạy mô hình 2.8T trên laptop
Kimi K3 là một mô hình hỗn hợp chuyên gia (MoE) với 16 "chuyên gia" (expert), đòi hỏi hạ tầng máy chủ lên tới 16 node với khoảng 4.8TB VRAM tổng cộng để vận hành theo khuyến nghị. Deltafin đã làm điều không tưởng: chạy mô hình gốc, không cắt giảm, chỉ trên một chiếc MacBook Pro.
Thành tích hiện tại của dự án là 0.2901 token/giây (tương đương khoảng 3.45 giây/token), được đo trên máy M1 Max. Con số này nghe có vẻ cực kỳ chậm, nhưng nếu nhìn vào lịch sử phát triển, đây là một bước tiến đáng kinh ngạc. Chỉ trong vài ngày, từ mức 0.0141 token/giây (ngày 27/7), họ đã tăng tốc lên hơn 2000%.
Badge mô hình Kimi K3
Badge nền tảng hỗ trợ
Bí quyết nằm ở việc phát trực tiếp từ SSD
Điểm mấu chốt của giải pháp Deltafin không nằm ở việc nén hay cắt giảm chất lượng mô hình. Họ giữ nguyên 100% trọng số BF16 gốc của Moonshot AI, tổng dung lượng lên tới 1.7TB.
Thay vào đó, họ sử dụng một kỹ thuật gọi là phát trực tiếp có chọn lọc (expert streaming). Vì Kimi K3 là mô hình MoE, không phải lúc nào tất cả 16 "chuyên gia" đều hoạt động. Deltafin đã xây dựng cơ chế dự đoán và chỉ "phát" các phần trọng số cần thiết từ bốn ổ SSD NVMe vào bộ nhớ tại một thời điểm. Điều này tương tự như một hệ thống “bộ nhớ ảo” thông minh, sử dụng ổ cứng tốc độ cao như một vùng nhớ mở rộng.
Chất lượng tuyệt đối, không "ăn gian"
Trên các diễn đàn công nghệ, nhiều người thắc mắc tại sao tốc độ lại chậm đến vậy. Một số dự án khác cũng tuyên bố chạy Kimi K3 nhanh hơn nhiều nhưng hóa ra họ đã nén trọng số xuống còn khoảng 3-bit, điều này có thể làm giảm chất lượng đầu ra so với mô hình gốc.
Deltafin lựa chọn con đường khó hơn: giữ nguyên toàn bộ độ chính xác của mô hình. Như tác giả chia sẻ, họ ưu tiên sự đúng đắn và nghiên cứu thuật toán hơn là chạy theo chỉ số hiệu năng. Dự án hoàn toàn mang tính thử nghiệm, khám phá giới hạn của phần cứng tiêu dùng.
Badge bộ tăng tốc
Badge định tuyến chuyên gia
Badge thời gian chạy
Kiến trúc phân tầng và khả năng tăng tốc
Một điểm sáng tạo khác của Deltafin là kiến trúc chạy. Mô hình "giáo viên" Kimi K3 đảm bảo chất lượng cuối cùng, nhưng nó sử dụng các mô hình "học sinh" nhỏ hơn (như DSpark hoặc Qwen) để đoán trước token tiếp theo nhằm tăng tốc. Kimi K3 đóng vai trò là bộ kiểm duyệt, xem xét từng đề xuất và luôn là bên đưa ra quyết định cuối cùng.
"Deltafin không phải một sản phẩm. Đó là một thí nghiệm để xem phần cứng tiêu dùng có thể trải dài đến đâu."
Với chi phí tối thiểu, dự án này giúp những mô hình AI "biên giới" có thể chạy trên thiết lập tại nhà trị giá khoảng 15.000 USD thay vì hạ tầng đắt đỏ 2 triệu USD. Dự án có thể cài đặt theo hai chế độ: tải toàn bộ 1.7TB xuống ổ cứng hoặc cài đặt tối thiểu 215GB ban đầu và tải dần các phần còn lại khi cần.
Dự án cung cấp giao diện dòng lệnh lẫn máy chủ tương thích API OpenAI, cho phép tích hợp với các ứng dụng hiện có. Dù tốc độ 1 token mỗi giây còn quá chậm cho các tác vụ thực tế như trả lời hội thoại thông thường, nó mở ra cơ hội cho việc nghiên cứu về bộ nhớ ngoài, lưu trữ và các tác vụ không yêu cầu thời gian phản hồi nhanh, chạy nền.
Góc nhìn cho cộng đồng và tương lai
Thành công của Deltafin mang đến hai bài học lớn cho cộng đồng AI Việt Nam và thế giới:
- Giới hạn phần cứng không còn là rào cản duy nhất, khi các thuật toán thông minh có thể khai thác tối đa băng thông SSD.
- Chất lượng mô hình là trên hết, việc "ăn gian" bằng cách nén trọng số có thể dẫn đến sai lệch khó lường. Những lợi ích từ việc tối ưu này có thể được áp dụng sang nhiều dự án khác.
Đối với những người đam mê công nghệ tại Việt Nam, việc sở hữu một cỗ máy AI "khủng" ngay trong phòng khách không còn là chuyện viễn tưởng. Dự án là một cột mốc khẳng định rằng sự sáng tạo và tinh thần mã nguồn mở có thể tạo ra điều kỳ diệu ngay cả với những thách thức công nghệ lớn nhất.

