Chạy LLM cục bộ trên Mac: máy nào phù hợp, công cụ nào miễn phí và đâu là điều không cần thiết
Mọi chiếc Mac dùng chip Apple Silicon đều có thể chạy mô hình ngôn ngữ lớn ngay tại máy, kể cả MacBook Air M1 từ 2020. Bài viết phân tích mô hình nào phù hợp với dung lượng RAM nào, hai công cụ miễn phí phổ biến nhất là Ollama và LM Studio, cùng giới hạn thực tế và hướng ứng dụng đáng giá nhất của AI cục bộ.

Mọi chiếc Mac bán ra ngày nay đều có thể chạy mô hình ngôn ngữ ngay trên máy. Phần lớn người dùng không biết điều đó, hoặc lầm tưởng rằng phải cần tới một mô hình 70 tỷ tham số trên chiếc Mac Studio giá 5.000 USD. Không hề. Chiếc MacBook Air bạn đang dùng đã đủ điều kiện.
Bất kỳ máy Mac nào chạy chip Apple Silicon cũng chạy được LLM cục bộ. Quy tắc chung: mô hình 1–3B chạy ở đâu cũng được, 7–8B thoải mái với 8GB bộ nhớ, 14B cần 16GB, và 70B cần từ 64GB trở lên. Công cụ thì miễn phí — Ollama hoặc LM Studio — và mô hình cục bộ hữu ích nhất chưa chắc là thứ bạn ngồi trò chuyện cùng, mà là mô hình sống bên trong chính các công cụ bạn dùng hằng ngày.
Vì sao Mac đặc biệt hợp với việc này
Hai chữ: bộ nhớ hợp nhất (unified memory). Trên Apple Silicon, CPU và GPU dùng chung một vùng RAM, nên mô hình không vừa với bộ nhớ card đồ họa trên PC lại vừa thoải mái trong bộ nhớ thông thường của Mac. Cộng thêm Neural Engine và framework MLX của Apple, chiếc MacBook trở thành cỗ máy AI cục bộ dễ tiếp cận nhất mà hầu hết mọi người đã sở hữu.
Apple cũng ý thức rõ điều này. Mac mini M6 khởi điểm từ 899 USD và Apple quảng bá nó như một cỗ máy AI trước tiên với Neural Engine 16 lõi kép cùng băng thông bộ nhớ lớn. Nhưng lập luận đó đúng cả ở tầng thấp hơn: chiếc MacBook Air M1 từ 2020 vẫn chạy tốt mô hình 7–8B. Bạn không cần phần cứng mới để bắt đầu ngay hôm nay.
Mô hình nào vừa với máy nào
Các con số dưới đây là số lượng tham số; "dấu chân" bộ nhớ là mức mà phiên bản lượng tử hóa 4-bit cần. Hãy xem đây là con số gần đúng — mức lượng tử hóa thay đổi tùy mô hình và ứng dụng còn cộng thêm phần hao phí — nhưng đủ đúng để bạn tính toán:
| Kích thước mô hình | Dấu chân 4-bit (ước lượng) | Chạy thoải mái trên |
|---|---|---|
| 1–3B | ~1–2GB | Mọi Mac Apple Silicon |
| 7–8B | ~4–5GB | 8GB trở lên |
| 14B | ~9GB | 16GB trở lên |
| 30B+ | ~18–20GB | 32GB trở lên |
| 70B+ | ~40GB+ | 64GB trở lên |
Hai nguyên tắc giúp bạn tránh rắc rối. Thứ nhất, luôn chừa khoảng thở — nếu mô hình cần 5GB, đừng chạy nó trên máy 8GB đang mở Chrome và Slack; hãy đóng bớt ứng dụng hoặc hạ xuống mô hình nhỏ hơn. Thứ hai, to hơn chưa chắc đã tốt hơn cho công việc thực tế — một mô hình nhỏ được tinh chỉnh kỹ sẽ thắng mô hình lớn chung chung trong các tác vụ chuyên biệt.
Hai công cụ miễn phí phổ biến nhất
Ollama — dành cho người thích dòng lệnh. Gõ ollama run llama3.2 là bạn đã trò chuyện với mô hình cục bộ ngay trong terminal. Miễn phí, mã nguồn mở, cực đơn giản và gần như là tiêu chuẩn mặc định. Nếu bạn là lập trình viên, hãy bắt đầu từ đây.
LM Studio — bản có giao diện đồ họa. Tìm mô hình, tải về, trò chuyện, rồi trỏ các ứng dụng cục bộ vào nó như một máy chủ tương thích OpenAI. Miễn phí cho mục đích cá nhân. Nếu bạn không quen với terminal, hãy bắt đầu từ đây.
Cả hai đều chạy cùng những mô hình mở. Khác biệt nằm ở giao diện chứ không phải năng lực. Vẫn còn những lựa chọn khác — các runtime thuần MLX, hay llama.cpp trực tiếp — nhưng Ollama và LM Studio đã đủ phục vụ 95% người đọc.
Những giới hạn cần nhìn thẳng
Mô hình cục bộ không phải mô hình biên giới (frontier). Một mô hình 7–8B sẽ không sánh được với các mô hình đám mây lớn ở những bài toán suy luận khó, xử lý tài liệu dài có cấu trúc, hay các tác vụ kiểu nghiên cứu. Ai nói ngược lại thì đang bán cho bạn thứ gì đó.
Đổi lại, AI cục bộ mang đến:
- Độ trễ thấp. Không có vòng lặp qua máy chủ. Quá trình sinh văn bản bắt đầu tức thì.
- Riêng tư. Không gì rời khỏi máy. Bản nháp, mã nguồn, những suy nghĩ dang dở của bạn không bao giờ chạm tới máy chủ nào.
- Chi phí. Không tính theo lượt. Chạy cả ngày cũng được.
- Độ ổn định. Không giới hạn tốc độ, không sập dịch vụ, không bị "thay đổi gói cước".
Cách hình dung đúng nhất: mô hình biên giới cho 5% suy nghĩ khó, mô hình cục bộ cho 95% công việc gõ phím thường nhật. Đó không phải sự thỏa hiệp mà là cách phân chia lao động hợp lý.
Hướng ứng dụng mà ít ai nhắc tới
Điểm tôi muốn chỉnh lại trong câu chuyện "AI cục bộ": cửa sổ chat là thứ kém thú vị nhất bạn có thể làm với một mô hình cục bộ.
Một mô hình thỉnh thoảng bạn mở ra trò chuyện chỉ là món đồ chơi để khoe khách. Một mô hình nằm bên trong các công cụ hằng ngày mới là hạ tầng. Phiên âm cục bộ hoạt động trơn tru trong mọi cuộc họp. Tìm kiếm cục bộ trên chính các tệp của bạn. Và tự động hoàn thành câu — một mô hình nhỏ, được tinh chỉnh theo văn phong của bạn, hoàn thiện câu ngay trong mọi ứng dụng bạn gõ. Không phải một cửa sổ chat, mà là một lớp nền.
Lý do hướng này hiệu quả — và cũng là lý do nó không thể là sản phẩm đám mây — nằm ở việc tinh chỉnh. Mô hình hoàn thiện câu cho bạn phải học được vốn từ của bạn, nghĩa là phải huấn luyện trên chính các bản nháp thật, nghĩa là nó phải chạy ngay nơi lưu trữ những bản nháp đó.
Vậy nên cứ tải Ollama về tối nay và trò chuyện với một mô hình cục bộ — điều đó thực sự thú vị và giúp bạn hiểu rõ toàn bộ câu chuyện. Nhưng giá trị thực sự của AI cục bộ cho công việc hằng ngày không nằm ở chat, mà ở những mô hình bạn dần quên mất là chúng đang tồn tại.
Câu hỏi thường gặp
Mac có chạy được ChatGPT cục bộ không? Không — ChatGPT là dịch vụ đám mây đóng. Nhưng các mô hình mở như Llama, Mistral hay Gemma chạy cục bộ được trên mọi Mac Apple Silicon qua Ollama hoặc LM Studio, đủ đáp ứng nhiều nhu cầu thường ngày. Về chất lượng suy luận trong hội thoại, mô hình đám mây biên giới vẫn dẫn đầu; còn với các tác vụ gõ phím thường nhật, mô hình cục bộ hoàn toàn cạnh tranh — và riêng tư hơn.
Cần bao nhiêu RAM để chạy LLM cục bộ? Đại khái: 8GB chạy thoải mái mô hình 7–8B ở mức lượng tử hóa 4-bit, 16GB chạy 14B, và các mô hình cỡ 70B cần từ 64GB trở lên. Mô hình nhỏ 1–3B chạy trên mọi Mac Apple Silicon. Hãy chừa dung lượng cho các ứng dụng khác — một mô hình vừa khít sẽ khiến cả máy ì ạch.
Công cụ nào tốt nhất để chạy mô hình cục bộ trên Mac?
Ollama nếu bạn quen terminal (ollama run llama3.2 là chạy được ngay), LM Studio nếu bạn muốn một ứng dụng đồ họa có trình duyệt mô hình. Cả hai đều miễn phí và chạy cùng các mô hình mở — khác biệt nằm ở giao diện, không phải năng lực.
Mô hình cục bộ có tốt bằng ChatGPT không? Với suy luận khó và sinh văn bản dài, không — mô hình đám mây biên giới vẫn dẫn đầu. Nhưng về độ trễ, quyền riêng tư, chi phí và các tác vụ chuyên biệt như tự động hoàn thành câu hay phiên âm, mô hình cục bộ thắng tuyệt đối. Thiết lập thực tế cho hầu hết mọi người: một gói đăng ký đám mây cho 5% bài toán khó, mô hình cục bộ cho 95% công việc thường nhật.

