Cần bao nhiêu GPU để phục vụ 1 triệu, 1 tỷ hay 1 nghìn tỷ token?

Phần cứng06 tháng 10, 2026·5 phút đọc

Một công cụ tính toán từ Cedana giúp ước lượng số lượng GPU cần thiết để phục vụ khối lượng token lớn, ví dụ 1 nghìn tỷ token mỗi tháng với Llama 3.3 70B cần khoảng 367 GPU H100. Bài viết phân tích cách tính, các giả định và độ sai lệch cần lưu ý khi lập kế hoạch hạ tầng AI.

Cần bao nhiêu GPU để phục vụ 1 triệu, 1 tỷ hay 1 nghìn tỷ token?

Khi triển khai các mô hình ngôn ngữ lớn (LLM) trong môi trường sản xuất, một trong những câu hỏi khó nhất mà đội ngũ hạ tầng phải trả lời là: cần bao nhiêu GPU để phục vụ một khối lượng token nhất định? Cedana, một công ty chuyên về lưu trữ và di chuyển trạng thái cho ứng dụng AI, đã công bố một công cụ tính toán giúp trả lời câu hỏi này một cách có hệ thống.

Công cụ này không chỉ đưa ra một con số duy nhất, mà còn trình bày rõ các giả định, khoảng biến thiên và mức độ tin cậy của từng ước tính. Đây là cách tiếp cận đáng tham khảo cho các kỹ sư vận hành và kiến trúc sư hạ tầng AI tại Việt Nam.

Bài toán cơ bản: token và GPU

Công cụ cho phép chọn khối lượng token cần phục vụ (từ 1 triệu đến 1 triệu tỷ token), khung thời gian (một ngày, một tháng, một năm), loại mô hình, loại GPU và các giả định vận hành.

Ví dụ nổi bật: phục vụ 1 nghìn tỷ token trong một tháng (30 ngày) với mô hình Llama 3.3 70B cần khoảng 367 GPU H100. Con số này được đánh giá với độ tin cậy trung bình.

Khoảng biến thiên hợp lý là từ 211 GPU H100 (kịch bản lạc quan) đến 853 GPU H100 (kịch bản thận trọng). Đây là một khoảng rất rộng, cho thấy tầm quan trọng của việc đo lường thực tế trước khi mua sắm.

Cách tính toán từng bước

Công cụ thực hiện phép tính theo trình tự rõ ràng, mỗi bước thay đổi một đại lượng:

  • Bước 1: Bắt đầu với 1 nghìn tỷ token trong 30 ngày.
  • Bước 2: Chia cho 2.592.000 giây → trung bình 385.802 token/giây.
  • Bước 3: Nhân với 0,475 theo tỷ lệ trộn token → 183.256 token tương đương đầu ra/giây.
  • Bước 4: Chia cho 50% mức sử dụng → 366.512 token/giây công suất lắp đặt.
  • Bước 5: Chia cho 1.000 token/giây mỗi GPU H100 → 367 GPU H100.

Công thức tổng quát:

gpus = tokens ÷ seconds × [tỷ lệ đầu ra + tỷ lệ đầu vào × chi phí đầu vào] ÷ mức sử dụng ÷ token/giây mỗi GPU

Tỷ lệ trộn token quan trọng thế nào?

Một điểm ít được chú ý là token đầu vào rẻ hơn token đầu ra về thời gian GPU. Công cụ đưa ra ba kịch bản:

  • Toàn bộ là token đầu ra: đây là giới hạn trên, tốn kém nhất.
  • Chat: 3 đầu vào trên 1 đầu ra: tỷ lệ phổ biến cho chatbot.
  • RAG hoặc agent: 10 đầu vào trên 1 đầu ra: đặc trưng của các hệ thống truy xuất và tác nhân.

Với các ứng dụng RAG và agent đang bùng nổ, việc hiểu rõ tỷ lệ này giúp tiết kiệm đáng kể chi phí hạ tầng.

So sánh các loại GPU

Công cụ so sánh bốn dòng GPU phổ biến: A100, V100, H100 và B200. Với cùng bài toán 1 nghìn tỷ token/tháng trên Llama 3.3 70B:

  • H100: 367 GPU (độ tin cậy trung bình)
  • B200: 92 GPU (độ tin cậy trung bình)
  • A100: 815 GPU (độ tin cậy trung bình)
  • V100: 2.547 GPU (độ tin cậy thấp, chỉ mang tính lý thuyết)

Đáng chú ý, B200 nhanh hơn H100 từ 4 đến 21 lần với các mô hình mixture-of-experts lớn, nhờ hỗ trợ FP4 và dung lượng bộ nhớ lớn hơn. Tuy nhiên tỷ lệ này rất khác nhau tùy từng mô hình.

Với các mô hình lớn, kết quả của A100 và V100 chỉ mang tính lý thuyết vì một bản sao mô hình cần nhiều GPU hơn số lượng trong một node.

Yếu tố nào ảnh hưởng mạnh nhất?

Phân tích độ nhạy cho thấy ba yếu tố quan trọng nhất với kết quả H100:

  • Tốc độ H100 cho mô hình này: từ 244 GPU (ở 1.500 token/giây) đến 814 GPU (ở 450 token/giây).
  • Mức sử dụng trung bình: từ 229 GPU (ở 80%) đến 611 GPU (ở 30%).
  • Chi phí token đầu vào: từ 251 GPU (ở 0,1 lần đầu ra) đến 482 GPU (ở 0,5 lần đầu ra).

Yếu tố đầu tiên phản ánh độ bất định trong đo lường, hai yếu tố còn lại phụ thuộc vào lựa chọn vận hành của bạn. Đây là gợi ý thiết thực: hãy đo tốc độ mô hình trên phần cứng thực tế trước khi quyết định quy mô.

Những giới hạn cần lưu ý

Công cụ này là ước tính lập kế hoạch, không phải con số chính xác. Tác giả khuyến cáo:

  • Sai số có thể lên tới 2 lần theo mỗi hướng với các mô hình đã đo lường, và lớn hơn với các mô hình ước tính.
  • Tốc độ thay đổi theo mục tiêu độ trễ: giá trị thấp và cao đến từ các mục tiêu nghiêm ngặt và thoải mái.
  • Công cụ không tính đến prompt caching, giải mã suy đoán (speculative decoding), chi phí token suy luận, lỗi hệ thống hay nhân bản theo vùng.
  • Khoảng biến thiên được tính bằng tổng bình phương sai số trong không gian log, không phải khoảng tin cậy thống kê.

Ý nghĩa cho thị trường Việt Nam

Với các doanh nghiệp Việt Nam đang cân nhắc đầu tư hạ tầng AI, công cụ này mang lại vài bài học:

  • Đừng chỉ nhìn vào giá GPU. Chi phí vận hành phụ thuộc mạnh vào mức sử dụng thực tế và tỷ lệ trộn token.
  • Đo lường trước, mua sau. Sự khác biệt giữa các kịch bản có thể lên tới bốn lần.
  • Cân nhắc thuê đám mây. Với mức sử dụng thấp hoặc không ổn định, thuê GPU theo giờ thường kinh tế hơn sở hữu.
  • Tối ưu tỷ lệ đầu vào/đầu ra. Với ứng dụng RAG và agent, việc giảm token đầu vào không cần thiết có thể tiết kiệm đáng kể.

Công cụ của Cedana là một ví dụ tốt về cách trình bày các ước tính hạ tầng một cách minh bạch, có thể kiểm chứng và có ngữ cảnh rõ ràng. Đây là hướng tiếp cận mà các nhà hoạch định hạ tầng AI nên tham khảo.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗