Kinh tế học của suy luận mô hình mở: GPU cũ vẫn còn 'đất sống'?

Phần cứng22 tháng 9, 2026·6 phút đọc

Một báo cáo của Ornn Data lập luận rằng các dòng GPU NVIDIA cũ như A100 không hề bị đào thải ngay khi thế hệ mới ra mắt, nhờ nhu cầu suy luận từ các mô hình trọng số mở. Chi phí tự vận hành mô hình mở trên thuê phần cứng có thể rẻ hơn đáng kể so với dùng mô hình đóng, và A100 thậm chí rẻ hơn H100 với một số mô hình thưa.

Kinh tế học của suy luận mô hình mở: GPU cũ vẫn còn 'đất sống'?

Trong ngành trí tuệ nhân tạo, người ta thường mặc định rằng mỗi thế hệ GPU mới của NVIDIA sẽ khiến thế hệ trước trở nên lỗi thời. Một báo cáo mới của Ornn Data đưa ra góc nhìn ngược lại: nhu cầu suy luận (inference) từ các mô hình trọng số mở (open-weight) có thể kéo dài đáng kể vòng đời kinh tế của những dòng GPU cũ.

Báo cáo mang tên "The Economics of Open-Weight Inference" phân tích dữ liệu giá thuê GPU, hiệu năng suy luận và chi phí vận hành, từ đó cho thấy bức tranh kinh tế của hạ tầng AI phức tạp hơn nhiều so với câu chuyện "chip mới thay chip cũ".

Mô hình mở rẻ hơn mô hình đóng?

Một trong những phát hiện đáng chú ý nhất là về chi phí sử dụng mô hình.

Theo báo cáo, khi chuẩn hóa theo chỉ số thông minh (Artificial Analysis Intelligence Index), mô hình mở rẻ nhất đủ điều kiện hoàn thành một tác vụ với chi phí chỉ bằng khoảng một phần năm so với mô hình đóng tương đương.

Tuy nhiên, kết luận này không đúng ở mọi ngưỡng điểm. Ở một số mức điểm, mô hình đóng vẫn là lựa chọn rẻ hơn, và ở đỉnh cao nhất, các mô hình đóng vẫn vượt trội so với mẫu mô hình mở được khảo sát.

Điểm khác biệt cốt lõi nằm ở quyền kiểm soát. Mô hình đóng chỉ chạy qua hạ tầng do nhà phát triển cho phép, với hạn mức thuê bao mà nhà cung cấp có thể thay đổi bất cứ lúc nào — nghĩa là bảng giá token niêm yết chính là mức giá biên cho mỗi lần dùng thêm. Trong khi đó, trọng số mở cho phép triển khai độc lập, thậm chí chọn nhà cung cấp nếu tồn tại endpoint tương thích.

Tự vận hành: khi A100 vượt mặt H100

Phần thú vị nhất của báo cáo là phân tích chi phí tự vận hành (self-hosting) trên phần cứng thuê.

Với mô hình gpt-oss-120b — một mô hình thưa (sparse) chỉ kích hoạt 5,1 tỷ tham số — chi phí tính toán thuần của A100 chỉ ở mức 0,12 đến 0,35 USD cho mỗi triệu token đầu ra khi khai thác tối đa công suất. Con số này thấp hơn cả H100.

GPUMô hình dày (Llama-2-70B)Mô hình thưa (gpt-oss-120b)
A100 SXM4~0,28 USD~0,12 USD
H100 SXM~0,26 USD~0,27 USD
H200~0,32 USD~0,35 USD
B200~0,16 USD~0,15 USD

Điều đáng lưu ý là thứ tự này đảo ngược tùy theo loại workload. Với mô hình dày, phần cứng mới vẫn có lợi thế. Nhưng với mô hình thưa, A100 lại kinh tế hơn.

Báo cáo cũng cho thấy thị trường thuê GPU phản ánh đúng giá trị sử dụng này. Giá thuê kỳ hạn 5 năm của A100 vẫn giữ được 80,2% so với giá thuê 1 tháng, trong khi con số tương ứng của dòng Hopper chỉ 43,7–59,8% và Blackwell là 53,8%. Đáng chú ý, hợp đồng 5 năm đó sẽ kết thúc khi dòng Ampere đã hơn 11 năm tuổi.

Tỷ lệ lấp đầy (occupancy) của A100 cũng tăng từ 74% lên 90% trong giai đoạn từ tháng 3 đến tháng 9 năm 2026, ngay cả khi nguồn cung niêm yết tăng 13% và chỉ số giá spot tăng 20%.

Vì sao GPU cũ vẫn có việc làm?

Câu trả lời nằm ở đặc điểm của các workload AI hiện đại.

  • Agent chạy dài hạn: có thể chờ đợi, không cần độ trễ cực thấp
  • Đánh giá theo lô (batch evaluation): xử lý khối lượng lớn, ưu tiên chi phí
  • Học tăng cường (reinforcement learning): một phần công việc linh hoạt về thời điểm và địa điểm chạy

Những workload này chịu được độ trễ và không phụ thuộc phần cứng cụ thể. Vì vậy, dòng nhu cầu nhạy cảm với giá sẽ tự động chảy về bất kỳ phần cứng nào tối ưu chi phí.

Nói cách khác, phần cứng cũ không cần thắng mọi workload để duy trì vai trò kinh tế. GPU mới có thể rẻ hơn với các tác vụ khắt khe, trong khi phần cứng cũ đảm nhận những công việc phù hợp với bộ nhớ, phần mềm và mức giá thuê của nó.

Thước đo đúng cho giá trị của phần cứng là chi phí của công việc mà nó có thể đảm nhận, cùng nhu cầu đối với công việc đó — chứ không chỉ là tuổi của con chip.

Hàm ý với thị trường và cảnh báo

Báo cáo này có hàm ý quan trọng với các dự báo đầu tư. Nhiều mô hình tài chính giả định GPU mới sẽ xóa sổ khả năng sinh lời của GPU cũ, dẫn đến khấu hao nhanh và định giá thấp tài sản cũ. Nếu Ornn Data đúng, các thế hệ NVIDIA cũ có thể duy trì vòng đời sinh lời kéo dài nhiều năm, miễn là chúng đảm nhận được những workload phù hợp với chi phí cạnh tranh.

Tuy nhiên, cần hết sức thận trọng khi đọc báo cáo này, vì chính nhóm tác giả cũng nêu rõ nhiều giới hạn:

  • Các mốc giá kỳ hạn (forward marks) là chỉ báo do nhà phân tích tạo ra, không phải báo giá có thể thực thi hay mức trung bình đã xác minh của các hợp đồng thực tế.
  • Dữ liệu occupancy chỉ ghi nhận trạng thái cho thuê của các nhà cung cấp on-demand được theo dõi, không phải toàn bộ cơ sở lắp đặt hay khối lượng token thực tế.
  • Báo cáo không chứng minh rằng nhu cầu mô hình mở chính là nguyên nhân khiến occupancy và giá thuê A100 biến động. Việc ngừng khai thác thiết bị, suy luận mô hình dày, công việc phi LLM, hay các yếu tố tài chính và khan hiếm đều là những lời giải thích thay thế.
  • Ornn Data có lợi ích thương mại trong việc diễn giải và truyền bá dữ liệu của chính mình, vì công ty vừa cấp phép dữ liệu vừa cung cấp dịch vụ thuê GPU.

Ý nghĩa với thị trường Việt Nam

Với các doanh nghiệp Việt Nam đang cân nhắc đầu tư hạ tầng AI, báo cáo này gợi ý một chiến lược thực dụng: không nhất thiết phải chạy đua với phần cứng mới nhất. Các mô hình trọng số mở như gpt-oss-120b hay Llama có thể vận hành hiệu quả trên GPU cũ với chi phí thấp hơn đáng kể.

Đối với các startup AI trong nước, việc tận dụng phần cứng thế hệ trước — hoặc thuê theo kỳ hạn dài để có giá tốt hơn — có thể là cách tối ưu chi phí hợp lý, đặc biệt với các tác vụ batch, xử lý dữ liệu lớn hay huấn luyện mô hình nhỏ không đòi hỏi độ trễ cực thấp.

Bài học lớn nhất có lẽ là: trong kỷ nguyên AI, tuổi của con chip không phải là thước đo duy nhất cho giá trị của nó. Điều quan trọng hơn là nó có thể đảm nhận được công việc gì, với chi phí bao nhiêu, và liệu người vận hành có được tự do triển khai hay không.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗