Những gì benchmark Groq 3 LPU đầu tiên của Nvidia tiết lộ — và che giấu — về canh bạc 20 tỷ USD
Nvidia vừa công bố hiệu năng ấn tượng 3.400 token/giây của hệ thống LPX dùng chip Groq 3 LPU khi chạy mô hình Gemma 4 31B, nhanh gấp 4 lần đối thủ Cerebras. Tuy nhiên, con số này chỉ phản ánh kịch bản lý tưởng với mô hình nhỏ, trong khi kiến trúc SRAM hạn chế dung lượng và chưa kiểm chứng được với các mô hình MoE lớn như DeepSeek V3. Bài viết phân tích sâu những gì benchmark này thực sự chứng minh, và những rủi ro tiềm ẩn trong chiến lược kết hợp GPU và LPU của Nvidia.

Những gì benchmark Groq 3 LPU đầu tiên của Nvidia tiết lộ — và che giấu — về canh bạc 20 tỷ USD
Vụ thâu tóm Groq trị giá 20 tỷ USD của Nvidia bắt đầu cho thấy kết quả ban đầu. Trong một bài kiểm tra độc lập do Artificial Analysis thực hiện, hệ thống rack LPX dùng chip Groq 3 LPU đạt tốc độ sinh token lên tới 3.400 token/giây khi chạy mô hình Gemma 4 31B của Google — nhanh gấp 4 lần nền tảng tốt nhất hiện có, ám chỉ trực tiếp đến Cerebras (882 token/giây).
Tuy nhiên, như mọi benchmark thời điểm ra mắt, con số này cần được nhìn nhận một cách thận trọng. Liệu 3.400 token/giây có thực sự phản ánh sức mạnh của kiến trúc dataflow LPU trong môi trường sản xuất thực tế, hay chỉ là kết quả của một kịch bản lý tưởng hiếm khi xảy ra?
Kiến trúc LPU: Phép đánh cược vào băng thông bộ nhớ SRAM
Groq 3 LPU được thiết kế với kiến trúc dataflow (luồng dữ liệu) tập trung mạnh vào SRAM — loại bộ nhớ nhanh hơn nhiều lần so với HBM4 hay GDDR7 mà GPU trung tâm dữ liệu thông thường sử dụng. Trong suy luận AI, băng thông bộ nhớ chính là nút thắt cổ chai lớn nhất, và Groq 3 giải quyết triệt để điều này với 150 TB/s băng thông trên mỗi chip.
Nhưng mọi thứ đều có cái giá của nó: SRAM chiếm diện tích chết cực lớn trên chip. Trong khi GPU Rubin cao cấp nhất của Nvidia có tới 288 GB bộ nhớ trên chip, mỗi Groq 3 LPU chỉ có vỏn vẹn 500 MB — ít hơn tới 576 lần.
Điều này có nghĩa: Gemma 4 31B không thể chạy trên một LPU đơn lẻ. Hệ thống LPX phải dùng Ethernet để phân tán mô hình qua nhiều chip, mỗi rack tối đa 256 LPU (tương đương 128 GB SRAM).
Vì sao lại chọn Gemma 4 31B?
Câu hỏi đặt ra: Tại sao Nvidia lại chọn benchmark một mô hình 31B, thay vì một mô hình lớn và thực tế hơn?
Câu trả lời nằm ở hai chữ: kịch bản tối ưu. Gemma 4 31B là mô hình dense (đặc) — nghĩa là toàn bộ 31 tỷ tham số đều được kích hoạt mỗi lần sinh token. Với định dạng FP8, mô hình này cần khoảng 31 GB bộ nhớ, vừa khít một rack LPX (64 LPU). Kiến trúc pipeline parallelism cho phép chia mô hình thành các giai đoạn xử lý song song, đạt hiệu suất tối đa.
Tuy nhiên, con số 31B không hề nhỏ khi so sánh với các mô hình MoE lớn. DeepSeek V3 với 671 tỷ tham số chỉ kích hoạt 37 tỷ tham số mỗi token — khá gần với Gemma 4 31B. Điều này cho thấy Nvidia có thể đang cố gắng chứng minh hiệu năng LPU trên một khối lượng tham số tương đương.
Nhưng vẫn còn đó những nghi ngờ: Các mô hình MoE gặp phải chi phí overhead do định tuyến và tải khác nhau giữa các token. Phục vụ DeepSeek V3 trên hệ thống LPU đòi hỏi tới 1.342 chip LPU — tức hơn 5 rack LPX — một thách thức lớn về kết nối và quản lý.
Kiến trúc lai GPU + LPU: Tương lai thực sự
Điểm mấu chốt mà Nvidia muốn nhấn mạnh không nằm ở con số 3.400 token/giây đơn lẻ, mà ở kiến trúc suy luận lai (heterogeneous inference). Triết lý này chia tải suy luận thành hai pha:
- Pha prefill (xử lý prompt, tạo KV cache): giao cho GPU Rubin xử lý — phù hợp với sức mạnh tính toán dồi dào
- Pha decode (sinh token): chuyển sang Groq 3 LPU — tận dụng băng thông SRAM khổng lồ
Kết quả là một đường cong Pareto được đẩy lên và dịch sang phải: tối đa hóa throughput (thông lượng) mà không đánh đổi độ tương tác (interactivity) — hay nói cách khác, số token/giây cho từng người dùng.
Điều này lý giải vì sao Nebius, nhà cung cấp neocloud Hà Lan, lại là một trong những khách hàng đầu tiên đưa hệ thống kết hợp này vào trung tâm dữ liệu của mình.
Những con số có thể sẽ sớm lỗi thời
Điểm đáng bàn nhất trong công bố của Nvidia là sự so sánh trực tiếp với Cerebras. Nvidia tuyên bố hệ thống của mình nhanh gấp 4 lần — một con số được xác nhận bởi Artificial Analysis ở input 100.000 token. Nhưng có một điều bị bỏ qua trong cuộc so sánh này: số lượng chip cần thiết.
- Cerebras CS-3 (44 GB bộ nhớ) có thể chạy Gemma 4 31B với chỉ 1-2 chip (mixed precision)
- Hệ thống LPX của Nvidia cần tối thiểu 64 chip LPU
So sánh trên chỉ là công bằng khi tính trên tổng hệ thống, không phải trên mỗi chip.
Quan trọng hơn, các con số của Cerebras chưa phản ánh kiến trúc thế hệ mới CS-4 dựa trên chip WSE-3T vừa công bố tuần trước — với băng thông bộ nhớ, compute, I/O tăng gấp đôi, và số accelerator mỗi rack tăng gấp ba. Cerebras cũng đang phát triển kiến trúc kết hợp GPU + WSE tương tự Nvidia, hợp tác với AMD tại sự kiện Advancing AI tháng trước và với AWS.
Vì vậy, con số 3.400 token/giây của Nvidia hôm nay có thể sẽ không còn đứng vững trước thềm cuối năm 2026, khi cả Cerebras lẫn các đối thủ khác tung ra thế hệ phần cứng mới. Cuộc đua tối ưu hóa suy luận AI — nơi mà từng micro giây trễ đều có giá trị với các tác tử AI (AI agents) — mới chỉ bắt đầu.
Điểm mấu chốt: Nvidia đã chứng minh LPU có tiềm năng to lớn trong suy luận tốc độ cao, nhưng việc mở rộng lên các mô hình lớn và phức tạp hơn, cũng như cạnh tranh trực diện với các kiến trúc mới từ Cerebras, vẫn là những ẩn số lớn nhất cho canh bạc 20 tỷ USD này. ®
Hệ thống rack LPX của Nvidia với chip Groq 3 LPU


