Những gì chuẩn đoán Groq 3 LPU đầu tiên của Nvidia tiết lộ về vụ cược 20 tỷ USD
Nvidia lần đầu công bố hiệu năng của hệ thống LPX trang bị chip Groq 3 LPU, đạt 3.400 token/giây khi chạy mô hình Gemma 4 31B — nhanh gấp 4 lần nền tảng đối thủ. Tuy nhiên, con số này chỉ phản ánh kịch bản lý tưởng, và tương lai của kiến trúc dataflow này vẫn còn nhiều thách thức khi mở rộng lên các mô hình lớn hơn. Cỗ máy kết hợp GPU và LPU hứa hẹn mang lại hiệu năng suy luận vượt trội, đặc biệt hữu ích cho kỷ nguyên AI tác tử.

Vụ đặt cược 20 tỷ USD của Nvidia vào công nghệ LPU của Groq có vẻ đang mang lại kết quả xứng đáng. Hôm thứ Hai, gã khổng lồ GPU đã hé lộ cái nhìn đầu tiên về mức tăng tốc ấn tượng mà các rack LPX dựa trên Groq 3 sẽ mang lại.
Trong một bài kiểm tra độc lập do Artificial Analysis thực hiện, hệ thống rack LPX của Nvidia có thể xử lý 3.400 token mỗi giây (tok/s) với chuỗi đầu vào 100.000 token trên mô hình Gemma 4 31B của Google. Theo Nvidia, con số này nhanh gấp 4 lần so với nền tảng thay thế gần nhất, mà theo bảng xếp hạng của Artificial Analysis, đây được xem là lời công kích trực tiếp nhắm vào Cerebras — đơn vị chỉ đạt 882 tok/s trong cùng điều kiện.
Hệ thống LPX của Nvidia với chip Groq 3 LPU
Kiến trúc dataflow: Khác biệt cốt lõi so với GPU truyền thống
Được Nvidia mua lại vào cuối tháng 12, Groq sở hữu các LPU với kiến trúc dataflow chú trọng SRAM, được thiết kế đặc biệt để phục vụ suy luận hiệu năng cao. Khác với GPU trung tâm dữ liệu truyền thống — vốn dựa vào công nghệ bộ nhớ DRAM tốc độ cao như GDDR7 hay HBM4 — chip của Groq hoàn toàn dựa vào một nhóm SRAM trên die với tốc độ nhanh hơn nhiều lần so với cả các ngăn xếp HBM tốt nhất hiện nay (khoảng 2,75 TB/s mỗi ngăn). Khi nói đến suy luận, băng thông bộ nhớ chính là nút thắt cần phải vượt qua.
Thế hệ chip thứ ba ra mắt trong khuôn khổ nền tảng Vera Rubin của Nvidia hồi đầu năm tự hào đạt băng thông bộ nhớ 150 TB/s. Tất nhiên, điểm hạn chế là SRAM tiêu tốn rất nhiều diện tích die, đồng nghĩa bạn không thể nhồi nhét quá nhiều vào một phần có kích thước giới hạn. Trong khi GPU Rubin cao cấp nhất của Nvidia có 288 GB bộ nhớ trên bo mạch thì mỗi LPU Groq 3 chỉ có vỏn vẹn 500 MB — ít hơn gấp 576 lần.
Con số đó quá nhỏ để chạy Gemma 4 31B trên một LPU đơn lẻ, vì vậy kiến trúc của Nvidia sử dụng Ethernet để phân phối mô hình trên nhiều bộ tăng tốc. Mỗi rack LPX có thể trang bị tối đa 256 LPU, cung cấp 128 GB SRAM băng thông cao. Đối với các mô hình lớn, nhiều rack LPX có thể được kết nối với nhau.
Vì sao cần 3.400 token mỗi giây?
Vậy tại sao lại cần chạy Gemma 4 31B ở tốc độ 3.400 token/giây? Có lẽ bạn cá nhân không cần, nhưng trợ lý lập trình AI hoặc tác tử (agent) bạn đang dùng thì có thể. Tốc độ tạo token càng nhanh, mô hình càng có thể suy luận lâu hơn, tác tử có thể thực hiện nhiều lượt tương tác hơn, và xử lý hoặc hành động được nhiều thông tin hơn trong cùng một khoảng thời gian.
Điểm cược lớn ở đây là trong kỷ nguyên tác tử, máy chủ suy luận nhanh hơn tạo ra các tác tử thông minh hơn và do đó đáng giá với mức phí cao hơn. Sự kết hợp giữa GPU Nvidia và Groq 3 LPU dường như đã thu hút được sự chú ý của khách hàng Nvidia. Cùng ngày, gã khổng lồ GPU tiết lộ rằng nhà cung cấp đám mây Hà Lan Nebius sẽ là một trong những đơn vị đầu tiên triển khai hệ thống kết hợp này trong trung tâm dữ liệu của họ.
Mức độ ấn tượng thực sự của hệ thống LPX?
Dù 3.400 tok/s là con số ấn tượng trên bề mặt, Gemma 4 31B được xem là kịch bản lý tưởng nhất cho phần cứng này, và vẫn còn phải chờ xem kiến trúc này sẽ mở rộng một cách mượt mà đến đâu với các mô hình MoE (hỗn hợp chuyên gia) lớn hơn và phức tạp hơn.
Ở mức 31 tỷ tham số, mô hình này nằm gọn trong một rack LPX duy nhất bất kể Nvidia sử dụng kiểu dữ liệu nào để lưu trữ trọng số. Nvidia đang chạy mô hình ở định dạng FP8, nghĩa là cần hơn 31 GB hoặc chỉ dưới 64 LPU dung lượng SRAM.
Chúng tôi đã liên hệ với Nvidia để hỏi về cách phân phối mô hình trên các chip này, nhưng không nhận được câu trả lời rõ ràng. Dự đoán tốt nhất của chúng tôi là song song hóa pipeline (pipeline parallelism) thông thường, kết hợp với một chút song song hóa dữ liệu để cải thiện hiệu suất ở mức độ đồng thời cao hơn.
Song song hóa pipeline, nếu bạn chưa quen, sẽ phân phối mô hình trên các bộ tăng tốc rồi xử lý các thao tác giải mã trong một đường ống lớn duy nhất. Vì có đủ LPU — theo ước tính của chúng tôi, đủ để chứa bốn bản sao của mô hình — song song hóa dữ liệu sẽ nhân bản đường ống này và cung cấp thêm các vị trí độc lập cho độ đồng thời cao hơn.
Nếu bạn nghĩ 31B không phải là con số lớn, thì bạn đúng. Mô hình này đủ nhỏ để chạy trên một card đồ họa tiêu dùng cao cấp như RTX 3090/4090 — tất nhiên là ở độ chính xác 4-bit.
Dù là mô hình nhỏ, chúng ta không nên gạt bỏ kết quả thử nghiệm của Nvidia. Mô hình tương đối nhỏ, nhưng lại là mô hình dày đặc (dense), nghĩa là toàn bộ 31 tỷ tham số đều được kích hoạt mỗi khi tạo một token. Con số 31 tỷ cũng khá gần với số lượng tham số động được sử dụng bởi các mô hình MoE lớn hơn nhiều như V3 671 tỷ tham số của DeepSeek (có 37 tỷ tham số động).
Tuy nhiên, cần lưu ý rằng vì các mô hình MoE sử dụng các tham số khác nhau cho mỗi token, chúng phải gánh chịu chi phí hiệu suất mà các mô hình dày đặc không gặp phải. Một vấn đề khác đáng nói là để phục vụ mô hình như DeepSeek V3 trên hệ thống LPX sẽ cần 1.342 bộ tăng tốc, tương đương hơn 5 rack LPX. Đó là một số lượng lớn bộ tăng tốc cần quản lý.
Nâng LPX lên một tầm cao mới
Các con số hiệu suất được Nvidia chia sẻ hôm nay là cho mô hình chạy hoàn toàn trên LPU. Tuy nhiên, mức tăng hiệu suất lớn nhất của Nvidia sẽ đến từ việc kết hợp GPU với các bộ tăng tốc dataflow trong một kiến trúc suy luận không đồng nhất.
Chúng tôi đã thảo luận chi tiết về cách tiếp cận này hồi đầu năm, nhưng tóm lại, những gì Nvidia đang làm là chia tải suy luận thành hai giai đoạn riêng biệt. Giai đoạn prefill (tiền xử lý) nặng về tính toán — khi prompt được xử lý và bộ nhớ cache khóa-giá trị (KV cache) theo dõi trạng thái mô hình được tạo ra — sẽ được thực hiện trên GPU, trong khi giai đoạn giải mã (decode) tốn băng thông bộ nhớ sẽ được chuyển sang Groq 3 LPU.
Kết quả là hiệu suất suy luận tăng vọt vượt xa những gì GPU đơn lẻ có thể mang lại. Sơ đồ dưới đây tóm tắt cách GPU và LPU của Nvidia kết hợp một cách ăn ý.
Trong đồ họa này, các đường màu xanh nhạt và vàng thể hiện khả năng mở rộng của GPU và LPU. Bằng cách kết hợp cả hai, Nvidia đặt mục tiêu mang lại điều tốt nhất của cả hai thế giới — thông lượng cao và tính tương tác cao. Mật độ tính toán cao của Rubin khiến nó lý tưởng cho suy luận khối lượng lớn, nơi mục tiêu là khả năng tương tác hợp lý (tok/s mỗi người dùng) cho một số lượng lớn người dùng đồng thời, trong khi LPU phù hợp nhất cho khả năng tương tác tối đa. Kết hợp cả hai, Nvidia đã nâng đường cong Pareto lên phía trên và sang phải, tối đa hóa thông lượng mà không làm mất đi tính tương tác.
Con số 3.400 tok/s do Artificial Analysis ghi nhận phản ánh hiệu suất ở phía xa bên phải của biểu đồ, nhưng bằng cách kết hợp LPU của Groq với GPU của mình, Nvidia kỳ vọng có thể đạt được một phần hiệu suất đó trên một số lượng lớn người dùng đồng thời.
Những con số của Nvidia có thể không bền vững
Cùng với những thách thức tiềm ẩn trong việc mở rộng quy mô của LPU, cũng đáng để bàn về việc so sánh của Nvidia với chip của Cerebras. Nvidia tuyên bố hệ thống của họ nhanh gấp 4 lần so với linh kiện của Cerebras, điều này đúng. Thử nghiệm của Artificial Analysis với chuỗi đầu vào 100.000 token xác nhận điều đó. Điều bị bỏ qua trong cuộc trò chuyện đó là số chip cần thiết.
Chúng tôi không biết chi tiết cấu hình của Cerebras, nhưng không khó để suy đoán. Cerebras thường phục vụ mô hình của mình ở độ chính xác hỗn hợp 8 và 16 bit với kích hoạt 16 bit, nghĩa là toàn bộ mô hình Gemma 4 31B có thể nằm gọn trong một, tối đa là hai bộ tăng tốc CS-3 44 GB, trong khi Nvidia cần ít nhất 64 chip.
Số liệu hiệu suất của Cerebras cũng không phản ánh các bộ tăng tốc thế hệ tiếp theo mà họ đã công bố tuần trước. Bộ tăng tốc CS-4 dựa trên WSE-3T tăng gấp đôi khả năng tính toán, băng thông I/O, tốc độ fabric và băng thông bộ nhớ so với chip hiện tại, đồng thời tăng gấp ba số bộ tăng tốc trên mỗi rack. Các hệ thống mới dự kiến ra mắt trên đám mây suy luận của Cerebras vào cuối năm nay, cùng với hệ thống không đồng nhất GPU+WSE tương tự như cấu hình NVL72+LPX mà chúng ta đã thảo luận.
Thỏa thuận hợp tác, được công bố tại sự kiện Advancing AI của AMD tháng trước, sẽ chứng kiến AMD kết hợp hệ thống rack GPU Helios của mình với bộ tăng tốc WSE của Cerebras. Cerebras cũng đang hợp tác với AWS trong một cấu hình tương tự.
Do đó, so sánh hiệu suất Gemma 4 31B của Nvidia có thể sẽ không giữ được giá trị lâu dài.
Bài viết liên quan

Công nghệ
Hot Chips 2026: High Bandwidth Flash (HBF) – Giải pháp mới cho cơn khát bộ nhớ AI?
24 tháng 8, 2026
Công nghệ
Trump muốn kìm hãm năng lượng sạch, nhưng ngành này vẫn bùng nổ kỷ lục
24 tháng 8, 2026
Công nghệ
Coi chừng khi mua xác ướp online: Nguy cơ nhiễm độc và nấm mốc chết người
24 tháng 8, 2026