Chip Jalapeño của OpenAI: Quái vật suy luận với 128 chip, 1,7 exaFLOPS

25 tháng 8, 2026·4 phút đọc

OpenAI đã trình làng chi tiết về chip tăng tốc AI tùy chỉnh đầu tiên của mình, mang tên Jalapeño, được phát triển cùng Broadcom. Với 128 chip trong một hệ thống, đạt 1,7 exaFLOPS và 27 TB bộ nhớ HBM4, chip này hứa hẹn mang lại hiệu suất suy luận vượt trội so với các hệ thống GPU hiện tại của Nvidia, nhờ tối ưu hóa cho băng thông bộ nhớ và độ trễ thấp.

Chip Jalapeño của OpenAI: Quái vật suy luận với 128 chip, 1,7 exaFLOPS

Chip Jalapeño của OpenAI: Quái vật suy luận với 128 chip, 1,7 exaFLOPS

Tại hội nghị Hot Chips diễn ra ở Stanford, OpenAI đã có cái nhìn chi tiết nhất về chip tăng tốc AI mang tên Jalapeño, sản phẩm hợp tác với Broadcom. Với hệ thống 128 chip đạt 1,7 exaFLOPS, 27,5 TB HBM4 và băng thông bộ nhớ gần 2 PB/s, chip này hứa hẹn sẽ vượt trội hơn cả kiến trúc Blackwell và thậm chí cả Rubin của Nvidia trong các tác vụ suy luận (inference), đồng thời đánh dấu bước đi chiến lược của OpenAI trong việc tự chủ phần cứng.

Băng thông bộ nhớ là yếu tố quyết định

Khi nói đến suy luận AI, sức mạnh tính toán quan trọng nhưng băng thông bộ nhớ lại là yếu tố then chốt. Dựa trên những điểm chuẩn ban đầu mà OpenAI chia sẻ, các hệ thống dựa trên chip Jalapeño cho thấy hiệu suất "công việc AI" cao gấp 1,5 đến 1,9 lần ở mức đỉnh, và độ trễ đầu cuối thấp hơn từ 1,7 đến 3,6 lần so với các đối thủ khi chạy các mô hình như GPT-OSS-120B, DeepSeek R1 và Kimi K2.5.

"Đây không phải kiến trúc dành riêng cho một mô hình cụ thể, mà là sự cân bằng giữa hiệu suất và khả năng lập trình."

Đối với các tác vụ suy luận có độ trễ cực thấp — phân khúc đang trở nên nóng bỏng cho các nhà cung cấp hạ tầng AI — chip của OpenAI nhanh hơn từ 2,1 đến 4,1 lần.

Thiết kế theo kiến trúc rack-scale

Không gây bất ngờ, Jalapeño được thiết kế theo kiến trúc rack-scale tương tự như Nvidia NVL72 hay AMD Helios. Mỗi hệ thống gồm 128 chip, mỗi chip có khả năng đạt 13,4 petaFLOPS ở định dạng MXFP4, được hỗ trợ bởi 216 GB bộ nhớ HBM4 (giả định 6 khối xếp chồng 12 tầng) với băng thông 15,4 TB/s.

Điểm đáng chú ý là chip này được tối ưu hóa cho cả hai giai đoạn của quá trình suy luận: prefill (xử lý prompt) và decode (tạo token đầu ra). Theo Richard Ho, Phó chủ tịch phần cứng của OpenAI, chip được thiết kế để giảm thiểu việc di chuyển dữ liệu, giữ trạng thái mô hình — bao gồm cả bộ nhớ đệm KV — ngay trên chip.

So với các hệ thống GPU hiện tại của Nvidia (GB200 NVL72, GB300 NVL72), hệ thống Jalapeño có thể sử dụng năng lượng ít hơn từ 40% đến 60%, mặc dù có băng thông bộ nhớ vượt trội hơn tới 15%.

Thiết kế với AI, cho AI

Điều ít gây ngạc nhiên nhất là OpenAI đã sử dụng chính các mô hình AI của mình để hỗ trợ thiết kế, kiến trúc và tối ưu hóa chip, giúp giảm thời gian từ ý tưởng đến hoàn thiện thiết kế (tape out) xuống chỉ còn 9 tháng. Các mô hình này cũng được dùng để viết kernel tùy chỉnh và tối ưu hóa engine phục vụ suy luận.

Tuy nhiên, cần lưu ý rằng AMD và Nvidia cũng đã làm điều tương tự trong nội bộ từ lâu. AMD đã mở công khai bộ công cụ ROCm.AI tại sự kiện Advancing AI, cho thấy cuộc đua tối ưu hóa phần cứng bằng AI không chỉ riêng OpenAI.

"Mặc dù Jalapeño không nhằm thay thế hoàn toàn GPU của Nvidia hay AMD, do các GPU vẫn giữ lợi thế về khả năng lập trình cho các tác vụ đa dạng, nhưng bước đi này cho thấy OpenAI đang nghiêm túc trong việc tự chủ phần cứng."

Theo thông tin ban đầu, Jalapeño sẽ bắt đầu được triển khai với số lượng nhỏ vào cuối năm nay và đạt sản lượng lớn vào năm 2027 — thời điểm cũng là lúc Nvidia Rubin và AMD MI455X dự kiến tăng tốc sản xuất.

Mặc dù những con số này rất ấn tượng, nhưng cũng cần thận trọng khi các bài kiểm tra của OpenAI không bao gồm kỹ thuật giải mã suy đoán (speculative decoding) mà Nvidia và AMD thường sử dụng để tăng hiệu suất suy luận. Điều này tạo ra sự so sánh có phần khập khiễng, vì hiệu suất suy luận không chỉ phụ thuộc vào phần cứng mà còn vào toàn bộ nền tảng phần mềm.

Dù vậy, Jalapeño chắc chắn sẽ không phải là chip cuối cùng của OpenAI. Nếu "bong bóng AI" chưa vỡ trước khi thế hệ chip thứ hai hoàn thiện, chúng ta có thể sẽ thấy nhiều hơn những sáng tạo đột phá từ gã khổng lồ này trong tương lai.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗