Chip Jalapeño của OpenAI: Đột phá về hiệu năng suy luận AI quy mô lớn, vượt trội so với Nvidia Blackwell
OpenAI vừa công bố kết quả benchmark đầu tiên cho chip Jalapeño, được phát triển cùng Broadcom để tối ưu cho suy luận AI quy mô lớn. Kết quả cho thấy Jalapeño vượt trội về số token trên mỗi người dùng và hiệu quả năng lượng so với hệ thống Nvidia Blackwell hiện tại, đánh dấu bước tiến quan trọng trong chiến lược phần cứng của OpenAI.

Tại hội nghị Hot Chips diễn ra vào thứ Ba tuần này, OpenAI đã hé lộ chi tiết hơn về chip Jalapeño cùng với loạt kết quả benchmark đầu tiên của hệ thống. Theo đánh giá trên bộ tiêu chuẩn InferenceX của Semianalysis, Jalapeño ghi nhận cả số token trên mỗi người dùng và thông lượng trên mỗi kilowatt đều cao hơn so với các bộ xử lý suy luận tiên tiến nhất hiện có trên thị trường.
“Kết quả cho thấy một bước tiến vượt bậc rất đáng kể so với công nghệ hiện đại,” Richard Ho, Giám đốc phần cứng của OpenAI, phát biểu trong cuộc họp báo. “Jalapeño có thể phục vụ nhiều khối lượng công việc AI hơn trên mỗi đơn vị điện năng, đồng thời phản hồi nhanh hơn. Nó rất hiệu quả khi phục vụ lượng lớn khách hàng, nhưng cũng có độ trễ cực thấp.”
Đáng chú ý, con số so sánh này được đối chiếu với hệ thống Nvidia Blackwell — tuy nhiên, đến thời điểm Jalapeño được triển khai đầy đủ, đối thủ cạnh tranh có thể đã tiến xa hơn nhiều. Ông Ho ước tính Jalapeño sẽ được triển khai vào cuối năm 2026 “với số lượng rất nhỏ”, và việc mở rộng quy mô đáng kể sẽ diễn ra vào năm 2027.
Thiết kế chuyên sâu cho suy luận AI
Lần đầu tiên được công bố vào tháng 10 năm ngoái, Jalapeño được OpenAI phát triển trong sự hợp tác chặt chẽ với Broadcom, với sự hỗ trợ từ chính các mô hình AI của OpenAI trong quá trình phát triển. Công ty đặt mục tiêu biến Jalapeño thành nền tảng đa thế hệ, cho phép các sản phẩm AI, mô hình, chip và bộ nhớ phát triển đồng bộ với nhau.
Nhờ cách tiếp cận toàn diện này, OpenAI đã giải quyết được các giai đoạn cụ thể trong quá trình suy luận thường gây ra tắc nghẽn. Cụ thể, Jalapeño được thiết kế để giảm thiểu độ trễ trong các giai đoạn prefill và giao tiếp trong quá trình xử lý — vốn thường được xem là điểm nghẽn cổ chai.
“Chúng tôi thiết kế Jalapeño để giảm thiểu việc di chuyển dữ liệu và độ trễ giao tiếp,” công ty cho biết trong bài đăng blog trình bày kết quả. “Điều này có nghĩa là trạng thái mô hình, bao gồm cả bộ nhớ đệm KV được sử dụng trong khi tạo phản hồi, có thể được đặt và giữ cục bộ trong khi hệ thống kích hoạt sự kết hợp phù hợp giữa tính toán, bộ nhớ và mạng cho từng giai đoạn suy luận.”
Ý nghĩa chiến lược đối với OpenAI
Việc tự phát triển chip là một phần trong chiến lược dài hạn của OpenAI nhằm giảm sự phụ thuộc vào Nvidia và tối ưu chi phí vận hành hệ thống AI khổng lồ. Đối với thị trường Việt Nam, nơi các doanh nghiệp ngày càng quan tâm đến việc triển khai các mô hình ngôn ngữ lớn, sự xuất hiện của các giải pháp phần cứng tối ưu cho suy luận như Jalapeño có thể giúp giảm chi phí dịch vụ AI trong tương lai, mở ra cơ hội ứng dụng rộng rãi hơn cho các doanh nghiệp địa phương.
Mặc dù con đường triển khai thương mại còn dài, nhưng những kết quả ban đầu này cho thấy OpenAI đang nghiêm túc trong việc xây dựng hạ tầng phần cứng riêng, hứa hẹn định hình lại cục diện cạnh tranh trong ngành công nghiệp chip AI vốn đang bị thống trị bởi Nvidia.