Samsung LPDDR5X-PIM: Điện toán trong bộ nhớ và những thách thức phần mềm tại Hot Chips 2026
Tại Hot Chips 2026, Samsung giới thiệu giải pháp Processing-in-Memory (PIM) trên chip LPDDR5X, hứa hẹn băng thông nội bộ 614 GB/s nhờ tích hợp các khối MAC ngay trong từng bank bộ nhớ. Tuy nhiên, bài toán phần mềm, khả năng tương thích với hệ điều hành đa nhiệm và cơ chế cache của CPU vẫn là những rào cản lớn khiến công nghệ này chưa thể sớm phổ biến.

Samsung LPDDR5X-PIM: Điện toán trong bộ nhớ và những thách thức phần mềm tại Hot Chips 2026
Điện toán trong bộ nhớ (In-Memory Compute) từ lâu đã là một ý tưởng hấp dẫn trong ngành bán dẫn, bởi khả năng khai thác băng thông nội bộ cao và giảm độ trễ truy cập dữ liệu so với kiến trúc truyền thống. Tại hội nghị Hot Chips 2026, Samsung đã trình bày chi tiết về nỗ lực hiện thực hóa ý tưởng này thông qua dự án PIM (Processing-in-Memory) trên nền tảng chip nhớ LPDDR5X.
Samsung đặt các khối tính toán MAC (Multiply-Accumulate) ngay bên trong chip LPDDR5X-PIM, trong khi vẫn duy trì khả năng tương thích với bộ điều khiển bộ nhớ (memory controller) tiêu chuẩn. Mặc dù hiệu năng tính toán tuyệt đối không quá cao, nhưng cách tiếp cận sáng tạo này mở ra tiềm năng lớn cho các tác vụ AI trên thiết bị di động và máy tính cá nhân.
Kiến trúc chip nhớ LPDDR5X-PIM với các khối PIM trong từng bank
Khai thác băng thông nội bộ vượt trội
Về cấu trúc, chip LPDDR5X-PIM về cơ bản giống một chip LPDDR5X-9600 thông thường với 16 bank (ngân hàng bộ nhớ), nhưng mỗi bank được gắn kèm một khối PIM riêng. Các khối PIM này có thể truy cập trực tiếp vào bank bộ nhớ liền kề mà không bị giới hạn bởi bus dữ liệu ngoài của chip. Nhờ vậy, tổng băng thông nội bộ trên cả 16 bank đạt mức 614 GB/s, một con số ấn tượng so với chỉ 76,8 GB/s khi truy cập DRAM thông thường.
So sánh với một chip LPDDR5X tiêu chuẩn, vốn chỉ có thể truy cập tối đa hai bank song song, lợi thế về băng thông của PIM là rõ ràng. Khối PIM bên trong mỗi bank bao gồm một cụm mạch MAC (MAC tree), các thanh ghi (register file) và logic điều khiển. Nó có thể xử lý các định dạng dữ liệu độ chính xác thấp như INT8, FP8 và INT4, đạt thông lượng tối đa 2,4 TOPS cho toàn bộ chip.
Cơ chế hoạt động qua lệnh DDR tiêu chuẩn
Một điểm nhấn của LPDDR5X-PIM là khả năng hoạt động trong khuôn khổ giao thức LPDDR5X tiêu chuẩn. Samsung sử dụng các hàng địa chỉ (row address) đặc biệt, hoạt động như các địa chỉ MMIO. Kích hoạt các hàng này sẽ đưa chip vào chế độ multi-bank, cho phép áp dụng lệnh điều khiển lên tất cả 16 bank cùng lúc.
Quá trình tính toán diễn ra thông qua việc nạp dữ liệu kích hoạt (activation) và trọng số mô hình (model weights) vào các thanh ghi của khối PIM. Sau đó, các lệnh đọc (read) sẽ kích hoạt tính toán và lưu kết quả vào vector register file (VRF). Cuối cùng, lệnh ghi (write) sẽ đưa kết quả từ VRF trở lại các bank DRAM.
Sơ đồ khối MAC và các thanh ghi bên trong PIM
Dù hiệu năng của một chip đơn lẻ không quá nổi bật, nhưng khi kết hợp nhiều chip, sức mạnh tổng hợp sẽ tăng đáng kể. Ví dụ, sử dụng tám chip LPDDR5X-PIM sẽ đạt khoảng 9,6 TOPS INT8, tương đương với NPU trên chip Intel Meteor Lake. Tuy nhiên, chi phí cho cấu hình này sẽ rất lớn, tương ứng với dung lượng bộ nhớ hệ thống lên tới 128 GB.
Thách thức phần mềm: Bài toán khó giải
Bất chấp tiềm năng phần cứng, những thách thức từ phía phần mềm được đánh giá là rất lớn. Do chế độ PIM thay đổi ý nghĩa của các lệnh truy cập bộ nhớ, hệ thống không thể vừa chạy PIM vừa thực hiện các truy cập bộ nhớ thông thường cùng lúc. Điều này gây khó khăn cho việc đa nhiệm, ngay cả khi sử dụng đa luồng (multithreading).
Samsung đề xuất giải pháp cô lập một vùng bộ nhớ dành riêng cho PIM. Tuy nhiên, việc này đòi hỏi phải vô hiệu hóa cơ chế xen kẽ địa chỉ (address interleaving) giữa các kênh bộ nhớ, dẫn đến lãng phí băng thông và làm giảm hiệu suất tổng thể của hệ thống. Trong môi trường hệ điều hành đa nhiệm hiện đại, việc nhiều tiến trình cùng muốn sử dụng PIM sẽ cực kỳ phức tạp, tiềm ẩn nguy cơ xung đột dữ liệu.
Vấn đề với bộ nhớ cache và thực thi ngoài thứ tự
Một thách thức lớn khác đến từ kiến trúc CPU. PIM có thể tự tạo ra các giá trị bộ nhớ mà hệ thống phân cấp cache không hề biết đến. Ngược lại, bộ nhớ cache có thể "nuốt" các lệnh truy cập nhằm kích hoạt tính toán PIM. Samsung khuyến nghị ánh xạ vùng nhớ PIM là uncacheable (không thể lưu cache), điều này sẽ làm giảm hiệu suất nghiêm trọng vì CPU phụ thuộc rất nhiều vào cache để giảm độ trễ.
Hơn nữa, các lệnh đọc PIM hoạt động như các truy cập MMIO, gây ra các tác dụng phụ làm thay đổi nội dung VRF. Điều này phá vỡ các cơ chế dự đoán rẽ nhánh (branch prediction), nạp trước (prefetching) và thực thi ngoài thứ tự (out-of-order execution) của CPU. Nếu CPU thực hiện một lệnh đọc dự đoán (speculative load) nhầm vào vùng nhớ PIM, nó có thể gây ra các phép tính không mong muốn, dẫn đến sai lệch dữ liệu nghiêm trọng.
Tác động đến hiệu năng và khả năng ứng dụng thực tế
Việc sử dụng PIM đòi hỏi phải vô hiệu hóa nhiều tính năng tối ưu của CPU, bao gồm cả cache, prefetch và thực thi ngoài thứ tự. Điều này sẽ khiến hiệu năng tổng thể của CPU bị sụt giảm đáng kể, đánh mất đi những lợi ích về băng thông mà PIM mang lại.
Ngoài ra, do các khối PIM không thể trao đổi dữ liệu trực tiếp với nhau, nếu một khối PIM cần kết quả tính toán từ khối khác, host phải sử dụng các lệnh đọc/ghi DRAM thông thường để di chuyển dữ liệu, tạo thêm chi phí và độ trễ.
So sánh băng thông và hiệu năng giữa DRAM thường và PIM
Hướng phát triển trong tương lai
Theo phân tích từ bài viết trên Chips and Cheese, để PIM thực sự hữu ích, cần có những thay đổi sâu hơn trong toàn bộ hệ thống bộ nhớ. Một số đề xuất bao gồm:
- Mở rộng giao diện DRAM để bổ sung các lệnh tính toán chuyên dụng, tránh sự phức tạp khi chuyển đổi chế độ
- Khiến bộ điều khiển bộ nhớ trở thành một "CPU peer" trong hệ thống cache coherency, giúp đồng bộ dữ liệu trước và sau khi thực hiện tính toán PIM
- Thêm các lệnh CPU mới như
rep macbđể thực hiện phép nhân tích lũy trên một khối bộ nhớ, cho phép CPU tự quyết định sử dụng PIM hay tính toán nội bộ
Những thay đổi này, dù tốn kém, sẽ giúp các nhà phát triển phần mềm sử dụng công nghệ PIM một cách trong suốt và hiệu quả trên các hệ điều hành đa nhiệm hiện đại, mở đường cho việc áp dụng rộng rãi công nghệ này trong tương lai.