Everpure và bài toán 'đói dữ liệu' của GPU trong kỷ nguyên AI
Everpure giới thiệu nền tảng lưu trữ chuyên dụng cho AI nhằm tăng tỷ lệ sử dụng GPU và tránh lãng phí những cụm GPU đắt đỏ phải chờ dữ liệu. Giải pháp tập trung vào ba nút thắt: băng thông, bộ nhớ đệm KV cache và loại bỏ các silo dữ liệu.

Everpure và bài toán "đói dữ liệu" của GPU trong kỷ nguyên AI
Trong các hệ thống AI quy mô lớn, GPU thường xuyên rơi vào trạng thái chờ dữ liệu, gây lãng phí khổng lồ. Everpure giới thiệu nền tảng lưu trữ chuyên biệt nhằm giải quyết ba nút thắt cốt lõi: băng thông, bộ đệm KV cache và sự phân mảnh dữ liệu.
Hãy tưởng tượng bạn là một AI Agent đang vận hành bên trong hệ thống SuperPOD của Nvidia, nơi mỗi cụm máy có giá từ 20 đến hơn 40 triệu USD. Một khách hàng bảo hiểm gõ câu hỏi trên trình duyệt: "Tôi có được bảo hiểm cho thiệt hại do thời tiết theo hợp đồng hiện tại không?" Câu hỏi được chuyển cho agent, và mọi thứ phía sau phụ thuộc vào một yếu tố duy nhất: dữ liệu.
Mỗi phút GPU nhàn rỗi có thể tiêu tốn 25 USD trở lên — tương đương một USD mỗi 2,4 giây. Đây chính là lý do các doanh nghiệp đang ráo riết tìm cách tối ưu hóa lớp lưu trữ, nơi diễn ra cuộc chiến thực sự để loại bỏ các chu kỳ nhàn rỗi.
Ba nút thắt khiến GPU "đói" dữ liệu
Par Botes, Phó Chủ tịch phụ trách hạ tầng AI của Everpure, chỉ ra sự khác biệt giữa xử lý dữ liệu doanh nghiệp truyền thống và kỷ nguyên AI:
"Các đặc tính về hiệu năng, khả năng phục hồi, tính sẵn sàng và quản trị không thay đổi về bản chất, nhưng mô hình truy cập thì khác. Khi tìm kiếm thông tin, siêu dữ liệu (metadata) có thể trở nên phong phú hơn cả dữ liệu gốc, bởi nó giải thích ngữ nghĩa và cách dữ liệu vận hành khi được làm giàu."
Everpure tập trung giải quyết ba điểm nghẽn cụ thể:
- Nghẽn băng thông ở quy mô lớn: Để duy trì hàng nghìn GPU hoạt động hết công suất, nền tảng lưu trữ cần mở rộng vượt mức 4-5 TB/giây lên 10 TB/giây hoặc hơn. Các mảng lưu trữ hai bộ điều khiển truyền thống không thể đáp ứng được yêu cầu này.
- Thuế prefill của KV cache: Khi một mô hình AI đọc cùng một tài liệu nhưng trên GPU khác, quá trình tiền xử lý (prefill) phải thực hiện lại, tiêu tốn hàng trăm nghìn token. Everpure Key Value Accelerator (KVA) khắc phục bằng cách chuyển trạng thái token đã lưu trực tiếp vào flash chia sẻ qua NVIDIA GPUDirect Storage (GDS), giúp các tensor KV đã tính toán trước chảy thẳng vào bộ nhớ GPU.
- Loại bỏ các silo dữ liệu: Việc sao chép dữ liệu ở quy mô lớn đang trở nên bất khả thi. Everpure Data Stream đóng vai trò nền tảng tái sử dụng dữ liệu, tự động hóa quá trình nạp, chọn lọc, vector hóa và lập chỉ mục dữ liệu từ nhiều nguồn khác nhau.
Vì sao khoảng cách vật lý lại quan trọng
Botes nhấn mạnh rằng tốc độ dữ liệu suy giảm nghiêm trọng khi rời xa CPU hoặc GPU: nanosecond cho bộ nhớ cục bộ, microsecond cho đĩa và millisecond cho truyền tải qua mạng. Ông so sánh:
"Nếu truy cập bộ nhớ là một giây, thì truy cập đĩa là một giờ. Càng di chuyển xa, mọi thứ càng mất nhiều thời gian, và điều đó không hiệu quả với AI."
Do đó, việc đặt lưu trữ dữ liệu ngay cạnh máy chủ GPU — như cách FlashBlade//EXA được thiết kế — giúp giảm thiểu thời gian di chuyển dữ liệu. Mô hình lặp lại token và nhu cầu đặt chung compute với storage là đặc trưng của các ứng dụng AI trong phân tích tài chính, hệ thống y tế lâm sàng, kho văn bản pháp lý, phát hiện gian lận thời gian thực và tình báo an ninh mạng.
Kiến trúc phi tập trung và tầm nhìn về dữ liệu tự mô tả
Everpure theo đuổi cách tiếp cận tách rời compute, network và storage để có thể mở rộng độc lập từng thành phần. Điều này cho phép các tổ chức nâng cấp phần cứng theo từng tầng riêng biệt thông qua mô hình đăng ký Evergreen, tránh việc phải đại tu toàn bộ hạ tầng mỗi khi có kiến trúc tăng tốc mới.
Botes cũng cảnh báo về cạm bẫy của các "ốc đảo sự thật" — tình trạng mỗi phòng ban như bán hàng, kỹ thuật, tài chính, nhân sự đều có nguồn dữ liệu riêng với quy tắc quản trị khác nhau:
"Bạn không muốn có 55 ốc đảo sự thật biệt lập. Chúng ta từng đi con đường đó và nó thực sự rắc rối. AI không vận hành theo cách đó. Chúng ta phải tạo ra cách tìm dữ liệu theo tham chiếu, chứ không phải theo vị trí hay URL."
Để làm được điều này, Everpure đã mua lại 1touch nhằm xây dựng hệ thống data intelligence, giúp thăm dò, mô tả và tạo chỉ mục cho dữ liệu. Mục tiêu cuối cùng là khiến mọi tầng lưu trữ trở nên tự mô tả, bất kể nhà sản xuất là ai.
Ý nghĩa với doanh nghiệp Việt Nam
Đối với các doanh nghiệp Việt Nam đang bắt đầu triển khai AI, bài học từ Everpure mang tính thực tiễn cao. Nhiều tổ chức tập trung đầu tư vào GPU mà quên rằng nút thắt thực sự nằm ở lớp lưu trữ. Khi các dự án AI chuyển từ giai đoạn thử nghiệm sang sản xuất quy mô lớn, số lượng GPU thuần túy đang dần mất đi vai trò thước đo chính.
Chỉ số thực sự quan trọng là hiệu quả sử dụng GPU — và cuộc chiến loại bỏ các chu kỳ nhàn rỗi ngày càng diễn ra quyết liệt ở tầng lưu trữ. Với các doanh nghiệp vừa và nhỏ tại Việt Nam, việc cân nhắc kiến trúc tách rời và ưu tiên khả năng mở rộng độc lập có thể giúp tiết kiệm đáng kể chi phí vận hành trong dài hạn, đồng thời đảm bảo khả năng thích ứng nhanh với các thế hệ tăng tốc phần cứng mới.

