Gimlet Labs gọi vốn 300 triệu USD Series B: Tối ưu suy luận AI với kiến trúc đa chip không đồng nhất

Phần cứng04 tháng 9, 2026·5 phút đọc

Gimlet Labs công bố vòng gọi vốn Series B trị giá 300 triệu USD do Andreessen Horowitz dẫn đầu, nhằm mở rộng nền tảng điện toán đám mây suy luận AI đa chip (multisilicon). Công ty tuyên bố đạt tốc độ suy luận nhanh gấp 3-10 lần cho các khối lượng công việc tiên tiến nhờ kỹ thuật phân tách không đồng nhất (heterogeneous disaggregation), giải quyết bài toán cân bằng giữa thông lượng và độ trễ.

Gimlet Labs gọi vốn 300 triệu USD Series B: Tối ưu suy luận AI với kiến trúc đa chip không đồng nhất

Gimlet Labs gọi vốn 300 triệu USD Series B: Cuộc đua tối ưu suy luận AI với kiến trúc đa chip

Gimlet Labs vừa công bố khoản đầu tư Series B trị giá 300 triệu USD, do Andreessen Horowitz dẫn đầu cùng sự tham gia của nhiều quỹ lớn và các ông lớn công nghệ như Arm, Samsung Ventures hay Tiger Global. Trọng tâm của công ty là xây dựng nền tảng điện toán đám mây suy luận (inference) AI thế hệ mới, dựa trên kiến trúc phần cứng không đồng nhất để tối ưu cả thông lượng lẫn tốc độ phản hồi.

Bài toán cấp thiết nhất của ngành AI hiện nay không còn nằm ở việc huấn luyện mô hình mà đã dịch chuyển sang khâu suy luận. Nhu cầu token tăng gấp 6 lần chỉ trong 12 tháng và dự kiến tăng thêm 20 lần vào năm 2030, trong khi nguồn điện trở thành rào cản lớn nhất. Gimlet Labs cho rằng giải pháp nằm ở việc chạy các giai đoạn khác nhau của mô hình trên những loại chip chuyên dụng khác nhau, thay vì dùng chung một hạ tầng đồng nhất như cách làm truyền thống.

Vấn đề song hành: Thông lượng cao nhưng vẫn cần độ trễ thấp

Các khối lượng công việc AI hiện đại đang đặt ra yêu cầu khắt khe chưa từng có. Các tác nhân AI (agentic workloads) thực hiện các vòng lặp suy luận nhiều bước, đòi hỏi hàng chục lệnh gọi mô hình liên tiếp. Kích thước mô hình đã tăng từ vài trăm tỷ tham số lên tới 3-10 nghìn tỷ tham số chỉ trong vài năm. Bối cảnh ngữ cảnh (context window) cũng mở rộng từ 100K token (năm 2023) lên hơn 1 triệu token hiện nay.

Các hệ thống truyền thống buộc người dùng phải đánh đổi giữa hiệu suất cao và độ tương tác thấp. Biểu đồ Pareto về mối quan hệ giữa thông lượng và khả năng tương tác đã phản ánh rõ sự đánh đổi này.

Biểu đồ thể hiện sự đánh đổi giữa thông lượng và khả năng tương tác trong suy luận AIBiểu đồ thể hiện sự đánh đổi giữa thông lượng và khả năng tương tác trong suy luận AI

Thách thức không chỉ là tối đa hóa thông lượng hay tối đa hóa tốc độ, mà là mang lại token nhanh ở mức thông lượng cao.

Gimlet Labs tuyên bố kiến trúc phân tách không đồng nhất của họ giúp đạt hiệu suất nhanh hơn 3-10 lần cho các khối lượng công việc tiên tiến trong nền tảng điện toán đám mây suy luận của mình.

Kiến trúc "multisilicon" — chạy từng giai đoạn trên đúng loại chip

Khác với cách tiếp cận thông thường là tái sử dụng hạ tầng huấn luyện cho suy luận, Gimlet Labs xây dựng đám mây đầu tiên dành riêng cho suy luận ngay từ nền tảng. Ý tưởng cốt lõi: mỗi loại chip có thế mạnh riêng về hiệu năng và hiệu quả năng lượng.

Các kiến trúc chip khác nhau vượt trội ở những tác vụ khác nhau và có sự đánh đổi riêng giữa hiệu năng và hiệu quả.

So sánh các kiến trúc chip khác nhau cho suy luận AISo sánh các kiến trúc chip khác nhau cho suy luận AI

Phần mềm của Gimlet phân tách mô hình và lập lịch từng phần trên các bộ tăng tốc tối ưu nhất, bao gồm GPU, bộ nhớ gần (near-memory compute), kiến trúc luồng dữ liệu (dataflow) và CPU. Bằng cách phá vỡ mô hình và chạy trên các loại bộ tăng tốc khác nhau, họ đạt được tốc độ nhanh hơn 5-10 lần với cùng mức tiêu thụ điện năng, hoặc cải thiện thông lượng tương đương ở cùng độ trễ.

Có nhiều cách phân tách mô hình, mỗi cách mang lại đặc điểm hiệu suất riêng:

  • Prefill/decode disaggregation: Tách giai đoạn prefill (thiên về tính toán) và decode (thiên về băng thông bộ nhớ) trên các cụm chip riêng — mang lại độ trễ thấp nhất.
  • Speculative-decode disaggregation: Tăng tốc bằng cách dùng mô hình nhỏ dự đoán trước token, sau đó xác nhận bằng mô hình lớn.
  • Attention-FFN disaggregation: Tách phần attention (dựa trên bộ nhớ) và feed-forward network (dựa trên tính toán).

Phần mềm tự động cân bằng lại khối lượng công việc dựa trên phần cứng hiện có, tránh tình trạng tài nguyên tính toán bị bỏ trống. Nếu decode đang bão hòa trên một loại chip, các phiên bản decode mới có thể khởi chạy trên phần cứng khả dụng khác.

Các sơ đồ phân tách khác nhau trong suy luận AICác sơ đồ phân tách khác nhau trong suy luận AI

Tuyển dụng và tầm nhìn tương lai

Công ty đang mở rộng đội ngũ với các vị trí nghiên cứu, kỹ sư và vận hành trên toàn bộ ngăn xếp hạ tầng AI từ hệ thống, trung tâm dữ liệu, trình biên dịch, hệ thống phân tán đến mạng và kỹ thuật hiệu năng. Gimlet hướng đến mô hình tổ chức phẳng với các nhóm nhỏ và quyền sở hữu cao.

CEO Zain Asgar chia sẻ: "Kích thước mô hình, nhu cầu token, tốc độ token, độ dài cache và kiến trúc chip đều đang phát triển nhanh chóng. Phần mềm như chúng ta biết đang thay đổi, và chúng tôi rất vui được làm việc với khách hàng về những trải nghiệm sản phẩm mới có thể mở khóa nhờ bước nhảy cơ bản về cả tổng thông lượng token lẫn tốc độ mô hình."

Với 300 triệu USD vừa gọi vốn, Gimlet Labs không chỉ đặt cược vào tương lai của suy luận AI mà còn định vị mình là người chơi chủ chốt trong cuộc đua hạ tầng AI trị giá hàng nghìn tỷ USD. Câu hỏi lớn nhất hiện nay không phải là có đủ năng lực tính toán hay không, mà là làm sao để tối ưu từng kilowatt điện năng — nơi Gimlet Labs đang hướng tới.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗