InstinctFlash: Chạy mô hình robot 5B theo thời gian thực trên Jetson Thor

Phần mềm22 tháng 9, 2026·6 phút đọc

General Instinct vừa phát hành InstinctFlash, framework phục vụ mô hình robot hiệu năng cao, đạt tốc độ nhanh hơn tới 33,78 lần trên Jetson Thor. Framework hỗ trợ 8 dòng mô hình VLA và world-action, cho phép chạy suy luận thời gian thực với độ chính xác gần như không đổi.

InstinctFlash: Chạy mô hình robot 5B theo thời gian thực trên Jetson Thor

InstinctFlash: Chạy mô hình robot 5B theo thời gian thực trên Jetson Thor

General Instinct vừa trình làng InstinctFlash, một framework phục vụ (serving framework) hiệu năng cao dành cho các mô hình robot. Trên nền tảng Jetson Thor, giải pháp này đạt tốc độ nhanh hơn từ 1,2 đến 7,9 lần chỉ nhờ tối ưu runtime, và lên tới 33,78 lần khi kết hợp với bộ lập lịch diffusion rút gọn số bước. Điểm đáng chú ý là tốc độ tăng vọt nhưng độ chính xác thực thi nhiệm vụ gần như không suy giảm.

InstinctFlash logoInstinctFlash logo

Từ nút thắt cổ chai trong triển khai robot

Câu chuyện bắt đầu từ vấn đề mà nhiều nhóm kỹ sư robotics gặp phải: các mô hình policy ngày càng mạnh, nhưng tốc độ suy luận lại quá chậm so với vòng điều khiển thực tế của robot. Dù chất lượng mô hình được cải thiện đáng kể, khả năng đáp ứng thời gian thực vẫn là rào cản lớn khi đưa từ phòng thí nghiệm ra môi trường sản xuất.

InstinctFlash ra đời để giải quyết trực tiếp bài toán đó. Người dùng chỉ cần đưa vào checkpoint đã fine-tune, framework sẽ tự động xử lý phần còn lại và cung cấp mô hình đã tăng tốc thông qua runtime Python hoặc máy chủ WebSocket tương thích với OpenPI.

Hiệu năng vượt trội trên Jetson Thor

Theo kết quả đo đạc ngày 15/9/2026, InstinctFlash cho thấy mức tăng tốc ấn tượng trên nhiều dòng mô hình khác nhau. Đáng chú ý nhất là LingBot-VA (mô hình world-action 5B) đạt tốc độ nhanh hơn 5,36 lần ở cấu hình FP8 với 25 bước thị giác và 50 bước hành động, và 4,51 lần khi rút gọn xuống 2 bước thị giác và 4 bước hành động.

Một số kết quả tiêu biểu khác:

  • pi05: nhanh hơn 7,88 lần nhờ FP8, độ trễ giảm từ 408,58 ms xuống còn 51,85 ms
  • LingBot-VLA-4B: nhanh hơn 2,82 lần
  • Cosmos3 Edge DROID: nhanh hơn 3,24 lần
  • DreamZero DROID: nhanh hơn 1,98 lần với bộ nhớ đệm động 16 bước
  • GR00T N1.7: nhanh hơn 1,19 lần ở chế độ chính xác bit-exact

Đáng chú ý, trên 50 nhiệm vụ Robotwin2.0 với 1.153 episode mỗi cấu hình, LingBot-VA dùng InstinctFlash ở cấu hình 2V/4A đạt tỷ lệ thành công 90,5%, so với 92,1% của baseline chạy 25V/50A. Mức chênh lệch chỉ khoảng 1,6 điểm phần trăm, trong khi tốc độ nhanh hơn hàng chục lần.

Sáu lớp tối ưu hóa

InstinctFlash tổ chức tối ưu hóa thành sáu lớp, mỗi lớp thay đổi một khía cạnh khác nhau của quá trình suy luận:

  1. MODEL — thay đổi những gì được tính toán: chưng cất (distillation), giảm số bước, nén checkpoint
  2. GRAPH — thay đổi thời điểm phát công việc: tách prefill, CUDA graph capture, quy hoạch bộ nhớ
  3. CACHE — thay đổi những gì được tính lại: tái sử dụng KV, cache cross-attention và cache episode
  4. ATTENTION — cách các token tương tác: FlashAttention, attention lai và attention tuyến tính
  5. KERNEL — cách viết nhân tính toán: phân phối backend và layout, hợp nhất phép toán
  6. HARDWARE — nền tảng thực thi: fp8/int8, TensorRT, thiết bị biên dạng Jetson

Với pi0.5, các phép GEMM độ chính xác hỗn hợpCUDA graph giúp tăng tốc tính toán và giảm chi phí khởi chạy. Với Cosmos, cơ chế cache tránh tính toán dư thừa qua các bước diffusion. Còn với các mô hình world-action, bước khử nhiễu diffusion phụ thuộc vào bước trước đó, thúc đẩy nhóm phát triển phương pháp chưng cất rút gọn số bước.

Hỗ trợ đa dạng nền tảng và mô hình

Hiện tại, InstinctFlash hỗ trợ 8 dòng mô hình VLA và world-action, bao gồm pi0.5, NVIDIA Cosmos Policy, LingBot-VA, LingBot-VLA, GR00T và DreamZero. Framework có thể chạy trên ba nền tảng phần cứng chính:

  • RTX 5090 — hỗ trợ từ ngày 17/9/2026, cho phép triển khai trên máy trạm với cùng Runtime API như Jetson Thor
  • RTX 4090 — hỗ trợ từ 16/9/2026, suy luận trên desktop và phục vụ WebSocket
  • Jetson Thor — nền tảng biên chủ lực cho robot

Việc cài đặt khá đơn giản. Lớp lõi Python 3.10+ có thể kiểm tra checkpoint và lập kế hoạch mà không cần PyTorch hay GPU. Quá trình suy luận sử dụng môi trường riêng biệt được ghim phiên bản cho từng dòng mô hình, giúp tránh xung đột thư viện.

Ứng dụng thực tế và định hướng

Điểm đáng chú ý là InstinctFlash đã được các đội ngũ tại Samsung, Siemens và một số startup robotics sử dụng để tăng tốc mô hình VLA, WAM và world model dựa trên diffusion. Việc mở rộng quyền truy cập cho cộng đồng đánh dấu bước chuyển từ giai đoạn thử nghiệm nội bộ sang phổ biến rộng rãi.

"Chúng tôi bắt đầu làm điều này vì liên tục gặp cùng một vấn đề khi triển khai robot policy: các mô hình ngày càng tốt hơn, nhưng suy luận thường quá chậm cho vòng điều khiển mà chúng tôi thực sự mong muốn."

Framework được phát hành theo giấy phép AGPL-3.0, phù hợp với các dự án mã nguồn mở nhưng yêu cầu chia sẻ lại mã nguồn khi triển khai dưới dạng dịch vụ mạng. Về lộ trình, nhóm phát triển đang hướng tới chưng cất rút gọn số bước cho các mô hình chưa đáp ứng ngân sách điều khiển ở biên, nâng cấp attention cho mô hình world model ngữ cảnh dài, và đo đạc mặc định phục vụ riêng cho từng thiết bị.

Ý nghĩa với cộng đồng robotics Việt Nam

Đối với các nhóm nghiên cứu và startup robotics tại Việt Nam, InstinctFlash mở ra khả năng triển khai mô hình lớn trên phần cứng biên có chi phí hợp lý hơn. Thay vì cần GPU máy chủ đắt tiền, các mô hình world-action 5B giờ đây có thể chạy thời gian thực ngay trên Jetson Thor — nền tảng vốn phù hợp cho robot tự hành, drone và các thiết bị thông minh trong nhà máy.

Việc hỗ trợ giao thức WebSocket tương thích với hệ sinh thái pi0/openpi cũng có nghĩa là các client phía robot hiện có có thể kết nối mà không cần sửa đổi, giúp giảm đáng kể chi phí tích hợp và rút ngắn thời gian đưa sản phẩm ra thị trường.

Mã nguồn và tài liệu chi tiết có sẵn tại GitHub của General Instinct, kèm theo blog kỹ thuật và hướng dẫn tái lập kết quả đo đạc.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗