OpenWAM: Khung mở cho các mô hình thế giới – hành động có thể kết hợp

Công nghệ07 tháng 10, 2026·10 phút đọc

"OpenWAM là khung mở của Stanford giúp thống nhất các mô hình thế giới – hành động vốn dùng nhiều backbone và công thức huấn luyện khác nhau. Khung này cho phép thay đổi thứ tự sinh video và hành động, đồng thời ghép các thành phần huấn luyện độc lập như bộ dự đoán video, mô hình động học nghịch đảo (IDM) và thuận (FDM). Kết quả cho thấy dữ liệu phản thực tế (counterfactual) là chìa khóa giúp tái sử dụng các thành phần động học trên robot thật."

OpenWAM: Khung mở cho các mô hình thế giới – hành động có thể kết hợp

OpenWAM: Khung mở cho các mô hình thế giới – hành động có thể kết hợp

Robot nên dự đoán điều nó sắp thấy trước khi quyết định hành động, hay sinh ra cả hai cùng lúc? Các mô hình thế giới – hành động (world–action model) cho phép cả hai lựa chọn. Nhưng việc so sánh chúng rất khó khăn khi mỗi hệ thống dùng một backbone, một bộ dữ liệu và một công thức huấn luyện riêng. OpenWAM ra đời nhằm tạo một nền tảng chung để nghiên cứu cách dự đoán và điều khiển phối hợp với nhau.

Tổng quan về OpenWAMTổng quan về OpenWAM

Một nền tảng chung cho dự đoán và điều khiển

Khung của OpenWAM hỗ trợ việc kết hợp cả bên trong một mô hình lẫn giữa các mô hình với nhau. Chúng ta có thể thay đổi thứ tự sinh video và hành động, cũng như cách các token của chúng chú ý (attention) lẫn nhau. Đồng thời, có thể ghép nối các thành phần được huấn luyện độc lập: một bộ dự đoán video đề xuất tương lai, một mô hình động học nghịch đảo biến tương lai đó thành hành động, và một mô hình động học thuận dự đoán điều gì sẽ xảy ra với một chuỗi hành động cho trước.

Điểm đáng chú ý là ở các thí nghiệm chuyển giao, ta có thể tinh chỉnh bộ dự đoán video cho từng tác vụ mới mà vẫn tái sử dụng nguyên mô hình động học nghịch đảo (IDM) mà không cần huấn luyện lại.

Kiến trúc video – hành động dùng chung

Trước khi học hành động, nhóm nghiên cứu tinh chỉnh Wan2.2-5B cho chuyển động và tương tác của robot. Họ tiền huấn luyện trên khoảng 3,34 triệu quỹ đạo và bản ghi — tương đương 14.640 giờ video nguồn — bao gồm thao tác robot thực và tổng hợp, thao tác do con người hướng dẫn và tương tác của con người. Giai đoạn này chỉ dùng video, không cần nhãn hành động hay tín hiệu cảm nhận vị trí (proprioception).

Một số nguồn dữ liệu chính trong quá trình tiền huấn luyện:

  • Open X-Embodiment: 1.300.749 quỹ đạo, 1.911 giờ
  • AgiBot World Beta: 1.003.672 quỹ đạo, 2.976 giờ
  • InternData-A1 (tổng hợp): 637.498 quỹ đạo, 7.433 giờ
  • Ego-Exo4D v2 (tương tác người): 5.035 bản ghi, 221 giờ
  • RoboCOIN: 183.157 quỹ đạo, 1.306 giờ

Cơ chế chú ý nhân quả (causal attention) cho phép sinh video theo từng khối: mỗi khối có thể dùng các quan sát hiện tại, quá khứ và các khối trước đó, nhưng không dùng các khối tương lai. Sau 14 ngày huấn luyện trên 32 GPU NVIDIA B200, checkpoint này trở thành nền tảng thị giác cho các mô hình phía sau.

Để thêm khả năng điều khiển robot, nhóm ghép chuyên gia video 5B với chuyên gia hành động 2B trong kiến trúc Mixture-of-Transformers (MoT). Mỗi chuyên gia giữ riêng lớp chuẩn hóa, phép chiếu và lớp feed-forward, nhưng cùng chú ý trên tập token kết hợp để trao đổi thông tin.

Kiến trúc MoT dùng chungKiến trúc MoT dùng chung

Các chương trình tương tác video – hành động

Cùng một kiến trúc có thể dự đoán video trước hành động, hành động trước video, hoặc cả hai cùng lúc. Mỗi chương trình tương tác quy định thứ tự sinh và cách chú ý giữa các token tương lai, trong khi backbone, cách token hóa, mục tiêu huấn luyện và công thức phía sau vẫn giữ nguyên.

  • Video-then-action (VTA): dự đoán video trước, sau đó sinh hành động dựa trên video đó.
  • Action-then-video (ATV): sinh hành động trước, rồi dự đoán video dựa trên hành động đó.
  • Joint: khử nhiễu video và hành động cùng lúc, chú ý theo cả hai chiều.
  • Decoupled: dự đoán video và hành động mà không chú ý giữa các token tương lai.

Mặt nạ chú ý của các chương trìnhMặt nạ chú ý của các chương trình

Tất cả chương trình đều dùng latent flow matching, với bốn khung video tiềm ẩn căn chỉnh theo mỗi khối hành động 16 bước, và tín hiệu proprioception được cấp theo từng khối. Ở VTA và ATV, giai đoạn thứ hai học từ quỹ đạo ghi lại khi huấn luyện, và dùng dự đoán của giai đoạn một khi suy luận.

Vượt ra ngoài chính sách: IDM và FDM theo ngữ cảnh cục bộ

Bộ dự đoán có điều kiện theo tác vụ đề xuất điều gì nên xảy ra tiếp theo. Các mô hình động học kết nối đề xuất đó với chuyển động thực tế của robot: động học nghịch đảo (IDM) biến một tương lai thị giác thành hành động, còn động học thuận (FDM) dự đoán kết quả của một chuỗi hành động.

Cả hai đều nhận giao diện ngữ cảnh cục bộ:

  • IDM ngữ cảnh cục bộ: quan sát hiện tại + proprioception + video tương lai cho trước → chuỗi hành động.
  • FDM ngữ cảnh cục bộ: quan sát hiện tại + proprioception + chuỗi hành động cho trước → video tương lai.

Không mô hình nào nhận ngôn ngữ tác vụ hay lịch sử trước khi bắt đầu. Cách này tách việc chọn tác vụ khỏi việc mô hình hóa chuyển đổi trạng thái: ta có thể tinh chỉnh bộ dự đoán video rồi kiểm tra liệu cùng một IDM có còn sinh ra hành động đúng hay không.

Học từ các kết quả thay thế

Một bản trình diễn chỉ cho thấy người trình diễn đã chọn làm gì, chứ không nói gì về những hành động khác lẽ ra sẽ gây ra điều gì. Để lấp khoảng trống đó, nhóm nghiên cứu xây dựng LIBERO-Long-CF: 32.000 đoạn phản thực tế (counterfactual) trên mười tác vụ, bằng cách khôi phục trạng thái mô phỏng và thử các chuỗi hành động thay thế, kể cả những chuỗi không thành công.

Các mô hình học từ những quan sát và hành động thu được, mà không cần truy cập trạng thái mô phỏng. Bộ dữ liệu này có lượng bản ghi điều khiển gấp 29,7 lần so với dữ liệu trình diễn gốc, nhưng vẫn dùng đúng tác vụ, tài nguyên và vật lý ban đầu.

Hiệu quả của chính sách qua các chương trình

Trên bộ LIBERO, chương trình VTA đạt trung bình 98,6% thành công trên bốn bộ kiểm thử. Mỗi chương trình được đánh giá đều vượt 95% trên LIBERO-Long. Đáng chú ý, Decoupled vẫn cạnh tranh với Joint trên LIBERO-Long (97,0% so với 96,6%) — nghĩa là khả năng điều khiển mạnh trên benchmark này không nhất thiết cần chú ý giữa token video tương lai và token hành động.

Trên robot hai tay, VTA và Joint đều đạt khoảng 92% thành công qua các tác vụ nướng bánh mì, hoàn thiện tầng cuối của khối Rubik 2×2 và phân loại cốc theo màu. Cấu hình dùng hai cánh tay Franka Research 3 với kẹp song song, hai camera cổ tay và một camera góc nhìn thứ ba.

Các tác vụ đánh giáCác tác vụ đánh giá

Vai trò của tiền huấn luyện và kiến trúc MoT

Bắt đầu từ một mô hình video đa dụng giúp ích, nhưng thích nghi nó với video robot mới tạo khác biệt lớn. Tiền huấn luyện video robot có chú ý nhân quả giúp cải thiện thành công trên LIBERO-Long 29,4 điểm với VTA và 34,4 điểm với Joint so với khởi tạo Wan2.2 gốc.

Kiến trúc cũng quan trọng: tách riêng chuyên gia cho video và hành động giúp VTA tăng 5,0 điểm và Joint tăng 3,0 điểm so với một DiT dùng chung xử lý cả hai phương thức.

Điều gì giúp IDM đóng băng chuyển giao được?

Câu hỏi trọng tâm: liệu có thể dạy bộ dự đoán video một tác vụ mới mà không cần huấn luyện lại thành phần hành động? Nhóm nghiên cứu đóng băng IDM huấn luyện trên LIBERO-Long và ghép với các bộ dự đoán video đã thích nghi cho bốn tác vụ LIBERO-90.

Kết quả rất đáng chú ý: với cùng hỗn hợp trình diễn và phản thực tế, IDM ngữ cảnh cục bộ đạt 84,0% thành công trung bình, so với 47,0% của IDM ngữ cảnh đầy đủ. Dữ liệu phản thực tế đóng vai trò then chốt — cùng một IDM ngữ cảnh cục bộ nếu chỉ huấn luyện trên trình diễn chỉ đạt 21,5%, nhưng thêm các chuyển đổi phản thực tế thì vọt lên 84,0%.

Giữ lại trình diễn trong hỗn hợp cũng giúp mô hình ghép nối duy trì kỹ năng gốc: thành công trên tác vụ nguồn đạt 94,4%, so với 90,6% khi chỉ huấn luyện bằng phản thực tế.

Dự đoán tương lai có bám theo hành động?

Với động học thuận, câu hỏi là liệu thay đổi hành động có làm thay đổi tương lai dự đoán một cách chính xác hay không. Nhóm nghiên cứu kiểm thử 2.560 tương lai phản thực tế: 16 nhánh hành động từ mỗi 160 ngữ cảnh xuất phát trên mười tác vụ LIBERO.

Giám sát bằng phản thực tế cải thiện cả độ chính xác thị giác lẫn khả năng phân biệt kết quả của hành động. Huấn luyện chỉ bằng phản thực tế giảm sai số RGB 34,5% và nâng khả năng nhận diện đúng tương lai trong số 16 lựa chọn từ 21,1% lên 71,3%.

Chính sách và động học trong một mô hình

Cho đến đây, mỗi mô hình động học được huấn luyện riêng. Nhóm cũng huấn luyện một checkpoint OpenWAM duy nhất cho cả sinh chính sách, động học nghịch đảo và động học thuận. Nó đạt 92,8% thành công LIBERO-Long so với 88,0% của UVA — một hệ thống đã phát hành hỗ trợ cùng ba mục tiêu.

Tuy nhiên, chuyên môn hóa vẫn có giá trị. Các mô hình chính sách chuyên biệt giữ được thành công tác vụ cao hơn, trong khi các mô hình động học huấn luyện riêng cho video phản thực tế và dự đoán vị trí đầu cuối chính xác hơn.

Triển vọng và tài nguyên

Một backbone video nhân quả dùng chung hỗ trợ các chính sách mạnh mẽ trên nhiều chương trình tương tác, trong khi dữ liệu phản thực tế giúp các thành phần động học huấn luyện độc lập trở nên dễ tái sử dụng hơn. Thách thức tiếp theo là mở rộng khả năng tái sử dụng này từ mô phỏng sang robot thật, và mở rộng dự đoán từ các chuyển đổi cục bộ sang lập kế hoạch dài hạn.

Với độc giả quan tâm, kho mã nguồn OpenWAM bao gồm mã huấn luyện, đánh giá và kết hợp video-thành-hành-động. Có thể bắt đầu từ hướng dẫn nhanh hoặc tải trọng số mô hình video đã tiền huấn luyện.

Đối với cộng đồng nghiên cứu và phát triển robot tại Việt Nam — vốn đang ngày càng quan tâm đến robot thao tác và học tăng cường — những khung mở như OpenWAM là cơ hội để tiếp cận phương pháp tiên tiến mà không cần hạ tầng tính toán khổng lồ ngay từ đầu, đặc biệt khi các checkpoint và mã nguồn được chia sẻ công khai.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗