GPT-6 Astra vượt trội trên cánh tay robot: Tỷ lệ hoàn thành 95% nhưng vẫn "bế tắc" trước thử thách lắp ghép tinh vi

Công nghệ06 tháng 9, 2026·6 phút đọc

Bài đánh giá mới so sánh GPT-6 Astra của OpenAI với hai mô hình Claude Fable 5 và Fable 5.1 của Anthropic trên cùng một hệ thống robot. Kết quả cho thấy Astra vượt trội trong nhiệm vụ đơn giản nhưng vẫn gặp khó khăn ở các thao tác lắp ráp phức tạp đòi hỏi độ chính xác cao.

GPT-6 Astra vượt trội trên cánh tay robot: Tỷ lệ hoàn thành 95% nhưng vẫn "bế tắc" trước thử thách lắp ghép tinh vi

GPT-6 Astra trình diễn khả năng điều khiển robot vượt trội, nhưng vẫn dừng bước ở thao tác tinh vi

Trong một bài đánh giá chi tiết vừa công bố, nhóm nghiên cứu đã so sánh khả năng điều khiển cánh tay robot của GPT-6 Astra (OpenAI) với hai phiên bản mô hình Claude Fable 5Fable 5.1 (Anthropic). Kết quả cho thấy Astra không chỉ nhanh hơn đáng kể mà còn đạt tỷ lệ thành công lên tới 95% trong nhiệm vụ đơn giản, cùng chi phí vận hành thấp hơn một nửa. Tuy nhiên, thử thách lắp ghép đòi hỏi sự chính xác đến từng milimet vẫn là điểm yếu của cả ba mô hình, cho thấy khoảng cách giữa trí tuệ nhân tạo và robot học (robotics) vẫn còn khá xa.

Bối cảnh so sánh: Cùng một cánh tay robot, cùng một chính sách điều khiển

Đây là nghiên cứu tiếp nối từ các bài kiểm tra trước đó nhằm đánh giá khả năng của các mô hình ngôn ngữ lớn (LLM) trong việc đóng vai trò "bộ não" điều khiển robot thao tác vật lý. Thử nghiệm sử dụng cánh tay robot bimanual I2RT YAM với 6 bậc tự do (6-DoF) trên mỗi cánh tay, cùng bộ điều khiển nắm (parallel-jaw grippers).

Cả ba mô hình đều được đặt trong cùng một điều kiện: chính sách tác tử (agent policy), mức độ suy luận trung bình, góc quan sát từ ba camera (góc trên cao, cổ tay trái và cổ tay phải). Tổng cộng 120 lần thử nghiệm được thực hiện, mỗi mô hình thực hiện 20 lần cho mỗi nhiệm vụ.

Hai nhiệm vụ, hai thử thách khác biệt

Các nhà nghiên cứu đặt ra hai bài toán với cấp độ khó hoàn toàn khác nhau:

  • "Nhặt khối màu đỏ trên mặt bàn và đặt nó vào trong bát."
  • "Nhặt mảnh ghép hình tròn màu xanh bằng tay cầm ở trung tâm và lắp nó vào rãnh tròn tương ứng trên bảng."

Nhiệm vụ đầu tiên kiểm tra khả năng nhận diện vật thể, tính toán quỹ đạo và kỹ năng thả đồ vật chính xác. Nhiệm vụ thứ hai đòi hỏi độ chính xác cực cao trong việc định vị và căn chỉnh mảnh ghép với rãnh khớp, một bài toán khó hơn nhiều đối với hệ thống robot học.

Kết quả ấn tượng: GPT-6 Astra thống trị bài toán "khối vào bát"

Kết quả trong nhiệm vụ đơn giản cho thấy một sự khác biệt vô cùng rõ rệt:

Mô hìnhTỷ lệ hoàn thànhĐiểm trung bìnhThời gian/lầnChi phí/lần
Fable 55% (1/20)1.308.2 phút$2.69
Fable 5.140% (8/20)2.406.8 phút$2.12
GPT-6 Astra95% (19/20)3.952.5 phút$0.94

GPT-6 Astra đã thể hiện sự vượt trội hoàn toàn với tỷ lệ hoàn thành cao gấp 2.4 lần so với Fable 5.1, nhanh hơn gần 3 lầnrẻ hơn 2.3 lần về chi phí trên mỗi lần thử. Con số ấn tượng này chứng tỏ mô hình của OpenAI đã tối ưu hóa đáng kể chuỗi hành động, chỉ cần trung bình 2.1k token đầu ra so với 12.9k của Fable 5.1.

Thử thách lắp ghép: Astra dừng bước ở ngưỡng cuối cùng

Tuy nhiên, nhiệm vụ lắp ghép mang lại một bức tranh hoàn toàn khác. Cả hai mô hình Astra và Fable 5.1 đều chỉ đạt tỷ lệ hoàn thành khiêm tốn:

Mô hìnhTỷ lệ hoàn thànhĐiểm trung bìnhThời gian/lầnChi phí/lần
Fable 50% (0/20)1.507.9 phút$2.63
Fable 5.110% (2/20)2.355.9 phút$2.18
GPT-6 Astra10% (2/20)2.003.4 phút$1.36

Điều đáng chú ý là Astra vẫn rẻ hơn 1.6 lần so với Fable 5.1, nhưng lại dừng lại đúng ở bước cuối cùng y hệt các đối thủ — khi đã định vị khối ghép ngay phía trên rãnh nhưng không thể thực hiện cú đặt chính xác để khớp vào.

Chi tiết chấm điểm và thang đánh giá

Mỗi lần thử nghiệm được một giám khảo là con người đánh giá theo thang điểm 6 mức (từ 0 đến 4) để ghi lại mức độ tiến triển ngay cả khi thất bại:

  • 0: Không có tiếp cận có chủ đích
  • 1: Đã tiếp xúc với vật thể
  • 2: Đã nâng vật thể rời khỏi bàn
  • 3: Đã đưa vật thể đến vị trí cần đặt
  • 4: Đã đặt vật ở vị trí cuối cùng

Nhìn vào phân bố điểm, phần lớn các lần thử của Astra trong bài toán khối vào bát đều chạm mốc 4, trong khi các phiên bản Fable phân bố rải rác ở nhiều mức khác nhau. Ở bài toán lắp ghép, bức tranh cho thấy các mô hình thường xuyên kẹt ở mức 3 — một dấu hiệu cho thấy robot vẫn thiếu phản hồi cảm giác (haptic feedback) tinh vi để hoàn tất cú khớp chính xác.

Phân tích kỹ thuật và những giới hạn của bài kiểm tra

Nhóm nghiên cứu cũng đề cập đến một số điểm hạn chế cần được xem xét khi diễn giải kết quả:

  • Không đan xen các lượt thử: Các lần thử của Astra được thực hiện sau các lượt thử của Fable hai ngày, không được trộn lẫn ngẫu nhiên để loại bỏ yếu tố môi trường thay đổi.
  • Khác rig kiểm tra: So sánh bài toán khối vào bát diễn ra trên hai rig khác nhau (rig-3 cho Fable, rig-1 cho Astra), có thể tạo ra khác biệt nhỏ về điều kiện vật lý.
  • Tiềm năng thiên vị của người chấm điểm: Vì người chấm điểm biết được mô hình nào đang được kiểm tra, kết quả có thể chịu ảnh hưởng của thành kiến vô thức.
  • Chi phí chưa bao gồm bộ nhớ đệm (prompt caching): OpenAI tự động lưu trữ bộ nhớ đệm cho khoảng 1/5 lượng input của Astra nhưng không được chiết khấu trong tính toán. Điều này có nghĩa chi phí thực tế của Astra có thể còn thấp hơn những gì được công bố.

Ý nghĩa đối với thị trường công nghệ và robot học

Kết quả trên cung cấp một góc nhìn rất thú vị về cuộc đua giữa các ông lớn AI trong lĩnh vực điều khiển robot. Trong khi OpenAI dường như đã tối ưu hóa rất tốt khả năng suy luận không gian và chuỗi hành động đơn giản, điểm yếu ở các nhiệm vụ đòi hỏi độ chính xác cao vẫn là một bài toán chung chưa có lời giải.

Đối với doanh nghiệp và nhà phát triển tại Việt Nam, đây là tín hiệu cho thấy các giải pháp tự động hóa dựa trên AI trong nhà máy, kho bãi hay dây chuyền sản xuất sẽ ngày càng tối ưu hơn về chi phí. Tuy nhiên, những thao tác tinh vi như lắp ráp linh kiện điện tử hoặc chế tạo cơ khí sẽ vẫn cần sự can thiệp của con người trong một khoảng thời gian nữa, trước khi các cải tiến về cảm biến lực và học tăng cường (reinforcement learning) được thương mại hóa rộng rãi.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗