Kỹ năng chơi game tồi của bạn có thể trở thành dữ liệu huấn luyện AI
Một startup Anh đang biến dữ liệu đầu vào từ tay cầm chơi game thành bộ dữ liệu huấn luyện cho các mô hình AI thế giới (world model), với tham vọng giúp AI có thể điều hướng trong thế giới thực. Nhưng liệu dữ liệu game có đủ chính xác để dạy AI các thao tác vật lý tinh tế?

Chỉ với vài thao tác xoay cần gạt, bóp cò và nhấn nút, ngay cả một người chơi nghiệp dư cũng có thể điều khiển nhân vật len lỏi qua một môi trường game 3D. Một startup người Anh đang đặt cược rằng những chuỗi hành động tưởng chừng đơn giản ấy chứa đựng một kho tàng thông tin có thể dùng để huấn luyện các mô hình trí tuệ nhân tạo mới.
Trong một số nhánh của ngành AI, niềm tin đang lớn dần rằng các mô hình ngôn ngữ lớn (LLM) cuối cùng sẽ bị giới hạn bởi việc chúng không thể tương tác với thế giới vật lý. Được huấn luyện chỉ bằng chữ, LLM có lẽ không đủ khả năng lái xe tự hành, điều khiển cánh tay robot hay thực hiện bất kỳ hành động nào đòi hỏi sự khéo léo và chính xác. Để khắc phục điểm yếu này, một loạt nhà nghiên cứu nổi tiếng như Fei-Fei Li và Yann LeCun đang tập trung vào một lớp AI khác: mô hình thế giới (world model).
Vì sao AI cần dữ liệu về hành động?
Để thông hiểu các quy luật vật lý trong thế giới thực, mô hình thế giới cần được huấn luyện trên sự kết hợp giữa dữ liệu hình ảnh và dữ liệu hành động. Trước khi có thể điều khiển cánh tay robot một cách khéo léo, mô hình có thể cần được huấn luyện bằng video quay cảnh nhà máy, kèm theo thông tin về lực cần nắm vật thể, mô-men xoắn khi thao tác, v.v. Nhưng khác với LLM vốn được huấn luyện trên biển văn bản, các phòng thí nghiệm mô hình thế giới không có nguồn dữ liệu tương tự.
"Với mô hình thế giới, bạn cần nguyên nhân và hệ quả," Xiatian Zhu, phó giáo sư chuyên ngành AI tại Đại học Surrey, cho biết. "Trên internet, chúng ta có rất ít dữ liệu kiểu này."
Worldmodeldata, một startup người Anh do LeCun cố vấn, đang nhắm giải quyết bài toán đó bằng cách đóng gói dữ liệu đầu vào từ tay cầm và các dữ liệu khác do studio game thu thập — một sản phẩm phụ tồn tại với số lượng khổng lồ — thành các bộ dữ liệu huấn luyện cho mô hình thế giới. Một số công ty như General Intuition và Niantic đã tự thu thập dữ liệu game từ nền tảng của mình để xây dựng mô hình. Nhưng Worldmodeldata định vị mình là một bên trung gian chuyên chọn lọc và tổ chức dữ liệu, giúp các phòng thí nghiệm khỏi phải đàm phán riêng lẻ với vô số studio game.
"Có hàng triệu tựa game tuyệt vời, và chúng ngày càng giống thế giới thực," Rhea Loucas, CEO của Worldmodeldata, nói với WIRED. "Tại sao không tận dụng những trải nghiệm phong phú, đa dạng từ game để dạy AI?"
Khoảng trống dữ liệu lớn nhất
Dù giả thuyết này chưa được kiểm chứng đầy đủ, giới nghiên cứu nhìn chung đang giả định rằng hiệu suất của mô hình thế giới sẽ tăng theo quy mô bộ dữ liệu huấn luyện, tương tự như LLM. Điều đó có nghĩa tình trạng thiếu dữ liệu huấn luyện phù hợp là một trong những điểm nghẽn lớn nhất đối với tiến bộ trong lĩnh vực này.
Một số phòng thí nghiệm đã thử tự tạo dữ liệu bằng cách gắn cảm biến lên người và robot trong môi trường thử nghiệm. Nhưng cách đó chỉ tạo ra lượng dữ liệu nhỏ, và không tính đến những tình huống hiếm gặp mà mô hình có thể gặp ngoài thực tế.
"Bạn có thể trả tiền để người ta thực hiện các thao tác gắp và đặt. Nhưng sự lặp lại đơn thuần không thể nắm bắt được sự hỗn loạn của thế giới mà bạn yêu cầu cỗ máy vận hành," Nicole Fraenkel, đối tác tại quỹ đầu tư Khosla Ventures — đơn vị đã đầu tư vào General Intuition — nhận định.
Worldmodeldata lập luận rằng dữ liệu thu thập từ môi trường game — biểu diễn hình ảnh của không gian 3D kết hợp với hành động của người chơi — vừa có sẵn với số lượng cần thiết, vừa đủ đa dạng để bao quát những tình huống hiếm gặp quan trọng.
"Những tình huống hiếm gặp mới là thứ thực sự cần làm đúng," Fraenkel nói. "Chi phí của sai sót với ô tô, máy bay, drone, xe nâng trong nhà máy hay robot bốn chân tự hành là rất cao."
Worldmodeldata cho biết đã cấp phép gần 1 triệu giờ dữ liệu từ các studio đứng sau nhiều tựa game nổi tiếng, dù Loucas từ chối nêu tên. Trong tương lai, startup này cũng hướng tới việc tạo kênh để từng người chơi cá nhân được trả tiền.
Loucas tin rằng dữ liệu game cuối cùng sẽ chiếm phần lớn tài liệu huấn luyện cho mô hình thế giới, sau đó được tối ưu bằng dữ liệu đặc thù cho từng môi trường hay nhiệm vụ thực tế. "Điều này hoàn toàn có thể dẫn tới khoảnh khắc GPT của mô hình thế giới — khiến chúng thực sự hữu ích," Loucas khẳng định.
Không phải ai cũng lạc quan
Tuy nhiên, không phải ai cũng chia sẻ sự lạc quan về dữ liệu game. Nvidia, công ty phát hành một dòng mô hình thế giới được tối ưu để chạy trên chip của mình, lại ưu tiên dùng một engine tùy chỉnh được thiết kế riêng để mô phỏng vật lý thực tế làm nền tảng cho AI của họ.
Ming-Yu Liu, người phụ trách phát triển mô hình thế giới tại Nvidia, cho rằng các mô hình huấn luyện trên dữ liệu game khó có thể đạt kết quả tốt với những nhiệm vụ đòi hỏi điều khiển động cơ tinh xảo, như thao tác nắm giữ vật thể cẩn thận. Lý do là vật lý trong game thường kỳ quặc, và lập trình viên hay dùng thủ thuật để tạo ảo giác chân thực — nhân vật hạ tay xuống nhặt quả táo trên bàn — mà không lập trình chi tiết: lực tác động của từng ngón tay để quả táo không tuột khỏi tay.
"Tôi sẽ thận trọng hơn khi dùng dữ liệu game cho thao tác nắm giữ," Liu nói. "Vật lý cho thao tác nắm giữ phức tạp hơn nhiều."
Theo ông, huấn luyện bằng dữ liệu game nên được dành cho các mô hình thế giới phục vụ tạo video siêu thực hoặc môi trường 3D.
Zhu từ Đại học Surrey cũng có lo ngại tương tự. "Game về bản chất là các trình mô phỏng. Chúng có một mức độ nền tảng vật lý nhất định," ông nói. "Nhưng chúng rất thô và gần đúng."
Dù vậy, cho đến khi mô hình thế giới đạt được khoảnh khắc ChatGPT của riêng mình, mọi ý tưởng để đưa chúng tới đó vẫn còn nằm trên bàn.
"Có nhiều con đường dẫn tới miền đất hứa," Fraenkel nói. "Sự thật là vẫn chưa ngã ngũ con đường nào sẽ hiệu quả nhất."
Ý nghĩa với Việt Nam
Câu chuyện này đáng chú ý với cộng đồng công nghệ Việt Nam ở hai điểm. Thứ nhất, nó mở ra một hướng đi mới cho ngành công nghiệp game trong nước — vốn đang phát triển mạnh với nhiều studio và hàng triệu người chơi — khi dữ liệu gameplay có thể trở thành một loại "nguyên liệu thô" có giá trị cho AI. Thứ hai, đây là lời nhắc rằng cuộc đua AI không chỉ xoay quanh LLM, mà còn ở các mô hình thế giới — lĩnh vực mà các trường đại học, phòng thí nghiệm và startup Việt Nam hoàn toàn có thể tham gia nghiên cứu từ sớm.
Bài viết liên quan

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Facebook bị bồi thẩm đoàn New Mexico kết luận lừa dối người dùng về quyền riêng tư
28 tháng 9, 2026