Ba kỹ sư để AI lái xe Toyota Corolla đi mua burger: Chỉ một mô hình thành công
Ba kỹ sư AI tại startup Axiom đã giao quyền điều khiển một chiếc Toyota Corolla 2024 cho các mô hình ngôn ngữ lớn gồm GPT-6 Astra, Claude Fable 5.1 và Grok. Chỉ Astra hoàn thành được bài kiểm tra lái xe, hé lộ khả năng hiểu thế giới vật lý còn sơ khai nhưng đầy tiềm năng của AI.

Ba kỹ sư AI đã cho các mô hình ngôn ngữ lớn nhất hiện nay cầm lái một chiếc xe thật. Kết quả cho thấy AI đang bắt đầu hiểu thế giới vật lý — nhưng còn rất xa mới đủ trình độ để chạy trên đường phố.
Aditya Ramabadran, Simon Mahns và Tobias Gessler, ba kỹ sư AI tại startup Axiom, bỗng thèm burger In-N-Out vào giờ ăn trưa. Nhưng thay vì tự lái, họ ngồi trong một chiếc Toyota Corolla đời 2024 gần khu drive-thru của nhà hàng ở vùng Vịnh San Francisco, mở laptop và yêu cầu GPT-6 Astra của OpenAI nắm vô lăng.
Họ kết nối giao diện chat với một server, server này nối với vài camera gắn trên kính chắn gió và hệ thống trợ lực lái của xe. Một tài xế an toàn luôn đặt chân trên bàn phanh, đề phòng bất trắc.
Mô hình AI — vốn thường chỉ sinh văn bản, code và đôi khi cả hình ảnh — chậm rãi nhưng chắc chắn đưa xe tiến tới cửa sổ lấy đồ ăn. "Có lẽ AGI đã đến thật rồi", một kỹ sư nhận xét, nhắc tới trí tuệ nhân tạo tổng hợp, khái niệm được nhắc nhiều về những cỗ máy có thể sánh ngang trí tuệ con người.
Không phải xe tự lái theo nghĩa truyền thống
Xe tự lái vốn không còn mới lạ. Nhưng chúng thường được vận hành bởi các thuật toán được huấn luyện và thiết kế riêng cho nhiệm vụ đó. Trong trường hợp này, "tài xế" lại là một mô hình sinh văn bản, hoạt động theo kiểu "tại chỗ", không hề được ba kỹ sư huấn luyện trước.
Màn trình diễn tại quán fast-food cùng một loạt thí nghiệm khác cho thấy các mô hình AI dựa trên ngôn ngữ đang bắt đầu có hiểu biết sơ khai nhưng hữu ích về thế giới vật lý.
Dù không có sự cố đáng lo ngại nào trong chuyến đi ăn trưa, cả ba thừa nhận việc giao quyền điều khiển một khối thép nặng hai tấn đang lao đi cho một mô hình đa dụng là canh bạc rủi ro cao.
Khi khả năng hiểu vật lý tiến bộ, AI có thể vươn ra thế giới thực theo những cách ấn tượng — và có lẽ cả nguy hiểm.
AI giỏi trên máy tính nhưng lúng túng ngoài đời thực
Các mô hình thông minh nhất hiện nay cực kỳ giỏi trả lời câu hỏi phức tạp, thậm chí tự thực hiện một số tác vụ ảo. Nhưng kỹ năng của chúng thường bó hẹp trong thế giới máy tính và internet. Đưa ra đời thực, chúng nhanh chóng bối rối.
Bất chấp những tuyên bố rằng AGI đã đến, các công ty AI rõ ràng vẫn xem suy luận vật lý là biên giới chưa được chinh phục. Một số nhà nghiên cứu đã rời các ông lớn để lập startup tập trung giải bài toán này.
Andrew Dai, CEO của Elorian AI, từng là nhà nghiên cứu tại Google DeepMind. Ông cho rằng suy luận thị giác tốt hơn sẽ mở ra nhiều ứng dụng mới cho AI, như hệ thống hiểu được thực khách có hài lòng với bữa ăn trong nhà hàng hay không, hay robot có thể hoạt động trong nhà.
"Điều đó khá thiết yếu với robot. Bạn khó có thể tưởng tượng robot gia đình mà thiếu năng lực này", Dai nói.
Elorian và Scale AI, công ty cung cấp dữ liệu huấn luyện cho các phòng thí nghiệm AI lớn, mới đây đã phát triển một bộ đánh giá tên Humanity's Sixth Sense, đo khả năng hiểu cảnh vật vật lý của mô hình.
Xingang Guo, nhà khoa học nghiên cứu tại Scale AI tham gia phát triển bộ đánh giá, cho biết: "Phần lớn nghiên cứu AI thị giác xoay quanh nhận thức. Chúng tôi muốn hỏi điều gì thực sự cần thiết để một mô hình hiểu cảnh vật theo trực giác, như cách con người hiểu mà không cần suy nghĩ".
Chỉ một mô hình hoàn thành đường đua
Với Ramabadran, Mahns và Gessler, mục tiêu của dự án In-N-Out — thực hiện ngoài công việc tại Axiom — là đo xem các mô hình vận hành tốt đến đâu trong thế giới thực đầy lộn xộn.
Ý tưởng kiểm tra kỹ năng lái xe nảy ra vào một cuối tuần. Họ nhận thấy các mô hình như Astra có thể dựng những mô phỏng 3D phức tạp, và tự hỏi liệu năng lực đó có chuyển hóa thành khả năng điều hướng thực tế hay không.
"Chúng tôi đều sống ở vùng Vịnh, thường xuyên thấy Tesla và Waymo, có lẽ điều đó cũng góp phần", Ramabadran nói.
Các kỹ sư thử nghiệm Grok của SpaceXAI trước khi thử các mô hình mới nhất từ OpenAI và Anthropic. Ban đầu, các mô hình từ chối nắm quyền điều khiển, đáp trả kiểu: "Tôi có thể giúp diễn giải hình ảnh đường sá, nhưng không thể phát lệnh chuyển động cho một chiếc xe thật". Nhưng với vài câu lệnh khéo léo, chúng bị dụ dỗ đi xa hơn. Cả ba sững sờ khi các mô hình bắt đầu lái.
Họ cho rằng các công ty AI lớn dường như đang tập trung cải thiện năng lực suy luận không gian cho mô hình mới, nhưng nghi ngờ điều đó không có nghĩa họ huấn luyện AI lái xe. Tài năng cầm lái của mô hình có thể là sản phẩm phụ của quá trình huấn luyện suy luận 3D.
"Đây có thể là năng lực trồi lên khi mở rộng đa phương thức của mô hình", Mahns nói, nhắc tới các đầu vào như hình ảnh, video và mô hình 3D đang được dùng để huấn luyện.
Tuy nhiên, bộ đánh giá lái xe mới của nhóm, gọi là DrivingBench, cho thấy các mô hình còn chặng đường dài trước khi vượt qua kỳ thi sát hạch. Bài kiểm tra đo khả năng lái quanh một đường đua đơn giản dựng trong bãi đỗ xe:
- Astra: hoàn thành đường đua, nhưng với tốc độ rất chậm
- Claude Fable 5.1: đi được 45% quãng đường
- Grok: chỉ đi được 11% quãng đường
Ramabadran cho biết các mô hình mới nhất tỏ ra có khả năng điều chỉnh khi mắc lỗi. Chúng dường như thích nghi với hệ thống điều khiển của xe và cải thiện kỹ năng lái theo thời gian thực.
"Các mô hình thực sự có vẻ đang điều chỉnh hoặc học trong ngữ cảnh dựa trên sai lầm của mình, và học cách điều hướng hệ thống điều khiển tốt hơn", ông nói.
Ý nghĩa với người dùng Việt Nam
Câu chuyện này đáng chú ý với độc giả Việt Nam ở nhiều điểm. Thứ nhất, nó cho thấy các mô hình AI đa dụng đang dần có khả năng hiểu thế giới vật lý — nền tảng cho robot, xe tự lái và các hệ thống tự động trong nhà máy, vốn là những lĩnh vực Việt Nam đang đẩy mạnh chuyển đổi số.
Thứ hai, đây là lời nhắc rằng AGI vẫn chưa đến, dù các tuyên bố marketing có thể gây hiểu lầm. Một mô hình có thể trả lời câu hỏi hóc búa chưa chắc đã điều khiển nổi chiếc xe trong bãi đỗ xe.
Cuối cùng, các bộ đánh giá như DrivingBench và Humanity's Sixth Sense cho thấy cộng đồng nghiên cứu đang nỗ lực đo lường năng lực AI một cách thực chất hơn, thay vì chỉ dựa vào cảm nhận. Với các kỹ sư và nhà phát triển Việt Nam theo dõi làn sóng AI, đây là tín hiệu đáng để quan tâm.
Bài viết liên quan

Công nghệ
Mô hình AI hàng đầu giỏi Vật lý đến đâu? Nghiên cứu mới chỉ ra các bài kiểm tra hiện hành đang đánh giá sai
16 tháng 9, 2026

Công nghệ
Nộp đơn xin việc lẽ ra nên khó hơn. Thật đấy
25 tháng 8, 2026

Công nghệ
Endeavor Catalyst gọi vốn 320 triệu USD để đầu tư cho các founder ngoài Thung lũng Silicon
07 tháng 10, 2026