Atlas: Mô hình thế giới đa phương thức cho trí tuệ không gian
World Labs vừa giới thiệu Atlas, một mô hình thế giới (world model) đa phương thức thế hệ mới, được huấn luyện từ đầu để xử lý đồng thời văn bản, hình ảnh, video và dữ liệu 3D. Atlas nổi bật với khả năng kiểm soát camera chính xác từng pixel, tái tạo không gian 3D từ ảnh thưa và mô phỏng chuyển động robot, mở ra tiềm năng lớn cho sáng tạo nội dung, robotics, gaming và thiết kế.

Atlas: Mô hình thế giới cho trí tuệ không gian, bước đột phá của World Labs
World Labs, công ty do nhà tiên phong AI Fei-Fei Li sáng lập, vừa chính thức giới thiệu Atlas — một mô hình thế giới (world model) thế hệ mới được thiết kế để hiểu và mô phỏng thế giới thực trong không gian ba chiều. Atlas không chỉ là một mô hình AI thông thường mà là một "omni model" có khả năng xử lý đồng thời văn bản, hình ảnh, video và dữ liệu 3D, hứa hẹn tạo ra bước ngoặt trong lĩnh vực trí tuệ không gian (spatial intelligence).
Điểm mấu chốt của Atlas nằm ở kiến trúc multimodal autoregressive diffusion transformer — một thiết kế kết hợp sức mạnh của các mô hình ngôn ngữ lớn (LLM) và mô hình khuếch tán video hiện đại. Thay vì chỉ dựa trên văn bản mô tả, Atlas cho phép người dùng điều khiển camera một cách chính xác từng pixel, tái tạo không gian 3D từ một vài bức ảnh và mô phỏng chuyển động của robot trong môi trường ảo.
Kiểm soát camera chính xác và tạo video dài
Điểm mạnh đầu tiên của Atlas là khả năng tạo hình ảnh và video với kiểm soát camera hoàn hảo. Người dùng có thể cung cấp một hoặc nhiều ảnh tham chiếu, sau đó chỉ định bất kỳ góc máy và vị trí camera nào để Atlas tạo ra các khung hình mới hoàn toàn nhất quán về mặt hình học với ảnh gốc.
Atlas sử dụng hình học camera chính xác như một loại đầu vào bản địa, vượt xa các phương pháp mô tả camera bằng văn bản thô sơ trước đây. Điều này cho phép người dùng tạo ra các video dài tới 1 phút ở độ phân giải 1440p với mọi cảnh quay và góc máy được thiết kế thủ công. Bạn có thể dựng một cảnh phim như một đạo diễn thực thụ, thay vì "quay xổ số" với các mô hình tạo video hiện tại.
Thú vị hơn, Atlas có khả năng "tưởng tượng" ra những phần không nhìn thấy được trong ảnh gốc. Ví dụ, từ một bức ảnh chụp robot, mô hình có thể tạo ra mặt sau của robot và phỏng đoán có một bãi cỏ bên cạnh hồ bơi. Đặc biệt, người dùng có thể đặt hai bức ảnh không liên quan vào một bối cảnh không gian 3D và Atlas sẽ tạo ra một thế giới mới mượt mà kết nối giữa chúng, tưởng tượng ra những lối đi, hành lang hay góc cạnh trung gian.
Tái tạo không gian 3D từ ảnh thưa
Atlas giải quyết một bài toán kinh điển trong thị giác máy tính: tổng hợp góc nhìn mới từ một số lượng nhỏ ảnh đầu vào. Thay vì yêu cầu hàng trăm bức ảnh hoặc thiết bị quét chuyên dụng, Atlas có thể tái tạo không gian thực một cách trung thực chỉ với hai hoặc ba bức ảnh, vượt qua các mô hình chuyên dụng hiện nay.
Cơ chế hoạt động rất linh hoạt: khi mô hình nhìn thấy ít ảnh, nó sẽ "tưởng tượng" để lấp đầy khoảng trống bằng kiến thức thế giới. Khi có nhiều ảnh hơn (tối đa hàng trăm ảnh), Atlas sẽ ưu tiên tái tạo chính xác hiện trường. Người dùng có thể tạo ra vô số quỹ đạo camera khác nhau xuyên qua cùng một khung cảnh mà vẫn giữ được tính nhất quán, mở ra ứng dụng lớn trong điện ảnh, game và thiết kế.
Bên cạnh đầu ra 2D, Atlas còn tạo ra các đầu ra 3D tường minh như đám mây điểm (point clouds) và 3D Gaussian splats. Từ một video quay bằng điện thoại, Atlas có thể dự đoán độ sâu của từng khung hình và kết hợp chúng thành bản tái tạo 3D hoàn chỉnh, lấp đầy các vùng mà camera chưa từng quay đến.
Với cộng đồng công nghệ Việt Nam, khả năng tái tạo 3D từ ảnh thưa của Atlas có thể mở ra hướng đi mới cho các startup bất động sản (tạo tour ảo từ ảnh căn hộ), kiến trúc và bảo tồn di sản.
Mô phỏng thế giới: Từ VFX đến Robotics
Atlas hoạt động như một mô phỏng thế giới (world simulator) khi kết hợp hiểu biết về không gian và thời gian. Một ứng dụng ấn tượng là khả năng reframe video — biến một vài camera điện thoại thành "bullet time" studio, đóng băng thời gian và xem sự kiện từ góc không thể nào.
Trong lĩnh vực robotics, Atlas mở ra cách tiếp cận mới cho quy trình Real-to-Sim (từ thực sang mô phỏng). Chỉ từ một video quay bằng điện thoại (24 khung hình), Atlas tái tạo môi trường 3D và mô phỏng chuyển động của robot, đồng thời tạo ra dữ liệu RGB và depth mà cảm biến robot sẽ quan sát được. Người dùng có thể dễ dàng thay đổi vật thể, vị trí, chuyển động robot, ánh sáng và bối cảnh để tạo ra dữ liệu huấn luyện đa dạng.
Kiến trúc kỹ thuật và hiệu năng
Atlas là một omni model — một kiến trúc thống nhất xử lý nhiều loại dữ liệu và tác vụ khác nhau. Điểm đặc biệt là mọi đầu vào (hình ảnh, depth map) đều được gắn với một vị trí 3D cụ thể trong không gian, tạo thành một "bối cảnh không gian" (spatial context). Mô hình hoạt động theo cơ chế autoregressive: tạo ra từng phần tử đầu ra một, tuần tự, dựa trên những gì đã tạo trước đó.
Về benchmarks, Atlas vượt trội so với các mô hình chuyên dụng ở hai tác vụ chính: tạo video theo điều khiển camera và tái tạo 3D từ ảnh thưa. Trong thử nghiệm, 75-94% người đánh giá độc lập chọn Atlas so với các đối thủ như MiniMax H3, Gemini Omni Flash hay FLUX 3. Về tái tạo 3D, Atlas đạt sai số trung bình 25.3 so với 28.7-47.7 của các mô hình khác trên nhiều benchmark phổ biến như DTU, ETH3D, KITTI.
World Labs tin rằng Atlas sẽ tiếp tục cải thiện khi tăng quy mô tính toán huấn luyện. Hiện Atlas đang ở giai đoạn truy cập sớm với các đối tác chọn lọc, và sẽ là nền tảng cho các phiên bản tương lai của sản phẩm Marble.