World Labs 在 2026 年 9 月 1 日推出了 Atlas,一個從照片生成 3D 世界的 AI 模型。World Labs 的共同創辦人是李飛飛(Fei-Fei Li),她是 ImageNet 的推手、史丹佛大學 AI 實驗室前主任,在 AI 圈被稱為教母級人物。這家公司到目前為止已經從 Nvidia、AMD、Autodesk 等拿到超過 12 億美元的資金。

Atlas 跟你熟悉的 AI 影片生成工具(像 Sora、Runway)不一樣。它生成的不只是一段影片,而是一整個有 3D 深度的空間,你可以自由控制鏡頭角度,就像在遊戲裡移動視角一樣。

它能做什麼

Atlas 官方稱自己是「世界模型」(world model),簡單來說:

  • 丟一張照片進去,它幫你「想像」照片背後的整個 3D 世界
  • 可以生成最長 1 分鐘、解析度最高 1440p 的影片
  • 鏡頭可以自由移動,前後左右上下都行
  • 除了影片,還能輸出點雲3D Gaussian splat(可以拿去遊戲引擎或 3D 軟體用)
  • 最多可以丟 8 張照片,它會自動拼成一個完整場景

官方公告裡特別強調的一個詞叫空間智慧(spatial intelligence):AI 不只看懂一張圖的像素,而是理解圖片背後的物理空間。物體之間多遠、什麼東西在什麼後面、光從哪裡來。

怎麼用

目前可以直接在 marble.worldlabs.ai 上試用。介面分兩種輸入模式:

  • 2D input:丟照片、影片或全景圖進去,讓 Atlas 生成 3D 世界
  • 3D input:用 3D 模型和基本幾何形狀搭場景

Atlas 操作介面:2D 輸入模式,可用文字描述場景、上傳照片,選擇 Marble 1.1 Plus 模型生成

操作很直覺:選 2D input,上傳一張照片,用文字描述你想要的場景,選模型(目前是 Marble 1.1 Plus),按 Create。生成需要等幾分鐘,完成後可以用滑鼠拖動鏡頭角度,也能匯出影片。

小企鵝的實測:用一張北海道照片生成一整個 3D 世界

小企鵝拿了一張之前帶家人去北海道二世谷旅遊的照片進行了測試,輸入 prompt 很簡單「生成這張圖片的場景,圖片拍攝於北海道二世谷」,選 Marble 1.1 Plus,按下 Create。

等待大約十分鐘後,Atlas 生成了一個可以自由移動鏡頭的 3D 場景。上面的影片就是完整的生成過程,包括等待動畫和最終成品的展示。

幾個觀察:

  • 整體氛圍還原得不錯,雪景和建築的質感有到位
  • 鏡頭移動時的幾何一致性還可以,但偶有破圖或扭曲
  • 離原始照片視角越遠,生成的細節越模糊(這是預期內的)
  • 生成時間大約 10 分鐘,不算快但可以接受

技術上怎麼做到的

Atlas 的底層架構是一個「多模態自迴歸擴散 Transformer」。一句話翻譯:它是一個單一模型,能同時處理文字、圖片、影片和 3D 資料,在一個統一的空間架構裡運作。

跟一般 AI 影片工具的差別在於:Atlas 把鏡頭軌跡和幾何當成原生輸入,而不是靠文字描述去猜你要什麼角度。這就是為什麼它能做到「像素等級的鏡頭控制」。

在官方公布的盲測裡,Atlas 在鏡頭路徑準確度上贏過了 Gemini Omni Flash 和 FLUX。在 3D 幾何重建方面也超越了主流開源模型。

官方介紹影片

World Labs 的官方影片展示了更多 Atlas 的能力,包括從單張照片到完整 3D 場景的轉換過程:

World Labs Atlas 官方介紹影片

▶️ World Labs Atlas 官方介紹影片(YouTube)

小企鵝的看法

  1. 這不是又一個 AI 影片工具。 過去像是 Grok Imagine 和退役的 Sora 做的是「從文字生影片」,講求的是下 prompt 要精準。而 Atlas 做的是「從照片與文字中重新建立起 3D 空間」。聽起來差不多,但單從「可以自由控制鏡頭」這件事來說,已經代表它真的在某種程度上「理解」了空間。
  2. 實際體驗比想像中好。 我原本以為從一張照片能生成的 3D 品質會很粗糙,但鏡頭移動時的效果還是讓人驚豔不少。雖然會破圖,不過很讓人期待未來新版本的釋出會如何。
  3. 有意思的是,「訓練機器人」才是他們真正想做的事。 在看官方 X 時候,出現了好幾次機器人的場景。找了下官方說明,發現他們把最大的應用方向放在機器人訓練:用手機拍真實空間,重建成 3D 環境讓機器人在模擬器裡練習。可以說對於 Atlas 而言,空間理解才是真正的核心。

延伸閱讀