World Labs 在 2026 年 9 月 1 日推出了 Atlas,这是一个从照片生成 3D 世界的 AI 模型。World Labs 的共同创办人是 Fei-Fei Li,她是 ImageNet 的推动者、斯坦福大学 AI 实验室前主任,在 AI 圈被称为教母级人物。这家公司目前已经从 Nvidia、AMD、Autodesk 等投资者处获得超过 12 亿美元的资金。

Atlas 跟你熟悉的 AI 视频生成工具(比如 Sora、Runway)不一样。它生成的不只是一段视频,而是一个拥有 3D 深度的完整空间。你可以自由控制镜头角度,就像在游戏里移动视角一样。

它能做什么

Atlas 官方称自己是“世界模型”(world model),简单来说:

  • 上传一张照片,它会帮你“想象”照片背后的整个 3D 世界
  • 可以生成最长 1 分钟、最高 1440p 的视频
  • 镜头可以自由移动,前后左右上下都可以
  • 除了视频,还能输出点云3D Gaussian splat(可以拿去游戏引擎或 3D 软件使用)
  • 最多可以上传 8 张照片,它会自动拼成一个完整场景

官方公告中特别强调的一个词叫空间智能(spatial intelligence):AI 不只是看懂一张图的像素,而是理解图片背后的物理空间——物体之间相距多远、什么东西在什么后面、光线从哪里来。

怎么用

目前可以直接在 marble.worldlabs.ai 上试用。界面分为两种输入模式:

  • 2D input:上传照片、视频或全景图,让 Atlas 生成 3D 世界
  • 3D input:使用 3D 模型和基本几何形状搭建场景

Atlas 操作界面:2D 输入模式,可以用文字描述场景、上传照片,选择 Marble 1.1 Plus 模型生成

操作很直观:选择 2D input,上传一张照片,用文字描述你想要的场景,选择模型(目前是 Marble 1.1 Plus),点击 Create。生成需要等待几分钟,完成后可以用鼠标拖动来改变镜头角度,也可以导出视频。

小企鹅的实测:用一张北海道照片生成整个 3D 世界

小企鹅拿了一张之前带家人去北海道二世谷旅行时拍的照片进行测试,输入的 prompt 很简单:“生成这张图片的场景,图片拍摄于北海道二世谷”,选择 Marble 1.1 Plus 后点击 Create。

等待大约十分钟后,Atlas 生成了一个可以自由移动镜头的 3D 场景。上面的视频就是完整的生成过程,包括等待动画和最终成品展示。

几个观察:

  • 整体氛围还原得不错,雪景和建筑的质感都很到位
  • 镜头移动时的几何一致性还可以,但偶尔会出现画面破损或扭曲
  • 离原始照片的视角越远,生成的细节就越模糊(这是预期内的)
  • 生成时间大约 10 分钟,不算快但可以接受

技术上是怎么做到的

Atlas 的底层架构是一个“多模态自回归扩散 Transformer”。简单来说,它是一个可以同时处理文字、图片、视频和 3D 数据的单一模型,在统一的空间架构中运行。

跟一般 AI 视频工具的差别在于:Atlas 把镜头轨迹和几何结构作为原生输入,而不是靠文字描述去猜测你想要什么角度。这就是为什么它能做到“像素级的镜头控制”。

在官方公布的盲测中,Atlas 在镜头路径准确度上胜过 Gemini Omni Flash 和 FLUX。在 3D 几何重建方面,它也超过了主流开源模型。

官方介绍视频

World Labs 的官方视频展示了 Atlas 更多的能力,包括从单张照片转换成完整 3D 场景的过程:

World Labs Atlas 官方介绍视频

▶️ World Labs Atlas 官方介绍视频(YouTube)

小企鹅的看法

  1. 这不是又一个 AI 视频工具。 过去的 Grok Imagine 和已经退役的 Sora 做的是“文本生成视频”,讲究的是把 prompt 写得精准。而 Atlas 做的是“从照片和文字中重新建立 3D 空间”。听起来似乎差不多,但光是“可以自由控制镜头”这一点,就说明它确实在某种程度上“理解”了空间。
  2. 实际体验比想象中好。 我原本以为从一张照片生成的 3D 质量会很粗糙,但移动镜头时的效果还是让人相当惊艳。虽然会出现画面破损,但也让人很期待未来新版本的发布。
  3. 有意思的是,“训练机器人”才是他们真正想做的事。 看官方 X 时,机器人场景出现了好几次。查阅官方说明后发现,他们最大的应用方向是机器人训练:用手机拍摄真实空间,重建成 3D 环境,让机器人在模拟器里练习。可以说,对 Atlas 而言,空间理解才是真正的核心。

延伸阅读