JavaScript is required

李飞飞的Atlas来了,「全球首个多模态世界模型」新在哪儿?

◎ Atlas:生成画面,也重建世界。

△ 撰文:董志洋

把相机转到照片没有拍到的地方,AI还能接着生成同一个场景吗?

换个角度后,物体之间的位置关系不能乱,原来被遮挡的部分也要补出来。相机继续移动,前后画面还要对得上。

9月1日,World Labs发布新一代世界模型Atlas。

公司在社交平台称,Atlas是全球首个能够以像素级相机控制生成图像和视频帧、并进行三维重建的多模态世界模型。

World Labs联合创始人兼CEO李飞飞强调,Atlas从零开始训练,它原生处理文字、图像、视频和三维信息,覆盖生成、重建与仿真辅助等任务。

在这次展示中,Atlas能从一张照片生成不同角度的画面,按照指定路线生成视频,也能从实拍中重建三维环境。

几部普通手机记录的动态事件,可以重新选择观察角度;虚拟机器人沿不同路线运动时,Atlas还会生成机身相机沿途看到的图像和深度信息。

同一处空间既供人安排镜头,也能输出三维几何,或用于准备机器人训练环境。

Atlas的技术重点,是让这些任务使用共同的空间信息:前面输入的照片、相机位置和深度,能够继续约束后面的生成结果。

01.

多模态,统一的是空间

Atlas把相机位置与朝向作为原生输入。

用户可以指定从哪里观察、看向哪里,再设计相机的移动路线。每张图像和深度图都对应明确的相机位姿,也就是拍摄位置与朝向,这些信息共同组成“空间上下文”。

团队展示过这样一种用法:选取两张彼此不相关的图片,分别指定它们在三维空间中的位置。

Atlas在两张图片之间生成连接区域,补出门口、走廊或转角,让相机沿连续路线从一处移动到另一处。

两张参考图可以决定两处空间的外观,相机位姿则提供它们之间的位置关系。

对于一间屋子,相机绕到侧面后,家具在画面中的大小和遮挡关系会变化;模型需要根据新的观察位置生成画面,同时与已经看到的部分保持一致。

Atlas采用多模态自回归扩散Transformer。

模型根据已有序列逐个生成新的元素,每个元素可以属于不同的数据类型;生成图像等连续数据时,则通过逐步去噪完成输出。

视频以图像序列的形式处理,图像和深度都与相应的相机位姿关联。

不同任务可以通过不同的输入、输出序列来组织。

团队也可以借用语言模型和视觉生成模型已有的优化方法,例如通过缓存减少重复计算,或调整去噪步数,在推理速度与生成质量之间取舍。

这套设计同时处理两件事:根据此前的内容继续生成,以及让新生成的视觉信息对应明确的空间位置。

文字负责描述内容,相机位姿负责指定观察条件,图像与深度则提供场景外观和几何信息。

团队用少量参考图和人工设计的相机路线,生成了最长1分钟、1440p的视频。

同一个场景还可以生成多条观察路径,改变相机运动的速度、长度和复杂程度。创作者可以先安排取景与路线,再让模型生成对应画面。

对需要反复调整镜头的工作,这种控制方式更接近先安排拍摄、再查看结果。

创作者修改路线时可以继续使用已有参考图,让镜头强调场景的不同部分,或调整经过同一区域的速度。

World Labs围绕运镜进行了比较:每次给出一张输入图片,以及包含一至三种镜头运动的目标路线。Atlas直接接收相机路径,其他模型接收描述相应运镜的文字,再由第三方评审判断哪段结果更符合指定路线。

在与五个模型的比较中,选择Atlas的比例为75%至94%。

其中,与Gemini Omni Flash相比为81%,与Seedance 2.5相比为94%;公司还观察到,随着相机轨迹变复杂,Atlas在运镜遵循上的优势扩大。

02.

生成与重建共用一个模型

团队先给Atlas一张花园照片,让模型从空中观察这处环境。花园之外的建筑没有出现在输入中,Atlas便补出周围景物。随后加入真实小屋照片,小屋进入重建结果;再加入主屋照片,主屋也按照新增信息调整。

用户提供的信息较少时,模型补充较多未知内容;照片增加后,真实信息对空间的约束随之增强。

创作虚构场景可以从少量参考图出发,还原真实地点则可以继续补拍,把关键区域的位置与外观交给模型。

World Labs称,Atlas通常用两三张图片就能获得较忠实的重建,也可以利用超过100张图像构成空间上下文。

斯坦福主广场的展示使用2至25张地面照片,逐步将入口草地、建筑和教堂立面的细节纳入同一个场景,再生成空中观察路径。

Atlas能够同时生成新视角画面和估计几何。

对于真实空间的视频,它预测各帧深度,再将这些结果组合成点云重建。模型还会填补未被相机覆盖的区域,并进一步形成3D高斯泼溅场景。

点云记录空间中各个点的位置,3D高斯泼溅场景则支持在设备本地以较高分辨率和帧率渲染。World Labs现有产品Marble采用同类表示,Atlas生成的场景可以与这一产品体系衔接。

输出三维场景,给后续使用者保留了重新选择观察位置的自由。镜头不必固定在已经生成的视频里,开发者可以根据设计、展示或仿真任务安排新的路线。对于机器人应用,几何信息也为生成不同位置的视觉观测提供了基础。

团队评估了稀疏图像三维重建能力:给模型输入图片及相机位姿,要求预测各像素对应的三维点。测试按统一流程复现对比模型结果,以平均绝对相对误差AbsRel衡量三维点图重建,数值越低越好。

以10⁻³为计量尺度,Atlas平均误差为25.3,使用位姿信息的Pi3X为28.7,π³为34.7。Atlas同时承担生成与重建任务,在这组测试的平均误差上优于参与比较的专用重建模型。

动态事件也可以重新选择观察角度。

团队用三至五个普通手机或运动相机视角记录事件,再用Atlas重建,生成类似“子弹时间”的效果。观看者可以定格其中一个时刻,将视角移到现场没有架设相机的位置;拍摄使用普通三脚架和夹具。

拍摄结束后重新取景,模型需要把不同相机记录的动态过程联系起来,在同一时刻维持多个视角之间的关系。观看者移动视角时,观察的仍是同一个事件。

Atlas还支持通过文字生成图像,以及用文字或图片生成360度全景,展示了不同视觉风格和画面文字生成能力。

World Labs称,团队训练了不同模型规模、使用不同训练算力的版本,并观察到增加算力带来了新的能力,后续将继续扩大训练。

03.

真实场景成为可变的训练环境

机器人在虚拟环境中移动时,相机的位置和朝向随身体变化,训练系统需要提供与这些变化对应的图像和深度。重建好环境后,还要让机器人从自己的位置观察它。

World Labs用手机视频记录两个大型环境,各选取24帧进行重建。随后,不同形态的虚拟机器人沿不同路线运动,Atlas根据机身相机的位置生成RGB图像和深度数据。环境重建与机器人视角的观测由同一个模型提供。

这种用法让同一批实拍能够支持多种观察条件。机器人可以沿新的路线移动,生成画面也随之变化,而不必局限于手机原来的拍摄轨迹。场景信息与观察位置共同决定了训练系统需要生成什么。

英伟达GEAR研究团队联合负责人Jim Fan在公开评价Atlas时,将其称为机器人领域从真实世界走向仿真的重要一步。

除了导航,World Labs还展示了机器人装盒的操作案例,包含放入物品、合盖,以及提起盒子放入篮筐等动作。

演示先呈现真实拍摄与多个相机视角,再展示Atlas生成画面、简化几何的物理仿真,以及加入渲染的物理仿真。盒盖开合、物体移动和最终放入篮筐的过程,在实拍和仿真画面中呈现。

Atlas根据少量实拍辅助建立涉及刚体、带关节物体和可变形物体的仿真。任务建立后,可以改变物体种类、位置和机器人动作,也可以调整光照与背景。演示中,盒子、提手和篮筐出现了不同实例,同一操作还被放入多个环境。

改变物体位置,机器人面对的抓取位置随之改变;调整背景与光照,相机获得的视觉信息也会变化。研究者可以沿着已有任务设置不同条件,增加训练情境,或者比较同一策略在不同条件下的表现。

导航侧重沿运动路线持续提供环境观测,操作还涉及物体之间的交互。Atlas展示的两类应用,都从真实采集开始,再生成新的观察视角或任务条件。

对机器人团队来说,已有记录可以继续用于设计实验,而不只是回看当时的执行过程。

World Labs此前已经在推进这类工作。

2026年7月21日,公司宣布收购SceniX;7月28日,又介绍了衔接真实采集、仿真训练与真机部署的流程。Atlas此次展示了空间重建、视觉观测生成和场景变化在这一方向上的应用。

公司在2026年2月宣布获得10亿美元新融资,参与方包括Autodesk、AMD和英伟达等,其中Autodesk投资2亿美元。

Atlas将用于未来版本的Marble及其他产品,目前面向选定合作伙伴开放早期访问。

World Labs同时面向创作工具与机器人研发,客户使用空间的方式也不同。前者需要安排镜头和生成三维内容,后者需要提供传感器观测、调整任务条件。共同的基础模型要进入这些工作,还需要通过具体产品和仿真流程供开发者调用。

对机器人团队,后续更换策略或调整任务时,已有场景能继续支持实验,才会减少重复采集和准备环境的工作。

世界模型的产品价值,也会越来越多地体现在这种持续使用中:一次建立的空间,能够服务后续多少轮研发。

-END-

2026年11月,HRTC 2026人形机器人技术与产业大会将在上海举办。本届大会以“场景落地·生态协同”为主题,围绕家庭服务、工业制造等场景实践及核心零部件技术,汇聚整机、供应链、集成开发企业与应用客户,探讨部署运营、量产交付及可靠性等问题,推动供需对接与产业协作,促进人形机器人商业化落地。

点击查看全文
评论赞0分享
轨迹
World Labs李飞飞Atlas

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4