◎ 让机器人先在世界模型里练习。
△ 撰文:董志洋
机器人缺训练数据,难处也在采集之前:一个真实工位,要花多少工夫才能变成训练环境?
Atlas发布后,World Labs联合创始人李飞飞、Justin Johnson和Ben Mildenhall接受了a16z普通合伙人Martin Casado的交流。三人从模型架构谈到机器人训练,解释了这款世界模型背后的技术选择。
李飞飞把当前机器人的主要瓶颈指向数据。
机器人在真实环境中操作的数据难以采集,训练又需要覆盖不同条件,她以工业布线举例:线缆不会始终按同一种方式弯曲,箱子也可能更换尺寸、箱盖和摆放位置。
教机器人完成任务,必须为这些变化准备足够的练习。
Atlas此前展示的自由运镜、少量照片重建场景,便与这项工作发生了联系。减少现场采集和重建的负担,可以帮助团队准备训练环境;继续学习物体和环境的变化,则可能让世界模型进一步参与机器人训练与规划。(点击回顾:李飞飞的Atlas来了,「全球首个多模态世界模型」新在哪儿?)
这次交流,将Atlas从一组视觉演示带到了机器人研发的具体工作中。
01.
重建工位,先少拍一些照片
Ben Mildenhall长期研究从图像重建三维场景,在他看来,这项技术走向应用时,一道难题是采集要求远高于普通用户的预期。
人看几张房间照片,往往就能理解大致布局。传统密集重建需要的观察却多得多:同一处表面需要从不同角度拍摄,桌底、麦克风下方和椅腿之间的区域,也需要尽量覆盖。
拍到整个房间,不等于拍清了房间里的每一处表面。
为了补齐视角,采集者需要围绕物体和空间移动。Ben提到,他见过第一次扫描多房间环境的人,花两个小时走遍现场,试图获得足够的覆盖。
这也是“密集”的含义:一个房间,可能需要拍摄100张、200张甚至300张照片。Ben介绍,团队希望把这项采集量降到约3张。
他还分享了自己的尝试。过去拍摄一个多房间场景时,他采集了约2000张照片;使用Atlas后,将输入减少到约30-40张,生成的场景漫游看起来仍然相近。
减少照片数量,首先减轻的是现场拍摄的负担。对于需要反复准备环境的团队,这会影响一项重建工作是否值得开展,以及现有图像能否被重新利用。
Ben已经尝试将过去未能成功重建的拍摄记录交给Atlas处理,也尝试从旧数据中删去大量照片。过去因视角不足而难以使用的记录,有了重新生成三维场景的可能。
这种变化来自生成与重建的结合。
Atlas把图像及其拍摄位置放在一起,建立空间上下文。用户指定新的相机位置后,模型根据已有观察,生成从那个位置看到的画面。
输入照片越多,模型获得的现场信息越充分。对于没有拍到的区域,它则利用训练中学到的空间经验补充画面。
Justin解释,即使让有经验的采集者拍摄数百张照片,也难免漏掉一些位置。传统重建依赖多个视角确定空间中的点,未被观察到的区域容易留下缺口,生成能力可以帮助补充这些部分。
这让模型能够同时处理两类情况:有充分观察的地方,利用图像还原;观察不足的地方,根据已有信息生成其他视角。用户也可以继续加入图像,让模型获得更多场景信息。
对机器人来说,生成视角有直接用途。
在Atlas公开的导航演示中,团队用手机视频记录两处大型环境,分别选取24帧进行重建。随后,模拟机器人沿不同路径移动,Atlas生成其机载相机沿途看到的RGB图像和深度数据。
环境重建和机器人观察到的画面,可以来自同一个模型。
李飞飞进一步将Atlas与World Labs收购的SceniX团队联系起来,后者如今已成为公司的机器人团队,围绕真实环境转入仿真、再将训练结果用于真机的流程开展工作。
她指出,过去通过密集拍摄重建环境,需要大量人工投入,耗时也长,拖慢了机器人仿真训练的准备过程,她希望用Atlas改善这一环节。
02.
训练需要会变化的环境
一个工位进入仿真之后,机器人还需要在其中经历不同的情况。
李飞飞谈到工业布线时,紧接着介绍了随机化:改变线缆的弯曲方式,调整箱子的尺寸、颜色、箱盖和位置,让训练覆盖不同条件。
这些变化会影响机器人接近物体、抓取和操作的方式。只记录某一种状态下的成功动作,很难提供足够丰富的经验。
Justin从机器人学习的特点解释了这个问题。
图像、视频和代码生成,可以学习大量已有内容。机器人策略则需要进入环境,通过动作完成目标,环境未必按预期响应,执行中也会出现意外。
因此,训练要让机器人接触部署时可能遇到的失败情况。仿真提供了一个可以安排不同条件、反复练习的环境。
这也让机器人数据的准备工作变得复杂,除了记录人或机器人怎样完成任务,还要考虑物体状态发生变化后,原有动作是否仍然适用,以及任务在什么地方容易中断。
李飞飞讨论真实环境转仿真,正是为了获得更多这样的训练条件。
以现场为基础构建环境,再改变其中的物体和布置,可以围绕同一个任务开展不同测试,团队不必每次都从头准备一个毫无关联的新场景。
Atlas已经展示了对这类流程的辅助。在操作任务演示中,它利用少量真实记录帮助构建仿真;任务进入仿真后,可以改变物体、位置、机器人运动、光照和背景,生成不同的训练与测试环境。
少量记录如何变成可反复使用的环境,比单次生成画面是否逼真,更贴近机器人研发的日常需求。
减少中间步骤,也是World Labs调整产品方法的原因之一。
Ben观察到,一些用户使用上一代Marble时,会先输入图像,生成三维高斯场景,再从几个位置截图,把这些画面用于后续创作。
Atlas可以根据空间上下文直接生成所需视角。需要图像时输出图像,需要三维结果时,则结合深度信息进一步重建,不必每次都经过完整的三维高斯场景。
这为不同任务留下了选择:视觉数据生成可以直接获取对应画面,三维应用则继续使用空间重建结果。
在设计和创作领域,Ben同样强调保留场景、反复修改的重要性。用户希望积累可持续使用的资产,调整物体、布局和观察角度,而不是每次重新生成。
他举出建筑和空间设计的例子:一次讨论可以很快提出修改意见,将这些意见落实到三维软件中,却可能需要长时间返工。他希望增加模型的控制能力,让用户更容易修改已有空间。
机器人训练也需要这样的可控性。
保留基本工位,只改变某些条件,便于围绕同一个任务比较不同策略的表现,场景能够生成之后,还要方便修改和重复使用。
03.
从场景重建走向动作预测
准备环境之后,World Labs更长远的设想,是让模型学习环境如何响应动作。
Justin在交流中讨论了两种仿真方法:
一种是使用物理引擎,由开发者设计可能出现的情境,再通过代码描述;另一种更依赖数据,训练模型理解动作会给世界带来什么变化。
他也提到,编程智能体能够帮助开发者构建传统仿真。数据驱动的神经仿真,则提供了另一条研究路线。
在他的设想中,模型学习大量数据,预测环境对动作的响应,再作为训练环境,帮助机器人策略练习。
这将世界模型要处理的问题,从不同位置的观察,进一步推进到动作之后的状态变化。物体如何移动、环境怎样响应,也需要被纳入模型学习。
Justin随后把讨论延伸到规划:理解一个动作会产生什么结果,与为了得到某种结果而选择动作,具有紧密联系。
如果模型能够预测行动后果,这种能力就可能用于帮助机器人选择行动。神经仿真与动作规划,也因此成为团队继续探索的方向。
动态能力已经进入Atlas的架构和预训练。
Justin介绍,Marble在设计上侧重静态世界,Atlas则支持动态内容。公开演示中的水波,以及部分俯视画面里移动的汽车,体现了这种变化。
即使最终需要静态重建,动态数据也有训练价值。
现实中很难获得规模足够大、又完全静止的场景记录,团队选择同时使用静态和动态内容,让模型学习区分其中的变化。
本次发布版本的后训练更侧重静态内容与空间移动,团队接下来,计划继续强化模型对动态过程的处理。
这与机器人任务密切相关。重建一个房间,主要涉及空间结构;机器人开始抓取、拉动或移动物体后,训练还需要处理随动作变化的状态。
不过,World Labs并没有把新视角预测仅仅当作一种重建技巧。
李飞飞与Justin将它类比于语言模型的下一词元预测,希望通过这一基础任务,推动模型学习更广泛的空间关系。
预测从新位置看到的画面,需要理解已有视角之间的联系,也要处理遮挡与未观察区域。加入时间和动作后,模型还要进一步理解世界如何变化。
Justin介绍,团队在研发中训练了不同规模的模型。扩大模型、延长训练时间、投入更多计算资源,都带来了明显改善。他认为,继续扩大Atlas,目前主要受训练算力约束。
这些研发观察支撑了团队继续投入的判断。下一步的工作,也包括增加对场景布局、物体和时间的控制,在保持生成质量的同时,让模型更容易被实际应用调用。
李飞飞在交流最后回到观察与行动的关系:空间智能需要在看见、经历和交互中发展。机器人恰好需要不断经历这个过程,执行动作,再根据环境变化继续行动。
对机器人行业而言,Atlas带来的一个值得关注的变化,是更多真实现场有机会成为训练环境。
过去,一处现场是否值得重建,要考虑拍摄、补齐视角和建模的投入。少量图像重建降低这部分负担后,研发团队可以尝试利用更多已有记录,围绕实际任务准备测试。
世界模型能否帮助机器人获得更多经验,也会体现在这些具体工作中:同一批现场记录能够生成哪些观察,环境如何修改,策略怎样在其中练习。
李飞飞团队正在尝试改变的,正是训练环境的准备方式。
让更多工位成为机器人可以反复练习的地方,是世界模型走向机器人应用的一项实际工作。
-END-




沪公网安备31010702008139