◎ 机器人动手前,TrAct先让世界模型看一遍结果。
△ 撰文:董志洋
机器人执行任务时,策略模型通常根据当前画面和语言指令,直接输出下一组动作。动作是否合适,要等机器人真正执行以后才能看到结果。
世界模型提供了另一种思路。
它可以根据候选动作预测接下来可能出现的画面,让机器人在动手之前比较不同结果。
但机器人控制指令与视频画面使用不同的表示方式,世界模型生成的未来很难直接接回实际控制。
8月25日,密歇根大学与斯坦福大学团队发布机器人决策框架TrAct,其名称来自“Track”与“Act”,核心做法是用二维视觉轨迹连接机器人动作和未来视频预测。作者包括曹智、Howard Ji、Kevin Zhang、葛匡智、李飞飞、吴佳俊和黄煌。
在真机实验中,团队使用Franka Panda机械臂完成关闭柜门、抓取面条和倾倒意大利面等任务。每次行动前,TrAct会生成16组候选动作,以及与每组动作对应的视觉轨迹。
世界模型根据这些轨迹分别生成未来视频,视觉语言奖励模型判断哪一种结果更符合任务要求,机械臂再执行得分最高方案所对应的动作。
以关闭一扇半开的柜门为例,系统会比较不同动作可能产生的结果:夹爪能否接触柜门,移动方向是否正确,最终画面中的柜门是否关好。
TrAct让世界模型参与机器人动作选择,策略模型提出候选方案,世界模型生成可能的结果,奖励模型从中完成筛选。
01.
动作和画面之间,缺一个接口
机器人控制器和视频世界模型处理的信息并不相同。
控制器输出关节角、末端位姿和夹爪开合状态等低维参数。
视频世界模型预测的是图像变化,包括夹爪的位置、物体的运动、遮挡关系和多个相机看到的场景。
一组控制参数最终对应怎样的画面,还会受到机器人结构、相机位置、空间关系和物体接触状态影响。
相同的末端位移换一个观察角度,夹爪在画面中的运动距离也会改变。夹爪接触物体后,物体是否滑动或移动,也无法仅由动作参数确定。
以机器人动作作为条件输入的世界模型,需要从控制指令继续推导完整的图像变化。
在TrAct的对比实验中,这类模型生成的视频会出现夹爪姿态错误、物体消失,以及外部视角和腕部视角中的物体位置不一致。
不同机器人还使用不同的动作空间,Franka Panda和UR5完成相同任务时,关节参数、末端控制方式和动作范围并不相同。
围绕某一种本体建立的动作与画面映射,换到另一种机器人后也会发生变化。
TrAct把接口放到图像空间,用二维视觉轨迹描述任务相关的关键点如何移动。
第一组关键点位于夹爪上,团队选取7个固定网格顶点,用来记录末端执行器的位置和姿态。
第二组来自腕部相机画面中的5×5网格,共25个场景点,用于提供物体、背景和相机运动的参照。
不同机器人仍然执行各自的控制指令,世界模型则围绕图像中的运动生成未来画面。
机器人本体发生变化后,视觉轨迹仍可描述夹爪和物体应该怎样移动。
02.
世界模型开始参与选动作
TrAct由VLAT、TWM和VLAC三部分组成。
VLAT以π0.5为基础,同时生成候选动作和对应的视觉轨迹,两者覆盖相同的执行时长,并以配对形式参与后续选择。仿真实验每次生成20组候选方案,真机实验生成16组。
视觉轨迹随后进入轨迹条件世界模型TWM。
团队以Stable Video Diffusion为视频生成骨干,并加入Temporal ControlNet处理轨迹条件。外部视角轨迹和腕部视角轨迹使用不同通道输入,世界模型据此生成两个视角下的未来画面。
基于InternVL2构建的视觉语言奖励模型VLAC,根据任务指令评价每段预测视频。
把面条放进碗里的任务,需要判断面条是否进入目标容器;关闭柜门的任务,则要判断柜门在预测结果中是否关好。
系统选出得分最高的视频后,执行与其轨迹共同生成的动作。动作和轨迹来自同一次策略采样,世界模型评估的预测结果与机器人执行的控制指令保持对应。

世界模型在这套流程中负责筛选候选动作,它不直接生成关节控制信号,而是比较不同候选动作可能带来的结果。
视觉轨迹也改善了未来视频的生成质量。
在真实腕部视角中,轨迹条件模型的LPIPS由动作条件模型的0.372降至0.225,FVD由246降至140。仿真外部视角的PSNR由15.12提高到24.51,LPIPS由0.438降至0.106。
轨迹条件提供了关键点的移动方向和位置,生成视频中的夹爪运动、物体状态和多视角位置关系也更加准确。
候选方案数量从5组增加到10组时,LIBERO-INTEGRAL成功率由52%提高到54%;增加到20组后,成功率达到55%。
候选方案越多,世界模型需要生成和评价的视频也越多。
03.
人类视频也能训练机器人
视觉轨迹还被用于连接机器人数据与人类操作视频。
机器人示范数据包含关节状态、末端位姿和夹爪动作,可以直接监督模型输出控制指令。人类第一视角视频通常不包含这些信息,却能够记录手部、物体和场景的运动过程。
TrAct从人类视频中提取手部关键点和场景点的轨迹,人类数据监督轨迹预测,机器人数据同时监督动作和轨迹,二者不需要共享同一种控制格式。
主模型使用7.6万条DROID机器人轨迹和15万条EgoDex第一视角操作片段预训练,两类数据按照1:2混合。
DROID的外部视角使用7个夹爪点,腕部视角使用7个夹爪点和25个场景点。EgoDex只有第一视角视频,团队为双手设置14个关键点,并加入25个场景点。
团队为不同数据设置了统一的轨迹槽位,某项数据缺少腕部相机、第二只手或动作标签时,系统通过掩码跳过相应位置。
EgoDex不参与机器人动作监督,只训练轨迹预测部分。
人类视频提供了更多手部操作和物体运动,机器人数据则保留可执行的动作信息,视觉轨迹让两类数据在预训练阶段共享运动监督。
主模型使用4块H100训练3万步。扩大数据规模后的TrAct+加入6万条BridgeData V2机器人轨迹,并使用约30万条完整EgoDex处理片段,在8块H100上训练6万步。
团队从LIBERO-INTEGRAL中选取5项最难的UR5跨本体任务进行测试。π0.5平均成功率为6%,TrAct达到32%,TrAct+进一步提高到38%。
增加机器人本体和人类操作数据后,模型在困难跨本体任务中的表现继续提高。统一轨迹表示使新增数据能够进入同一套训练体系。
04.
换本体以后,差距才拉开
标准LIBERO基准已经接近饱和,π0.5平均成功率为96.8%,TrAct为98.3%,差距只有1.5个百分点。
团队建立LIBERO-INTEGRAL,用20项任务考察分布变化和本体变化。
其中10项改变物体、任务、相机视角或机器人初始状态,另外10项将默认的Franka Panda替换成UR5,任务目标和场景配置保持不变。
在LIBERO-INTEGRAL上,π0.5平均成功率降至27%。
同时预测动作和轨迹、但不使用世界模型筛选的VLAT达到44%;采用动作条件世界模型的VLAT+AWM达到49%;完整TrAct达到55%。
跨本体任务中,π0.5平均成功率为17%,TrAct达到50%。
在“将橙汁放入篮子”任务中,π0.5成功率为0%,TrAct为50%;在“将碗放到盘子上”任务中,两者分别为40%和80%。
TrAct在20项任务中的18项取得最佳或并列最佳结果。
三个独立评测种子下,VLAT+AWM平均成功率为49.0%,95%置信区间为47%至51%;TrAct为54.7%,95%置信区间为53%至56%。
物体、视角和机器人发生变化后,动作格式与未来画面之间的对应关系更容易失效。视觉轨迹在这些任务中的增益,高于接近满分的标准基准。
真机实验使用Franka Panda、一个固定机位RGB相机和一个腕部RGB相机。团队采集400条、15Hz的演示,训练把完整粉色面条放入碗中、把面包放入碗中、关闭完全打开的柜门和倾倒意大利面4项任务。
测试阶段使用5项训练中未出现的任务,包括半长粉色面条、热狗面包、绿色方块、部分打开的柜门和倾斜料勺,每项任务分别在原始背景和陌生背景下测试10次。
π0.5在真机测试中的平均成功率为49%,使用VLAC筛选π0.5候选动作后达到65%,VLAT为55%,VLAT+AWM为66%,TrAct达到76%。
在陌生背景下关闭部分打开的柜门时,VLAT+AWM成功率为40%,TrAct达到70%。
把半长粉色面条放入碗中时,TrAct在原始背景下10次全部成功,在陌生背景下成功率为80%。
这些实验分别检验了轨迹联合训练、世界模型筛选和轨迹条件预测。完整TrAct在真机新任务和背景变化下取得最高平均成功率。
视觉轨迹贯穿策略训练、未来视频生成和候选动作选择。机器人继续使用本体相关的控制指令,世界模型则通过图像空间中的运动比较不同动作结果。
TrAct让世界模型生成的未来画面参与实际控制。机器人每次提出多组动作,世界模型预测结果,奖励模型完成筛选,选中的动作随后进入执行环节。
-END-



沪公网安备31010702008139