◎ Sharpa让世界模型“上手”。
△ 撰文:董志洋
在上海的DQ门店,Sharpa机器人开始制作冰淇淋,它使用门店原有的设备和工具,固定纸杯上的金属环、完成搅拌,再将暴风雪倒置展示。
CraftNet是支撑这套自主操作系统的模型之一。
制作流程可以拆成步骤,手指接触物体之后的变化却需要持续处理。纸杯受压会变形,搅拌会改变受力,翻转杯子也会改变抓握状态,机器人需要一边执行,一边调整。
最近,Sharpa公开WM-Craftnet研究,将关注点集中到手内操作:物体已经握在手里,机器人怎样让它继续转动,并在偏移或受到外力后恢复控制。
此前的CraftNet强调分层执行与接触修正,而WM-Craftnet研究如何学习手与物体的交互状态。
两项研究处理的是相关但不同的问题,关注点都落在接触之后的控制上。
01.
从任务执行,到接触控制
Sharpa此前公开的CraftNet采用视觉-触觉-语言-动作,也就是VTLA架构,它由System 1和System 0组成,上接负责语义理解与任务拆解的System 2。
Sharpa此前在GTC 2026的演讲中介绍过这套分工:System 1生成粗动作与物理意图,System 0结合触觉和本体感知,对动作进行精细修正。
△ System 1与System 0组成CraftNet,上接System 2
视觉可以帮助机器人找到物体、选择接近方向,手指碰到物体后,实际接触位置、受力和滑动情况,又会影响动作能否继续。
System 0使用触觉、本体状态和当前动作意图,生成动作修正。它还可以接入遥操作设备,在操作者提供较粗动作的情况下,帮助灵巧手稳定控制物体。
这套分工让底层控制根据接触变化调整动作,减少了上层重新规划的需要。
WM-Craftnet集中研究的手内旋转,则将接触变化贯穿整个操作过程。物体需要在手中持续转动,手指必须交替移动,建立新的支撑关系。
保持抓握时,多根手指可以维持相对稳定的接触。旋转物体时,部分手指需要松开、换位置,其他手指继续支撑。一次接触切换没有衔接好,物体就可能滑落。
物体形状也会改变这个过程。
圆柱体表面连续,带有凸起或缺口的物体却会让手指遇到不同轮廓。同样的手指位移,可能推动旋转,也可能把物体挤向手掌边缘。
Sharpa在研究中发现,部分策略能在熟悉物体和固定初始姿态下完成任务,却容易学成一套接近开环的手指动作。初始位置发生偏移,或者操作中受到外力,策略就可能卡住或让物体掉落。
02.
世界模型怎样参与动作
WM-Craftnet引入世界联觉模型WSM,将深度、触觉、关节状态和动作历史结合起来,学习连续交互中的状态变化。
整套方法由世界模型与操作策略配合工作。WSM持续更新内部状态,策略结合当前观测、目标旋转方向和WSM特征,输出22个关节的相对目标调整量。
简单说,世界模型根据连续的传感信息和动作,判断手与物体正在怎样变化;控制策略再利用这些信息,决定手指下一步怎么动。
实验使用22自由度的Sharpa Wave灵巧手,腕部安装RealSense L515深度相机。机器人运行时依靠自身观测,不需要输入物体编号。
深度图像提供手与物体的空间信息,触觉提供实际接触线索。关节状态和此前的指令,则帮助系统判断手指做过什么、动作带来了怎样的变化。
WSM采用Dreamer式递归状态空间模型,每次收到新观测,它都会结合此前的状态和动作更新,保留连续操作中的信息。
训练时,团队让模型重建深度、关节和接触信息,预测奖励,并利用仿真中的物体姿态、形状等标签辅助学习。部署后,模型根据传感器输入和动作历史更新状态。
深度去噪是其中一项重要设计。
真实腕部相机可能出现测量误差和局部信息缺失,团队便向训练输入加入噪声、缺失和小幅图像旋转,同时用干净的仿真深度监督重建。
这样训练,要求模型从受干扰的画面中提取手与物体的结构,此前的动作和接触信息,也能为当前判断提供参照。
实际运行时,操作策略接收带噪观测和WSM特征。重建深度用于训练监督和分析,完整策略使用的是世界模型内部的状态信息。
世界模型与策略按不同目标训练。
PPO强化学习负责优化操作策略,WSM根据重建和预测目标更新,策略梯度不会通过这一接口反向更新WSM。
世界模型在这里向控制策略提供状态特征,不通过生成想象轨迹来规划或优化动作。
这与Sharpa此前公开的CraftNet解决着相关但不同的问题。
System 0强调利用接触反馈修正动作,WM-Craftnet重点研究如何通过多模态预测训练,获得能够支持控制的交互表示。
WM-Craftnet通过目标旋转方向等条件指定任务,此前CraftNet由上层处理语言、分解长流程任务的方式,不属于这套实验架构。
为了将策略从仿真部署到真机,团队还标定了关节响应,并随机调整物体质量、摩擦、初始位置和传感噪声。
本次实验的手部控制、相机和触觉数据流均采用10Hz,仿真物理步进为60Hz。
03.
换物体、受干扰,还能继续转
在20个真实物体、共200次旋转试验中,WM-Craftnet成功175次。测试对象包括9个训练物体和11个未见物体,每个物体测试10次,以旋转超过半圈作为成功条件。
对照方法中,结合深度与触觉的方法成功53次,其他三种方法分别成功33次、41次和45次。团队将这些方法适配到同一款灵巧手,并使用一致的训练奖励、随机化范围和初始化方式。
另一项真机测试记录了20秒内的旋转表现。
面对鸭形物体,WM-Craftnet平均旋转约16.18弧度,10次全部成功;面对未见双缺口块,平均旋转4.32弧度,10次成功8次。
未见物体改变了手指接触的位置和支撑条件。这类测试检验的是,策略能否根据新的观测继续调整,而不是只复现熟悉物体上的动作。
团队还单独检查了去噪的作用:将WSM重建的深度图提供给原有视触觉策略,观察它能改善多少表现。
在角块上,原策略10次只成功1次,使用重建深度后达到10次全部成功。但面对未见双缺口块,两种配置都没有成功,完整WM-Craftnet则成功8次。
在该测试中,改善深度信息有帮助,但仅提供去噪后的图像,还没有达到完整方法在未见物体上的表现。
在仿真中,团队还比较了保留历史信息、但不使用多模态预测目标的LSTM和GRU网络。两者的任务回报分别为621.0和497.8,完整WSM为753.3。
这一回报综合了旋转、稳定性和动作代价等奖励项。对照结果表明,即使网络已经能够保留历史,多模态预测训练仍改善了任务表现。
外力干扰后的恢复也是测试内容。
在强扰动恢复的仿真实验中,WM-Craftnet成功恢复到可控状态的比例为14.1%,对照方法最高为6.2%;成功恢复的试验平均耗时2.56秒。
演示中,手指会先把物体移回适合操作的位置,或将倾斜的物体扶正,再继续旋转。物体超出工作范围,或接触持续漂移、卡住时,仍可能恢复失败。
04.
接触经验怎样复用
WM-Craftnet还测试了已经训练过的世界模型能否继续使用。
团队先在9个物体的z轴旋转任务上预训练WSM,再将它用于49个新物体的仿真训练。世界模型继续根据新交互更新,控制策略也针对新对象学习。
经过3000轮训练,平均每回合旋转角度达到9.37弧度,无预训练先验的对照结果为3.28弧度。
新物体需要重新训练控制策略,但此前学到的接触和运动关系可以继续利用。世界模型留下的交互表示,成为新一轮训练的起点。
团队还用同一套框架训练x轴和y轴旋转任务,为各轴分别训练世界模型与策略。
在工具操作的仿真演示中,灵巧手能够将螺丝刀调整到目标位置,并保持接触完成旋转。
Sharpa此前介绍System 0时,也谈到了操作经验的积累,团队通过仿真和强化学习生成抓取、捏取、插入、手内旋转等基础接触动作数据,再结合真机数据学习更复杂的操作。
Sharpa强调,仿真和强化学习不仅用于生成数据,还通过奖励与惩罚约束动作,使数据包含抓握稳定性等规律。
预训练后的System 0可以接入遥操作,操作者提供较粗的动作意图,系统根据触觉和本体状态修正手指,帮助完成精细接触操作。
两项研究积累的成果有所不同。
此前System 0侧重形成能够执行和修正动作的能力;WM-Craftnet则展示了另一种可复用成果:帮助新策略判断接触变化的世界模型。
在这两项研究中,Sharpa处理了操作能力的不同部分:分层控制负责配合执行,世界模型学习则为新的控制训练保留交互经验。
灵巧手开发因而可以同时积累动作策略和支持策略学习的模型。
WM-Craftnet的49物体实验展示了后一种积累的作用,换一批物体,团队仍然训练新的策略,但可以接着使用此前学到的交互表示,不必让每一项操作都从头学习。
-END-




沪公网安备31010702008139