JavaScript is required

One Model,Any Body!OM‑1让机器人不再“各练各的”

◎ OM‑1如何让一套模型进入不同身体?

许多机器人训练流程,仍然围绕具体本体采集示范数据。机械臂、灵巧手或控制方式发生变化,数据采集和模型适配也要随之调整。

Reward AI换了一个起点:先记录人类如何使用双手,再把这些经验交给不同的机器人。

人戴上可穿戴设备,用双手完成抓取、旋转、折叠和工具操作。OM‑1直接学习这些人类操作数据,再控制桌面机械臂、工业机械臂和人形机器人执行任务。训练中不使用遥操作数据,也不使用机器人运行产生的数据。

最近,Reward AI发布OM‑1,全称Omnibody Model 1,这是其首个机器人基础模型。

公开演示中,两台机械臂在酒吧调酒,四台机械臂协作包装手机,工业机械臂高速分拣物体,人形机器人则走到货架前取放物品,所有画面均以1倍速播放。

Reward AI将这套系统的原则概括为“One Model, One Data Interface, Any Body”:用一套模型和一个数据接口,连接不同的机器人身体。

它先在人类一侧建立统一的数据接口,再让同一套策略进入不同机器人本体,减少机器人技能对具体硬件的依赖。

“One Model, Any Body. Less is more.”

“Less”指向更少的重复采集与本体适配,为了做到这一点,Reward AI同时设计了手部装置、数据接口、策略模型和高频控制层。

01.

机器人训练,从人类双手开始

OM‑1最清晰的技术源头,是2024年发布的DexCap。

DexCap由王辰、Haochen Shi、Weizhuo Wang、Ruohan Zhang、李飞飞和C. Karen Liu共同完成,并发表于RSS 2024。王辰后来成为Reward AI联合创始人兼CTO。

当时,机器人灵巧操作的数据主要来自遥操作和视觉手部跟踪。遥操作要围绕具体机器人搭建控制设备,纯视觉方案又容易在手指握住物体时受到遮挡。

DexCap把数据采集设备穿到人身上。胸前的Intel RealSense L515记录彩色图像和深度信息,两台RealSense T265安装到手套背部,跟踪双手手腕的六自由度位姿;另一台T265留在胸前建立统一坐标系。Rokoko动捕手套通过电磁传感器记录手指动作。

图片

微型计算机和移动电源放在背包内。背包重约3.96磅,可连续采集约40分钟,整套硬件成本控制在4000美元以内。系统以60Hz记录相机位姿、双手手腕位姿、手指关节位置和RGB-D画面。

采集人员不必守在机器人工作台前,他可以在真实环境中直接操作物体,系统同步记录双手动作与周围空间。

图片

在小球收集任务中,DexCap的数据采集速度约为传统遥操作的3倍,接近人类自然操作的速度。

DexCap配套的DexIL负责把人类数据交给机器人。它先用指尖逆运动学,将人类指尖位置映射到四指、16关节的LEAP Hand。由于LEAP Hand没有小指,系统会舍弃人类小指的数据。

图片

随后,系统把RGB-D画面转换成三维点云,统一到机器人工作坐标系,去除多余背景,再加入机器人手的点云模型。处理后的点云、机器人自身状态和动作进入Diffusion Policy,由模型预测未来一段目标位置。

图片

研究团队在两台7自由度Franka Emika机械臂和两只LEAP Hand上测试了海绵抓取、小球收集、盘子擦拭、包装、剪纸和泡茶六项任务。

使用30分钟人类动捕数据后,DexIL在前三项基础任务上的平均成功率最高达到72%。野外采集数据训练的包装任务,对训练物体的完整成功率为47%,对未见物体为40%。

剪纸和泡茶包含更细的手指动作,也需要更长的操作顺序。研究团队让人在机器人运行时进行30次纠错,剪纸完整任务的成功率达到20%,泡茶完整任务达到25%。

DexCap的包装实验还记录了力信息缺失带来的影响。机器人包装物体时,一只手难以稳定盒身,另一只手合盖容易失败。

OM‑1沿用了直接采集人类操作的路线,并把触觉、接近度和力加入数据接口。模型同时获得手部运动、接近物体、建立接触、稳定抓握和用力的信息。

Reward AI联合创始人兼CEO符梓鹏此前参与Mobile ALOHA、HumanPlus、机器人跑酷和全身控制等研究。王辰的研究集中在灵巧操作、人类动作模仿与长序列控制。

OM‑1同时涉及手部数据、移动操作和全身控制,两位创始人此前的研究方向都能在这套系统中找到延续。

02.

7个自由度,换一种方式记录人手

Reward AI围绕Omnibody Hand设计人类数据接口,人类佩戴的版本负责记录自然操作,同样的7自由度功能设计也被用于机器人末端。

Omnibody Hand没有逐个复制人手关节,团队先保留几类常用能力:选择合适的接触位置,在手中调整物体姿态,以及在精细抓取和力量抓握之间切换。

拇指与食指可以对捏,也能分别屈曲;中指、无名指和小指在掌指关节处协同运动,配合拇指包住瓶子、盒子等物体。

这种结构把更多独立运动留给拇指和食指,其余三指共同承担包络抓握。7个自由度服务于具体操作,而不是复刻人手的关节数量。

图片

可穿戴版本还要适应不同人的手掌尺寸和手指比例,远端屈曲机构可以吸收手指长度差异,使用者不必逐人调整连杆。

这项设计与数据质量直接相关。

装置如果限制手指弯曲,或者在手上发生滑动,采集者就会改变原来的抓法,模型学到的也会变成人对设备的补偿动作。

Omnibody Hand采集的数据进入One Data Interface。

手内全局快门相机记录物体和场景,高频触觉记录接触,手指间接近度描述接触前的距离变化,位姿系统记录手部轨迹,力传感器则记录推、拉和负载。

人在传送带上分拣物体时,识别、伸手、接触和投掷会在很短时间内连续发生。相机可以看到物体的位置,但握住物体的瞬间、抓握是否稳定以及何时松手,还需要接近度、触觉和力信息补充。

手部轨迹同样要跟上人的速度,视觉惯性定位依赖相机更新,快速往返和突然变向时容易产生过冲。

Reward AI在视觉惯性跟踪之外加入电磁感知,并通过算法补偿环境中的电磁干扰。

团队让两套追踪器在两个固定机械限位之间运动,测试8种速度,每种速度重复10次。

在最高速度下,视觉惯性方案的平均过冲误差为24.9mm,加入电磁感知后降至9.5mm,下降60%,多次测试之间的误差波动也有所收窄。

图片

采集者可以保持原有操作节奏,快速伸手、反向移动和接触后的细小修正也能进入训练数据。OM‑1公开视频中的动作速度,首先从人类示范的采集环节开始保留。

03.

共同动作接口,连接不同机器人

OM‑1同时读取图像、触觉、手指间接近度和手部位姿轨迹。图像提供场景和物体信息,接近度记录接触前的距离,触觉反映接触位置和抓握状态,轨迹保留动作过程。

图片

各类信号按照传感器原有的频率进入模型,视觉负责更新场景,高频触觉和运动信号不必为了等待下一帧画面而被压低频率。

OM‑1还会读取一段时间内的历史信息。机器人判断杯子是否握稳、衣物折到哪一步,或者另一只手是否已经放好包装件,都要结合此前的接触和动作。

模型输出包括动作方向、速度、作用力,以及抓握、移动和松手等关键事件的时间。它描述机器人要怎样完成操作,而不是直接向所有本体发送相同的关节角度。

Reward AI还把不同阶段的人类示范统一成一种数据格式。

早期积累的示范和针对新任务补充的数据,都通过One Data Interface进入同一套训练流程,不再按照预训练、后训练或机器人本体分别处理。

公司称,OM‑1可以使用少于30分钟的人类示范学习一项新任务,包括带有复杂动力学和较长操作顺序的任务。

Reward AI还称,同一策略可以零样本迁移到小型机械臂、工业机械臂和人形机器人,不需要针对每种机器人重新微调。公开演示覆盖了这三类本体。

这些机器人使用Omnibody Hand作为共同末端接口。相同的手部功能和动作表达先缩小不同本体之间的操作差异,再由底层控制处理每种机器人在结构、动力学和执行器上的区别。

模型生成动作后,高频控制层负责驱动具体机器人,它处理机器人自身的动力学、外部扰动、系统延迟,以及速度和加速度变化。

这套控制层在仿真中通过强化学习训练。

机器人拉开阻力未知的冰箱门,或者搬起重量不同的箱子时,控制器会根据实际受力维持动作,再让身体回到目标轨迹。

图片

另外,控制层使用独立时钟。

OM‑1生成下一段动作时,底层控制仍会维持机器人运动。新动作到达后,控制层在线调整前后动作的衔接,减少高速投掷和摇晃中的停顿与跳变。

这套控制接口还覆盖移动机器人的导航动作,让人形机器人在靠近工作区、调整身体位置和操作物体之间保持连续运动。

Reward AI用分层系统实现“One Model”:OM‑1负责从共同数据中学习操作,高频控制层再处理每种机器人身体的执行差异。

跨本体依赖统一策略,也依赖本体控制。

04.

同一个模型,开始指挥更多双手

调酒演示把动作速度、双臂协作和长序列操作放在一起。

两台机械臂完成取冰、操作酒瓶和调酒器具、压紧容器、摇晃并倒入酒杯。抓取、按压、包络握持和快速摆动连续进行,任务在30秒左右完成。

图片

△ 两台机械臂连续完成摇晃与倾倒

而接头操作把任务缩小到锁止结构。机器人先处理带有锁止机构的软管接头,随后双手配合拔出以太网线。RJ45接头需要先压下卡扣,再保持按压并向外拔出,不能靠直接拉拽完成。

图片

△ 机器人握住并拔出带锁止结构的软管接头

图片

△ 两只手配合压下RJ45卡扣并拔出网线

四台机械臂协作包装手机时,每只手在同一工作区放置手机、配件和包装件,并完成位置调整与合盖。

Reward AI把这类任务称为quadmanual manipulation,即四只机械手共同操作。

图片

△ 四台机械臂在同一工作区协作包装手机

此外, Reward AI 还展示了任务受到干扰后的处理方式。

一只手出现偏差时,其他手会调整动作;一次操作没有完成,机器人会重新尝试;环境变化过大时,系统则停止继续执行。

四臂包装要求模型持续读取整个工作区的状态,一只手移动了包装件,另外几只手的目标位置和操作顺序也要随之改变。

折叠衣物考验模型对柔性物体变化的处理。

两台机械臂抓住布料不同位置,展开、调整、折叠,再把衣物放入收纳篮。布料被提起后形态不断变化,机器人需要继续调整抓点和动作。

图片

△ 两台机械臂协同展开并折叠衣物

高速分拣展示了另一种节奏。工业机械臂连续识别、伸手、抓取并投掷不同物体,手部根据目标大小在精细抓取和包络抓握之间切换。

图片

△ 工业机械臂连续抓取并投放不同物体

演示视频末段把OM‑1放到人形机器人上,机器人移动到货架前,弯腰、倾身、伸手取放物体,再转身离开。Reward AI将这项能力概括为全身操作与导航。

图片

△ 人形机器人移动到货架前,调整身体姿态并取放物品。

这些演示沿着同一条路线展开:人类示范提供操作数据,OM‑1生成共同动作,高频控制层再让不同机器人完成动作。机器人数量从一台增加到四台,身体也从固定机械臂扩展到需要移动和调整姿态的人形机器人。

Reward AI希望让操作数据摆脱本体更新周期。比如今天采集的一段人类示范,可以继续训练下一代机械臂、灵巧手或人形机器人,而不必随着硬件更换失去用途。

从DexCap到Omnibody Hand,团队把人类操作采集扩展到触觉、接近度和力;One Data Interface将这些信息变成统一数据;OM‑1与高频控制层再把操作送入不同机器人。

Reward AI把更多工程集中在数据进入模型之前,以及动作离开模型之后。中间只保留一套跨本体策略,这正是“Less is more”所指的取舍。

“One Model, Any Body. Less is more.”

一项人类技能能否进入更多机器人身体,取决于同一份数据可以复用多少次。OM‑1给出的答案,是先统一机器人学习操作的入口,再让不同身体各自完成执行。

点击查看全文
评论赞0分享
轨迹
机器人模型

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4