JavaScript is required

小鹏IRON,亮出「大脑」

◎ 不只学动作,还能预演结果。

小鹏IRON的“大脑”,揭晓了。

小鹏机器人团队公开的XPACE,将动作预测与未来画面预测放进同一套模型,并通过模拟器生成恢复片段,为机器人补充偏离正常操作后的纠错训练。

在演示中,IRON伸手抓住烤面包机中的面包片,将它取出并放到盘子里,随后撤回右手。另一段视频里,机器人接近侧向打开的抽屉,将它推回箱体。

△ IRON从烤面包机取出面包片,放入盘中。

△ IRON将侧向打开的抽屉推回箱体。

叠碗任务需要接连完成两次抓取与放置,IRON先把绿色碗放进粉色碗,再抓起蓝色碗,放入已经套叠的两只碗中,最后松手撤回。两次放置在一条任务指令下连续完成。

△ 一次指令下,先放绿色碗,再放蓝色碗。

这些操作与训练数据之间有一层关系:抽屉没有出现在机器人训练集中,面包本身虽然出现过,但从烤面包机取出面包并放盘的任务没有机器人示范,团队通过人类经验训练模型,再将这些操作迁移到IRON上。

XPACE把人的操作经验用于机器人动作学习,又用模型生成的恢复片段补充训练,公开了IRON学习操作的一套具体方法。

01.

人的经验,怎样教给IRON?

XPACE使用5000小时具身视频,团队把数据分成四层,分别提供广泛的视觉经验、人的动作、与机器人任务接近的示范,以及目标机器人的控制记录。

△ 5000小时具身视频的四层数据体系;失败数据单独用于模拟器训练。

第一层来自真实环境中的第一视角视频,团队筛选交互丰富、与操作有关的片段,用来训练模型预测画面接下来怎样变化,即使没有动作标签,这些视频也能参与学习。

第二层进一步记录人的手部和手腕位姿,让模型在观察物体移动的同时,学习手怎样接近对象、抓住它并完成搬放;第四层则是IRON遥操作,将视频与机器人原生动作配对,为模型提供目标硬件上的执行记录。

连接人类示范与机器人遥操的,是第三层桥接数据。团队既从人类视频中选择与机器人任务类别接近的片段,也在相机视角、背景和物体布局近似机器人工作区的环境里采集示范。

例如,人和机器人都在执行搬放任务,操作对象与动作顺序有所重合,接近机器人工作区的采集环境又能减少画面差异,这类数据帮助模型把人的经验用于机器人操作。

此外,团队还单独收集了失败、任务进展不足和恢复过程的数据,只用于训练模拟器预测动作后果,不让机器人模仿其中的失败动作。

人的手与IRON的手,仍然使用各自的动作映射。

XPACE用共同格式记录末端位姿、手部关节运动,以及躯干和相机位姿,再由不同本体各自的输入输出模块处理运动学和动作维度差异,使人类与机器人数据能够共同监督动作预测。

语言描述也要与片段中的操作对应。由于一段短片可能只展示完整任务的一部分,团队同时保留整体任务指令、片段内的详细描述、局部动作命令和同义改写,早期训练较多使用详细描述,随后逐渐提高任务指令的比例,接近机器人实际接收的语言。

训练越靠近部署阶段,机器人与桥接数据的权重越高,但人类经验仍然保留在训练中。在相同的中间训练起点和最终训练预算下,持续使用人类数据共同训练,离线动作预测损失相对纯机器人基线下降14.0%,而先使用人类数据、最后只用机器人数据微调,下降幅度为8.5%。

人的示范覆盖了哪些行为,也会影响学习收益:在人类与机器人示范都丰富的行为组中,共同训练使动作预测损失下降10.0%;机器人示范缺失、但人类数据丰富的行为组中,下降22.7%。

人类数据较少的缺失行为组,下降幅度为10.8%,两类数据均缺失的行为组则为0.3%。这组结果呈现了人的操作经验覆盖范围与学习收益之间的关系。

△ 不同数据覆盖条件下的动作预测损失改善幅度。

02.

动作与未来画面,一起学习

XPACE采用非对称混合Transformer架构,由视频Transformer学习视觉变化,动作Transformer读取视频分支的多层特征并预测动作,动作训练也会更新视频分支。

同一个视频骨干,支持两种工作方式。

操作模式接收历史画面、当前状态和任务指令,联合预测未来视频及16步动作;模拟模式则接收指定的二维骨架控制与相机位姿,预测这些动作之后的画面。

△ 共享视频骨干支持动作预测与指定动作后的画面模拟。

在绿色与红色苹果的演示中,指令分别指定两种颜色的目标,IRON从木架上层混放的水果中取出对应对象,移到旁边篮筐并放下。这两段视频展示了操作模式中的语言指令跟随。

△ 按指令选择绿色苹果并放入篮筐。

△ 改为红色苹果指令后,选择另一目标。

模拟模式则根据指定的手部运动,预测对象和场景会怎样变化,团队可以据此生成新的操作片段,也能检查策略选择了哪个目标。

失败数据帮助模拟器学习不正确动作的后果。如果模拟器只见过成功示范,输入不正确的动作时,它仍可能倾向于生成成功结果,因此需要学习失败与恢复过程,预测不同动作实际可能带来的后果。

两种模式通过渐进训练形成。第一阶段在预训练视频模型基础上适配具身视频,只学习未来画面预测;第二阶段加入动作分支,每次更新以相同概率选择操作或模拟模式,无动作标签的片段监督视频,有动作标签的人类与机器人示范进一步监督动作。

△ 视频适配、联合训练与两条独立的后训练分支。

视频适配对动作学习的帮助也经过单独比较:各组使用相同的动作训练方法,接受八分之一阶段视频训练的模型,离线动作预测损失下降8.1%,完成全部阶段视频训练后,下降幅度为12.5%。零阶段曝光组仍保留原视频模型的预训练权重,比较考察的是额外具身视频适配。

△ 不同具身视频适配量,对离线动作预测损失的影响。

真机执行时,模型采用流式视觉编码与异步动作发布,IRON继续执行已经排队的命令,模型同时处理新画面并预测后续动作,再删除新旧计划重叠的部分,将后续动作平滑接入,部署方案以约10Hz发布插值后的控制命令。

在香蕉搬放、倒水和叠碗主测试中,XPACE平均成功率为68.3%,DreamZero为40.0%,GR00T为6.7%。

各方法每项任务执行20次,XPACE的三项成功率分别为80%、50%和75%,这组完整方法对照匹配动作监督语料,XPACE另接受了第一阶段的视频适配。

测试还记录了中间进展,XPACE平均任务进展为0.84,DreamZero为0.68,GR00T为0.36。机器人接触目标、提起物体和完成放置分别获得相应分数,只有完成整项操作才计入成功率。

△ 香蕉搬放、倒水和叠碗,每项每方法20次测试;XPACE另接受第一阶段视频适配。

另一组真机对照比较纯机器人训练与全数据训练,香蕉在五个固定位置上的搬放成功率从50%升至80%;积木入盒任务加入机器人训练语料未出现过的黄瓜、花和玩具鸭后,成功率从30%升至50%。

该对照同时加入人类经验和无动作标签视频,展示了整个数据配方对位置与干扰物变化的帮助。

△ 全数据训练与纯机器人训练的位置、干扰物对照。

03.

给成功示范补上恢复过程

成功示范主要记录沿正确路线完成任务的过程,机器人执行时一旦偏离,就可能遇到示范没有充分覆盖的状态,XPACE的后训练针对这些状态增加恢复经验,让策略学习怎样接回原来的任务。

团队先从专家轨迹中选一个位置,沿采样方向移动其中一只手臂的末端,持续8步或16步,再用相同长度回到原位置,由模拟器根据指定动作生成偏离与返回过程的画面。

合成的只有插入的偏离与恢复段,前面的画面和后续任务仍取自真实示范。策略训练片段从偏离最远的位置开始,包含困难状态、完整恢复,以及恢复后继续执行的动作。

连续生成会积累误差,模拟器原先使用真实记录作为训练上下文,生成时却需要依赖自己此前预测的画面,团队因此采用自梯度强制训练,让它在自身生成的历史画面中继续预测。

在193帧视频生成对照中,这项适配提高了图像质量与运动一致性,训练分布内视频生成耗时从119.7秒降至39.86秒,分布外视频从120.2秒降至36.44秒,该方案同时把每块采样步数从50步减至8步,这里统计的是视频生成时间。

△ 生成质量、耗时与显存对照,保留帧数及采样步数条件。

合成片段还要经过筛选,恢复后的画面既要比偏离时更接近原始状态,也要满足图像一致性要求。团队结合DINOv3视觉特征、峰值信噪比和结构相似性筛选,并用深度信息提高近处交互区域的权重,减少背景对评分的影响。

模拟器适配完成后保持固定,策略从原基础模型单独开始微调,训练配方混入8%合成恢复样本,其余92%沿用此前数据,微调不到一天。

香蕉搬放、倒水和递可乐的前后测试,每项各执行20次,平均成功率从61.7%升至86.7%,平均任务进展从0.81升至0.93;其中香蕉成功率从80%升至90%,倒水从50%升至95%,递可乐从55%升至75%。

三项任务平均成功率提高25个百分点,倒水提高45个百分点。这组实验评价的是加入恢复样本后的策略微调,测试采用香蕉、倒水与递可乐三项任务。

△ 恢复训练前后成功率与任务进展对照。

模拟也用于检查行为错误,策略输出动作后,模拟器生成后续画面,再将画面交给策略继续预测。

公开示例中既有正确选择红色水果和烘焙食品的情况,也有把绿色水果选成红色水果、把弯曲水果选成瓶子的错误,团队可以先检查这类目标选择问题,再安排真机测试。

04.

IRON年底规模量产,明年上市交付

小鹏前不久发布的XCoT则是其物理AI推理的另一项探索。

在8月27日第二代VLA版本体验日上,小鹏通用智能中心负责人刘先明提出:“模型理解物理世界,既要看见当下,也要记住过去、预判未来。”

XCoT以自动驾驶为验证场景,用2至6个紧凑的结构化决策标记参与轨迹生成,减少冗长自然语言推理的解码开销;小鹏将第二代VLA与世界模型列为物理世界基座的两大支柱,提出向自动驾驶、Robotaxi和机器人等本体延展。

XCoT探索决策推理怎样在有限时延内参与动作生成,XPACE则在IRON上研究操作学习与模拟恢复训练,两项工作分别呈现了推理接口和动作学习的技术选择。

模型研究之外,IRON的制造也在推进。9月8日,小鹏宣布机器人生产线正式启用,首台IRON完成自动化总装并自主走下产线。

图片

小鹏披露,产线核心制程自动化率超过80%,以规模量产目标正向开发,将汽车工业质量体系与机器人精密制造结合,强调关键工序的一致性,并为扩产做准备。

8月24日,小鹏机器人业务签署超过9亿美元的首轮股权融资协议,募集资金用途包括软硬件研发、物理AI模型训练、高质量数据采集及量产基地建设。

按照已公布计划,IRON将于2026年底进入规模量产阶段,2027年上市交付。小鹏计划先在旗下门店和园区开展商业应用,利用实际运行的场景数据和人类示教继续训练模型。

XPACE已经展示了两种经验怎样接入IRON训练:人的操作拓宽示范覆盖范围,模拟生成补充偏离后的恢复过程。而随着机器人进入门店和园区,训练所需的经验也将进一步来自实际使用现场。

-END-

点击查看全文
评论赞0分享
轨迹
人形机器人具身智能机器人学习动作预测世界模型

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4