JavaScript is required

松延动力,开始做「大脑」

◎ 不只造机器人,松延动力还要让机器人“想过再动手”。

△ 撰文:董志洋

机器人动手之前,能否先预演几种结果?

9月8日,松延动力发布通用具身智能技术品牌Scalabot,同步推出HERON技术架构体系下的首个世界模型HERON-World Model。

过去三年,松延动力持续投入机器人结构设计、运动控制、供应链与制造。现在,松延动力开始通过Scalabot展开具身“大脑”业务。

HERON是覆盖空间智能、世界模型与行动智能的技术体系。此次发布的HERON-World Model,首先处理一个具体问题:当机器人采取某个动作之后,世界会怎样变化。

同样面对一扇冰箱门,伸手的位置、拉动的方向和幅度不同,接下来的运动也会不同。

模型接收当前画面、可用的历史观察与本体状态、任务指令和候选动作,生成相应的未来视频。保持起点不变,替换动作,便可以比较不同的预测结果。

这为机器人选择动作提供了一条路径:在实际执行前,先预演不同做法可能带来的后果。

01.

同一起点,预演不同未来

在一组多米诺骨牌演示中,HERON-World Model根据相同的初始画面与不同动作条件,生成了不同的骨牌运动结果。

动作的方向、幅度和时序,成为未来视频预测的明确条件。

图片

开冰箱的演示进一步呈现了空间变化。随着拉门动作推进,预测画面逐渐露出内部隔板、瓶子与食物。

模型需要让门体转动与动作相对应,并生成初始视角中未充分显露的区域。

图片

夹爪操作布料则涉及另一类变化。布料没有固定形状,随着夹爪移动、闭合,预测画面中的布料发生堆叠,表面出现褶皱。

模型需要处理操作端运动与柔性物体形变之间的关系。

图片

动作发生后,已经改变的物体状态还要保持下去。

在纸杯盖合演示中,手部遮住杯子再移开,生成画面继续保持杯子的位置与已经盖上的杯盖。

图片

绘画演示则呈现前后操作的联系:画笔先蘸取颜料,随后在纸面留下颜色。

图片

HERON-World Model还展示了平板游戏中的后续状态预测,以及双人托布、气球交互和翻绳等多智能体场景。

两人共同操作时,模型需要同时呈现参与者的动作与物体响应;更换动作条件,生成的交互过程也随之变化。

图片

量化评测方面,Scalabot采用WorldArena 1.0 Track 1开源测试方案开展离线评估,报告综合得分75.80。

团队还在EgoDex、AgiBot与RoboTwin划分的测试集上,报告了涵盖重建质量、时序表现、几何精度和交互控制等六个方面的13项指标,考察人类第一视角操作、真实机器人与仿真场景中的预测表现。

02.

动作标注不全,也能训练

这些预测能力,需要来自不同场景的交互经验。HERON-World Model采用三层预训练数据金字塔:真实机器人遥操作、基于真实场景重建的仿真,以及第一视角人类操作视频。

图片

真实机器人数据提供同步视频、本体状态和控制记录,建立动作与实际结果之间的对应,覆盖单臂、双臂、轮臂和人形等不同构型。

仿真通过改变初始状态、对象与动作组合,补充真实采集中难以反复覆盖的稀有状态、危险交互和失败轨迹。

人类视频则扩展了日常操作的范围,家庭物体、工具使用、双手协作,以及烹饪、整理和装配等活动,都可以提供交互经验。

但这类视频没有标准机器人控制日志,团队需要从画面中恢复头部相机运动、左右手腕的位置与朝向,以及十个指尖的三维位置。

数据来源扩大以后,首先要解决的是动作如何对齐。

机器人可能记录关节目标,人类视频得到的是手腕与指尖轨迹,相机和底盘还会同时移动。同一个动作,在不同数据中可能采用不同坐标和记录频率。

数据管线先以视频时间为基准同步信号,再通过正向运动学将关节目标转换为末端位姿,结合手眼标定与相机外参,统一空间参考、坐标轴、单位和旋转表示。

经过编码,异构动作转换为固定维度的Action Token,供模型使用。

统一表示仍保留操作器的差异。机器人数据保留夹爪开合或位置目标,人类视频保留指尖位置。手腕不动时,手指仍可能捏合、拨动或调整握姿,只记录手腕轨迹会丢失这些信息。

因此,操作端整体运动与精细操作信号需要一同进入模型。

HERON-World Model也没有把完整动作标注设为所有视频的训练门槛。

清洗管线先检查视频完整性、镜头连续性、重复内容和时间信息,再根据可见性、重投影误差、轨迹连续性及尺度稳定性,逐时刻、逐分量检查动作质量。

某个指尖被物体遮挡,可以只屏蔽对应时段的标签,保留清晰可见的手腕、其他指尖和相机运动。一只手恢复失败,也不必连带丢弃另一只手的可靠轨迹。

通过检查的视频,按标签情况进入完整动作、部分动作或动作标签缺失三种训练状态。

完整标签提供充分的动作条件,部分标签约束可靠分量;视觉有效但动作不可用的视频,仍可利用其他条件参与视频预测训练。缺失组件使用专门表示和有效性标记,与真实的零位移区分。

团队还以每个片段的首帧为固定参考,描述后续时刻相对于起点的位置和朝向变化。

对于从画面恢复的轨迹,中间一帧异常可以局部屏蔽,后续可靠位置继续提供监督。长视频切成有限长度的片段,参考帧本身也接受质量检查,减少估计误差对训练的影响。

03.

语言与生成,分工处理

模型既要理解“打开冰箱”这样的任务要求,也要根据具体动作预测门体、手部和周围画面的变化。身体或相机移动影响整幅画面,指尖接触和布料褶皱则要求恢复局部细节。

HERON-World Model通过MoT与MoE两层分工处理这些需求。

图片

MoT连接语言分支与视频生成分支。

预训练视觉语言模型VLM的语言分支处理任务指令,其参数及语言侧MoT参数保持冻结;扩散Transformer,也就是DiT生成分支,接收历史画面、本体状态、动作和带噪的未来视频表示,学习执行动作之后的视觉变化。

信息通过单向注意力从语言分支传入生成分支。

DiT在各层读取语言特征,使任务要求持续参与预测;候选动作与生成噪声不会反过来改变本次计算中的语言表示。两条分支保留各自的注意力投影、归一化和前馈参数。

这样可以复用已有语言知识,同时训练新的交互预测能力。同一条任务指令的语言特征,还能在不同候选动作和多轮去噪之间复用,减少重复编码。

生成侧的MoE采用高噪声与低噪声两套专家。

高噪声阶段侧重建立场景布局、大尺度运动和物体的主要位移;进入低噪声阶段后,另一套专家继续恢复物体边界、局部几何与精细交互。

每个去噪步骤只运行一个生成专家,两套专家使用相同的输入输出接口,按当前噪声阶段切换。

模型可以增加总生成容量,而单步计算仍由其中一套专家完成。拉开冰箱时的门体运动与手部接触、操作布料时的整体位移与表面褶皱,正包含了这些不同层次的预测需求。

训练时,历史视觉与可用本体状态作为不加噪的观察条件,生成分支学习恢复未来视频。

团队还会遮蔽部分有效动作输入,让模型结合其余动作、历史观察和任务语言进行预测,适应动作信息不完整的情况。

04.

预测结果,参与动作选择

在“将绿色积木叠放到蓝色积木上”的应用示例中,策略或规划器先提出多组候选动作,HERON-World Model分别预测相应的未来视频。任务评分器比较结果与目标的符合程度,再选出得分最高的候选。

世界模型负责预测后果,评分器负责评价,策略据此选择动作。

图片

另一种用法是连续模拟任务。

面对“先将红色积木移到中央,再把绿色积木叠放其上”的指令,策略生成一段动作,世界模型预测执行后的画面。策略再读取预测视频的最后一帧和最近的观察画面,生成下一段动作,让伸手、抓取、搬运和堆叠逐步衔接。

图片

这种推演也可以与真实执行结合。

滚动时域规划每次只执行选中动作的一小段,随后读取新的真实观察,再预测和比较下一批候选。

改变动作方向、幅度或执行时序,还可以生成不同的预测轨迹,用于分析失败过程与恢复尝试。

进一步接入奖励反馈和强化学习后,世界模型还可为策略训练提供模拟交互环境。

模型业务也将与松延动力的本体研发协同。公司计划在硬件定义阶段考虑智能系统对传感器、算力、自由度与数据接口的需求,通过统一动作表示和跨平台架构支持不同构型。

Scalabot将家庭服务作为重要场景,并向商业服务延伸;真实环境重建与3D资产构建也在其持续推进的方向之中。

交互记录的用途正在从学习动作,扩展到比较动作后果。

同一段经验可以帮助机器人学习怎样执行,也可以参与行动前的推演,让策略在几种候选做法之间作出选择。

松延动力从本体延伸到“大脑”,此次首先给出的,就是这样一个预测接口。

图片

未来,Scalabot还将陆续发布HERON系列模型,围绕空间智能、世界模型与行动智能,进一步拓展机器人理解环境、预测变化和自主行动的能力。

点击查看全文
评论赞0分享
轨迹
机器人松延动力

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4