JavaScript is required

李飞飞:机器人训练,走不了大语言模型的老路

◎ 李飞飞:机器人训练,不能照搬大语言模型。

△ 撰文:DONG.ZY

机器人行业已经做出不少精彩演示,难题是让机器人在真实现场稳定工作。

7月21日,李飞飞创办的World Labs宣布收购机器人与仿真公司SceniX。

一周后,在一场由a16z的Martin Casado主持的交流中,李飞飞与SceniX联合创始人李昀烛首次共同讲述双方走到一起的过程,并讨论机器人仿真、世界模型,以及机器人训练为何不同于大语言模型训练。

同一天,World Labs公布了R2S2R系统的早期成果,展示机器人如何在数字世界中训练、评测,再把策略迁移到真实硬件。

这笔收购还有一段前情。

SceniX最初是World Labs的客户,曾使用其世界模型Marble搭建机器人仿真环境。

双方在合作中发现,Marble能够生成空间一致的三维世界,SceniX则掌握机器人学习、物理仿真和真实任务重建技术。

SceniX由李昀烛、郑昌熙和胡晓晨共同创办。其中,李昀烛是哥伦比亚大学计算机科学助理教授,曾在斯坦福视觉与学习实验室从事博士后研究,与李飞飞、吴佳俊合作。

李昀烛在交流中表示,他一直希望机器人能更好地感知物理世界、与环境交互,并在真实场景中完成任务。

World Labs一直围绕空间智能和世界模型开发产品,收购SceniX后,这条技术路线进一步延伸到机器人训练与评测,让不同本体和策略模型进入数字环境,完成大规模训练和测试。

李飞飞看中的是机器人训练基础设施。真实工位能够提供的练习次数有限,数字世界则可以反复改变环境和任务条件,让模型暴露失败,再验证每次改进是否有效。

01. 

世界模型开始从“生成空间”走向“训练机器人”

World Labs成立之初聚焦空间智能,其核心产品Marble可以接收文字、图片或视频,生成具有空间一致性的三维世界,并以高斯泼溅、网格等形式表示。

这项能力最初主要服务内容创作和虚拟空间。机器人加入后,三维世界还要回答一个更难的问题:机器人对环境施加动作,环境会发生什么?

抓起纸箱、拉动线缆、打开盒盖,这些操作都会改变物体的位置和状态。重量、摩擦、形变和接触关系共同影响结果。一个看起来真实的三维场景,无法自动成为机器人训练环境。

SceniX的工作重点,是把真实任务重建为具有物理交互能力的仿真环境。

其R2S2R全称为Real-to-Sim-to-Real,即“真实到仿真再回到真实”。系统先将一项现实任务转成可交互的数字环境,再让机器人策略在仿真中训练和评测,最后迁移到真实硬件。

流程从现实任务开始,团队采集机器人本体、传感器、周围环境、操作对象和任务示范,重建一个与现场对应的交互世界。

真实环境很少提供完整、准确的参数。物体的形状、重量和摩擦系数可能存在偏差,相机和机器人也会与标称状态有所不同,线缆、包装和工具还会随着接触发生形变。

R2S2R会根据任务选择不同的表示和建模方式,再通过开环动作验证仿真与现实是否对齐。

同一组动作分别在数字环境和真实机器人上执行,团队比较机器人看到的画面、物体运动以及任务结果。

画面逼真只是基础,真正影响机器人训练的是,同一个动作能否在两个环境中引起接近的物理变化。

World Labs展示的对象包括箱体、试管和铅笔等刚性物体,也包括电源线、弹性线缆等可变形物体。

在双臂装箱任务中,仿真环境和真实环境执行相同动作序列,纸箱的移动过程与任务结果保持接近。

线缆任务则涉及滑动、布线、插接和持续接触,对几何、摩擦与形变建模提出了更高要求。

Marble负责生成并表示空间一致的世界,SceniX继续加入任务结构、物理交互和评测能力。

李飞飞希望构建的世界能在空间、时间、视角和交互上保持一致,让机器人在其中观察环境、执行动作,并看到动作产生的后果。

世界模型由此进入机器人训练和评测环节,它生成的不再只是一片可观看的空间,也是一套可供机器人使用的交互环境。

02. 

机器人更缺可控的失败经验

大语言模型可以从互联网上获得海量文本,机器人没有同等规模的动作数据。

每采集一段真实机器人数据,都要占用硬件、工位和操作人员,任务失败后,工作人员需要扶正物体、整理环境、恢复机器人状态,有些失败还会引起碰撞,增加硬件维护成本。

训练之外,评测同样依赖真机。模型更新一次,团队就要重新测试,确认性能有没有提高、旧能力是否退化、机器人会在哪些条件下失败。

李飞飞认为,机器人训练与语言模型训练存在明显差异。互联网视频记录了大量人类行为,却无法系统覆盖不同物体位置、光照、摩擦条件、机器人状态和失败边界。

仿真可以提供现实数据中较少出现的反事实经验。一段真实视频只记录已经发生的动作,仿真则允许机器人更换抓取位置、运动轨迹或作用力度,再观察物体状态如何变化。

R2S2R把一个真实任务重建完成后,可以继续调整外观、物体布局、杂乱程度、物理属性、机器人初始状态和相机视角,一项任务由此扩展出大量可控变体。

机器人还可以从仿真中获得真实采集较难提供的信息,包括精确的物体状态、接触位置、受力、可见性,以及采用另一种动作可能产生的结果。

在ALOHA双臂装箱任务中,World Labs先从真实任务重建仿真环境,策略训练阶段全部使用仿真数据,随后将策略直接迁移到真实ALOHA机器人。团队还改变现场光照,测试同一策略对视觉扰动的适应能力。

其他测试覆盖了多种机器人和操作任务。RB-Y1双臂机器人围绕冰箱整理和插接电源线,YAM机器人完成线缆滑动、布线、插入和拔出,Flexiv机械臂转移试管,xArm则从密集堆放的物体中逐个取出马克笔和铅笔。

这些任务对接触状态很敏感,试管转移需要较高的位置精度,细长物体容易相互遮挡,线缆则会在拉动过程中持续改变形状。

World Labs公布的结果显示,RB-Y1、YAM、Flexiv和xArm对应的上述任务分别在真实机器人上连续自主运行一小时,其间没有人工介入。

R2S2R可以接入固定机械臂、移动操作机器人、单臂或双臂系统,也可以适配夹爪和其他末端执行器。模型端同样能够采用不同策略架构。

一项现实任务完成数字化后,团队更换本体、传感器或模型,仍能继续利用已有环境训练和评测。李昀烛将其定位为机器人学习基础设施,World Labs提供训练环境,整机厂商和模型团队把自己的本体与策略接进来。

借助这套系统,机器人可以先在数字环境中进行大规模试错,再把筛选后的策略送回真实工位验证。

03. 

仿真正在进入机器人模型的评测环节

仿真训练在自动驾驶、无人机、火箭和四足机器人领域已经得到广泛使用。SceniX展现出的另一项能力,是用仿真结果帮助团队筛选机器人模型。

一次训练通常会产生多个模型检查点,团队需要判断哪一版更好、某次改动是否引入退化,以及模型的能力边界位于什么位置。

如果全部依靠真实机器人完成评测,每个检查点都要占用硬件和人员,模型迭代速度会被真机测试直接限制。

R2S2R在ALOHA双臂方块交接任务上进行了对照测试,每个模型检查点执行2000次仿真测试,其中1000次位于后训练数据的分布内,另外1000次使用分布外位置;真实机器人执行100次测试,两类位置各50次。

在不同策略架构、训练配置和检查点之间,仿真评测保留了与真实硬件相近的性能排序,也呈现出相似的成功区域和失败区域。

机器人团队可以先在数字环境中筛选模型,仿真负责找出更好的检查点、捕捉性能退化,并定位容易失败的空间区域,真机测试则集中验证更有希望的模型。

在方块交接任务中,某个策略没有抓住方块中心,而是抓在靠近边缘的位置,它在仿真和现实中都出现了接近失败、最终仍完成任务的过程,对应的失败行为也同时出现在两个环境中。

团队由此可以观察策略从哪里开始偏离,以及哪些状态容易把一次正常操作推向失败。系统找到策略的薄弱区域后,针对这些区域生成新的交互经验,完成训练后再次评测,再把筛选出的策略送到真实机器人。

SceniX与World Labs已经开始面向实际客户推进这套工具。

部分客户只需要Real-to-Sim,把具体任务数字化,用于评测已有机器人;另一些客户希望使用完整的R2S2R流程,将训练后的策略部署到硬件。

这些客户使用的机器人形态和模型并不统一,处理的任务已经接近部署阶段。

李飞飞给出的两年目标,是在少数重要垂直场景中完成客户验证,让这套基础设施解决具体的自动化需求,并形成可以继续复制的项目。

双方还准备在旧金山和纽约办公室部署机器人,用于测试工程系统以及远程支持客户的能力。

R2S2R要走向交付,需要处理现场采集、任务重建、本体适配、策略训练、仿真评测和真机迁移。

李昀烛认为,现阶段更适合机器人落地的是仓库、餐厅和酒店等半结构化环境,这些场景可以控制一部分设备和流程,同时仍要处理位置变化、人员走动和物体差异。

机器人应用通常从结构化环境逐步进入半结构化环境,再向家庭等非结构化环境扩展。

家庭机器人的任务空间更开放,人形本体具备较强通用性,也会同时面对硬件、控制和能效问题。

R2S2R因此采用与本体解耦的设计,可以同时服务不同机械结构和任务场景。

近期机器人商业化可能由多种专用本体率先推进,训练基础设施需要适应这种分散的硬件形态。

被问到World Labs会不会开发机器人基础模型时,李飞飞没有排除这种可能。

她认为,机器人基础模型需要处理多模态输入、世界状态和动作。动作作为输入时,模型可以预测环境如何变化;动作作为输出时,模型则要生成实现任务目标的行为。

World Labs目前首先推进的是机器人训练环境,它让不同本体和模型获得可训练、可评测的数字世界,并继续探索世界模型与机器人策略的结合。

过去一轮具身智能竞争集中在本体、VLA模型和真实数据采集。

World Labs与SceniX正在补上另一块基础设施:把现实任务转成可以重复调用的数字资产,用同一个世界训练不同策略、适配不同机器人,并减少低效的真机试错。

真实环境负责提出任务、校准仿真并检验最终结果,数字世界负责放大每一次真实经验。

当机器人公司都在寻找更多数据时,李飞飞选择先扩充机器人能够学习和犯错的世界。

-END-

点击查看全文
评论赞0分享
轨迹
World LabsSceniX机器人训练

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4