JavaScript is required

真机只占0.1%?光轮智能要让机器人「像人一样学习」

◎ 光轮智能押注机器人学习飞轮。

△ 撰文:董志洋

机器人进工厂后,没有多少犯错的机会。

大模型答错一句话,还可以从下一轮交互中获得反馈。自动驾驶模型作出错误判断,也能通过影子模式记录算法与人类驾驶员的差异。机器人一旦在产线上抓错工件、碰撞设备或停在流程中间,影响的是正在运行的生产系统。

WRC期间,光轮智能创始人兼CEO谢晨在世界机器人大会主论坛发表演讲。他没有从机器人能完成多少种动作讲起,而是把大模型、自动驾驶和机器人放在一起比较,讨论机器人为什么迟迟没有形成同等规模的持续学习系统。

谢晨给出了一项技术路线推演:未来具身智能可能需要10亿个实时生成数据或评测的“生成器”,其中约100万台是真实机器人,真机所占比例约为0.1%,人类行为与仿真环境将承担其余部分的数据和评测需求。

这个比例来自谢晨对具身智能任务复杂度的估算。按照他的设想,真机负责接触真实世界,人类数据扩大机器人能够观察的经验,仿真则提供反复试错的空间。

机器人数量还没有大规模增长,学习系统必须先运转起来。

光轮智能为此搭建了EgoSuite、SimFoundry、RoboFinals和RoboStack,试图让人类示范、仿真试错、能力评测和现场反馈首尾相接。

01.

真机撑不起全部学习

谢晨曾在Cruise负责自动驾驶仿真,也在英伟达从事过相关工作。2023年创立光轮智能时,他选择把自动驾驶积累数据、复现问题和验证算法的经验移到机器人行业。

汽车已经存在一百多年,自动驾驶公司不需要先生产数百万辆汽车,再去寻找数据来源,车辆每天行驶在真实道路上,人类驾驶员持续提供行驶经验。

影子模式进一步放大了这套数据基础,车辆由司机驾驶时,算法可以在后台同步运行,模型判断与司机操作出现差异,系统便记录相应片段,再带回云端分析。算法没有直接控制车辆,也能找到需要改进的场景。

大模型的条件更加宽松,它运行在数字世界中,可以使用互联网内容,也可以从用户对话和人工评价中积累反馈。一次错误不会损坏设备,也不会让生产线停下来。

机器人缺少如此庞大的本体基础。

不同机器人拥有不同关节、传感器和末端执行器,操作数据与具体硬件、任务和场景紧密相关。同一套动作换到另一种本体上,往往还要重新建立控制映射。

与此同时,真实环境也限制了试错规模。

机器人在实验室里可以反复抓取一个物体,进入工厂后却要服从生产节拍、安全规范和设备边界,现场会留下问题,却无法承担海量、无约束的失败。

谢晨用人的成长过程解释机器人需要什么。人先从言传身教中获得经验,在反复尝试中接受纠正,进入工作后继续根据结果调整行为。

光轮智能把这套过程拆成三个环节:人类提供示范,机器人在仿真中试错并接受评价,最后进入真实场景工作,再把失败和人工纠正送回训练系统。

按照谢晨的估算,具身智能的复杂度可能达到自动驾驶的1000倍,因此需要约10亿个数据与评测“生成器”,其中100万台真机占0.1%,其余学习需求由人类数据和仿真补充。

这是光轮智能选择同时投入数据、仿真、评测和部署平台的起点。

02.

99.9%的训练从哪里来

人类示范承担了第一部分数据供给。光轮智能将第一视角人类行为数据平台命名为EgoSuite。

光轮智能在WRC期间发布EgoSuite-Open100K,整套数据集规模为10万小时,覆盖7类环境、128类场景类型、超过1.5万个真实采集场景和超过1.5万项任务。

场景包括家居、餐旅、零售、运动、物流、办公和工业,任务覆盖清洁整理、包装、库存管理、工具操作、装配和维修等类别。采集者直接在真实空间里处理工具、容器、零部件和日常用品。

EgoSuite-Open100K主要分为EgoStandard和EgoPro两类。

EgoStandard以头部视角为主,记录人如何观察环境、寻找目标并推进任务;EgoPro增加腕部视角,补充手指接触物体时容易被手臂或物体遮挡的画面。

数据集整体提供手部位姿、全身位姿和事件级语义等标注,不同子集的标注内容有所区别。

Hugging Face的数据卡显示,EgoStandard计划开放9万小时,其中8万小时包含头部视角和手部位姿,另有1万小时增加全身位姿。EgoPro计划开放1万小时,提供头部与腕部双视角。

目前首批数据已经上线Hugging Face,后续内容将分阶段开放。项目也在AtomGit提供入口,允许学术研究和商业训练使用。光轮智能还计划将其捐赠给开放原子开源基金会孵化。

第一视角人类视频已经被更多机器人模型用于预训练。

Dyna Robotics在Dyna-2中使用超过100万小时人类第一视角视频,预训练阶段没有加入机器人数据。数据从1000小时扩大到100万小时后,模型在留出的人类视频和未见过的机器人数据上都表现出持续改善。

英伟达GEAR实验室的EgoScale使用20854小时第一视角视频预训练视觉语言动作模型,再加入少量人机对齐数据。在22自由度灵巧手测试中,最终策略的平均成功率比未进行人类视频预训练的基线高54%。

这些研究解释了光轮智能为什么选择在10万小时节点开放EgoSuite。机器人可以先从人类行为中学习物体如何被使用、任务如何推进,再通过少量机器人数据完成本体适配。

视频没有完整记录物体的摩擦、形变和受力。机器人看见人拿起纸杯,不会自然获得纸杯受压后的变化,也无法仅靠观看判断另一种抓握力度会产生什么结果。

SimFoundry则负责把真实物体、环境和任务转换成可以交互的仿真场景。

谢晨将其技术路径概括为“求解、测量、生成”。

“求解”来自仿真求解器。谢晨介绍,光轮智能已经开发刚体、部分非刚体及其耦合计算能力,并针对不同GPU平台进行加速。物体发生碰撞、接触或形变后,求解器计算新的物理状态。

“测量”发生在真实世界。光轮智能使用机械臂、灵巧手和触觉设备与物体交互,获取质量、接触、摩擦和形变等物理信息,再用于校准仿真资产。

外观相近的两个物体可能拥有不同的重量和表面特性,只有把这些差异带进仿真,训练结果才有机会迁移到真机。

“生成”负责扩充资产、场景和任务。光轮智能使用智能体组织3D内容生产流程,调整物体、材料、空间布局和任务条件,为同一项操作生成更多变体。

真实场景先提供人类动作、物体参数和任务规则,SimFoundry将这些内容转入仿真。机器人在仿真中训练后,再回到真实设备验证。

光轮智能将这条路径称为Real2Sim2Real。

03.

失败必须被测出来

仿真可以让机器人多做训练,却不会自动告诉开发团队模型进步了多少。一次成功的视频很直观,也很难回答机器人换一批物体、换一个环境后还能否完成任务。

光轮智能用RoboFinals组织规模化评测。

SimFoundry提供经过物理测量和校准的资产、场景与任务,RoboFinals再把产业需求转成可重复执行的测试。其评测栈可以运行在Isaac Lab-Arena和Newton等仿真基础设施上。

光轮智能政府及国央企业务负责人张鹏在WRC首发活动中,将具身智能中试所需的能力归纳为四项:可量化、可对比、可复现、大规模。

传统机器人测试通常围绕固定设备和工艺参数展开。具身智能系统中,本体硬件、模型、传感器、任务流程和环境状态都会改变结果。模型在一个场景中完成一次任务,只能留下一个成功样本。

RoboFinals覆盖工业制造、物流仓储、电力巡检、特种作业、商业服务和医疗康养等场景,可以调整物体位置、材料参数、环境条件、机器人本体和模型版本。开发团队能够重复运行同一任务,比较模型更新前后的结果。

光轮智能还与英伟达团队共同测试过Isaac Lab-Arena的并行评测能力。在4096个并行环境下,相关测试相对MuJoCo顺序执行取得13.5倍加速,将一组复杂操作任务的评测时间从10小时以上压缩到1小时以内。

WRC发布的RoboFinals中试基础设施采用更完整的项目口径。光轮智能称,平台可以把部分验证周期从月级压缩至小时级,并将评测中发现的失败模式重新用于数据采集、仿真任务生成和模型训练。

模型频繁抓错某类物体,系统可以补充相应的人类示范。在特定材质或光照下表现下降,SimFoundry可以增加对应场景,RoboFinals再用相同条件复测新模型。

标准化评测也影响数据如何销售。光轮智能联合创始人兼总裁杨海波在WRC演讲中提到,数据采集口径、标注方式、格式和时序不统一,不同来源的数据便难以合并训练。

按照杨海波公布的业务数据,光轮智能优质数据的复售倍数已经超过10倍,相关数据被30多家头部模型团队使用。模型客户复购率接近100%,部分头部客户的数据采购规模增长20倍。

光轮智能已经加入Newton技术指导委员会,并参与EgoVerse全球协作联盟。Newton由英伟达、Google DeepMind和迪士尼研究院发起,丰田研究院和光轮智能随后加入。

EgoVerse汇集佐治亚理工、斯坦福、Meta、Scale AI和光轮智能等高校与企业,推进第一视角人类数据的格式统一和跨本体训练。

在国内,光轮智能称其已主导或参与20项国家及行业相关标准,并参与《高质量数据集具身智能触觉数据采集技术要求》立项。

采集设备、数据格式和评测条件逐步统一后,同一批数据才能进入不同模型和机器人本体。

04.

部署以后,数据再回来

机器人通过训练和评测,还要进入真实场景。

光轮智能在WRC发布的RoboStack,负责把模型和机器人接入工厂、医院、仓储等工作现场。

RoboStack连接通用具身模型、机器人本体和光轮智能的数据与评测平台,系统支持模型后训练、强化学习和仿真到真机迁移,也支持不同机器人本体和场景接入。

在部署阶段,平台可以管理百台级机器人集群,进行任务下发、状态监控和安全告警。机器人无法自主处理现场问题时,操作人员可以远程接管并完成纠正。

机器人失败前后的状态、人工如何调整动作、任务最后如何完成,都会被保存下来。

现场数据随后进入下一轮训练,开发团队再在仿真中复现问题,检查新模型能否避开同类错误。

光轮智能解决方案副总裁张建伟展示了一套部署流程。

人类示范进入模型训练,模型通过仿真评测后部署到真机。现场出现问题,平台补采数据并更新模型,新版本完成仿真复测后再次部署。

在消毒供应中心的骨科器械套件整理任务中,RoboStack接入了Dexmate轮式机器人与夹爪、宇树H2与触觉灵巧手。两种机器人通过同一平台进入部署流程,处理器械识别、抓取和整理。

WRC首发活动期间,光轮智能还与吉利、五八赶集、新希望、阿尔特、宝通等企业签约,合作覆盖汽车、生活服务、农业和工业场景,后续将围绕真实任务部署、数据采集、机器人本体、算力和集成服务展开。

实验室可以提前摆好物体,真实工作现场会出现位置变化、设备误差和临时干扰。RoboStack收集这些运行记录,再交给EgoSuite、SimFoundry和RoboFinals补充数据、复现问题和重新评测。

光轮智能同时提出“5年100亿小时具身智能数据共建计划”。谢晨希望联合机器人本体企业、场景方、传感器和算力厂商及研究机构,统一不同设备产生的数据。

模型暴露问题后,平台再定向补采或生成数据,并调整人类数据、仿真数据、遥操作数据与真机数据的组合方式。

在光轮智能的技术路线中,10万小时开放数据提供一批可以立即用于训练的人类经验,100亿小时计划则试图把更多来源的数据纳入同一套标准和评测系统。

谢晨演讲中的0.1%最终落在一套明确分工上:人类数据提供操作经验,仿真扩大任务变化,评测持续暴露失败,真机负责检验模型在真实工作中的表现。

具身智能的下一轮竞争将深入模型训练之后。

机器人进入现场产生的数据能否被重新利用,开始影响模型更新速度,也影响同一套能力可以部署到多少本体和场景。

真机让机器人接触现实,持续学习系统决定它能从现实中带走多少经验。

-END-

点击查看全文
评论赞0分享
轨迹
光轮智能具身智能机器人

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4