JavaScript is required

一头连着真实场景,一头连着机器人模型,觅蜂如何生产「机器人教材」

◎ 2万套MEgo、100万小时数据...

△ 撰文:董志洋

夹取一块松软的甜点,手上的力稍大,甜点会变形;力气不够,又可能在移动时掉下来。

人会根据手感随时调整,机器人想学会这项操作,需要看到物体和手的位置,也要知道夹爪用了多大力、物体随后发生了什么变化。

在觅蜂科技的直播现场,一名体验者使用MEgo Gripper夹取甜点并完成装盘。夹爪同步记录操作画面、运动轨迹、开合程度和接触信息。体验者第一次没有夹稳,调整力度后才把甜点送到指定位置。

直播中的另一处采集现场位于上海浦东的一家员工食堂,工作人员佩戴头部和腕部设备,在收拾餐盘、擦拭桌面和整理物品时记录动作。药品摆放、商品整理等工作也采用了类似方式。

8月31日,觅蜂科技第20,000套MEgo无本体数据采集设备下线。觅蜂科技董事长兼CEO姚卯青将这套设备交付给京东科技集团副总裁何鹤,设备将进入京东的真实业务场景。

觅蜂当天还公布了一组数据:公司累计生产的高质量无本体数据已经超过100万小时,覆盖22类场景、1万多个真实环境、5万多种物体和500多类细分任务。

2万套设备把数据采集带进更多工作现场,百万小时则来自这些设备记录的人类操作。

原始视频还要经过空间重建、动作切分和质量评价,才能成为机器人模型可以使用的数据。

01.

设备跟着人进现场

觅蜂成立于2026年2月,4月发布MEgo系列产品、MEgo Engine数据处理系统和“蜂巢数据共创行动”。截至8月底,2万套MEgo已经陆续进入家庭、办公、零售、生产和餐饮等场景。

机器人遥操作采集通常需要机器人本体、控制设备、操作人员和相应场地,无本体采集则把记录设备交给正在工作的人,比如食堂工作人员正常收拾餐盘,门店员工照常整理商品,设备在工作过程中记录第一视角画面和双手动作。

觅蜂科技副总裁李茂青介绍,MEgo由MEgo View和MEgo Gripper两类采集硬件组成,同时配有MPR算法、MEgo Engine和数据运营平台。

MEgo View包含头部设备和腕部设备。

头部设备提供超过300度的视野,记录操作者所处的环境;腕部相机靠近双手,用于补充头部视角容易遗漏或被遮挡的手物交互。

各路图像分辨率为200万像素,最高帧率为60fps,设备中的7个传感器采用硬件同步。觅蜂公布的测试结果显示,99%以上的数据时间偏差控制在0.5毫秒以内。

头部相机、腕部相机和惯性传感器如果时间没有对齐,同一动作会出现在不同时间点,后续系统很难准确判断操作者何时接触物体、何时开始移动,以及画面变化对应哪一次动作。

MEgo View采用无线连接和可快速更换的电池,采集现场没有外部网络时,设备可以通过自组网继续工作,避免布线和固定工位限制工作人员的活动范围。

MEgo Gripper采用手持夹爪形态,采集第一视角视频、夹爪开合、六自由度运动轨迹和触觉信息,产品同样支持200万像素、60fps图像采集,并配有三维触觉感知。

MEgo View记录人如何观察环境、组织动作,MEgo Gripper记录夹爪怎样接近和接触物体。

甜点装盘中的抓偏、夹轻和用力过大也会保留下来,模型可以从动作结果中分辨不同操作造成的差别。

02.

百万小时来自分散的真实岗位

觅蜂公布的百万小时数据全部来自开放环境中的真实采集 ,居住、办公、零售、生产、仓储、餐饮、文娱休闲和交通出行等8类高频场景约占总量的82%。

其中,居住场景约17万小时,办公约14万小时,零售和生产场景各约13万小时。其余数据覆盖公共服务、物流、医疗、教育、养老、文旅、汽车服务和农业生产等场景。

按采集方式划分,第一视角裸手数据约50万小时,占50%;头部与腕部联合采集约35万小时,占35%;第一视角与UMI形态夹爪联合采集约15万小时,占15%。

裸手数据主要记录自然操作和任务意图,腕部相机补充双手附近的画面与连续运动轨迹,夹爪数据记录更接近机器人末端执行器的位姿、开合和接触过程。

百万小时数据还包括RGB图像、深度、惯性、触觉和音频。姚卯青在现场将其概括为“真实、全面、立体”,强调数据来自真实工作,覆盖多种任务、物体和感知信息。

姚卯青在圆桌讨论中表示,语言和图像模型可以从互联网获得大量现成内容,机器人所需的操作经验并不会自然留在网上。觅蜂需要通过采集设备,把人类在物理世界中积累的技能重新记录下来。

他估算,目前机器人数据与语言模型使用的数据规模相差四至五个数量级,未来物理AI可能需要数千万甚至数亿小时的数据。

何鹤以京东此前的项目经验为例,介绍了机器人遥操作的数据产量。人员工作8小时,有效数据有时只有约1小时,同时还要承担机器人运行、人员和场地成本。

现场工作人员佩戴MEgo后,可以在正常工作中同步采集数据。姚卯青给出的估算是,工作人员工作8小时,部分岗位可以形成5至6小时数据。

机器人尚未进入的岗位,也可以先记录人怎样完成工作。无本体设备增加了数据来源,也让真实场景中的操作变化保留下来。

03.

视频进入模型前,要先恢复动作

第一视角视频记录了操作过程,却不会直接给出双手的三维位置、身体姿态、夹爪轨迹和物体深度,机器人模型需要这些信息来还原动作。

觅蜂为MEgo开发了统一算法MPR,全称为MEgo Physical Reconstruction。MPR处理头部、腕部和夹爪数据,输出头部轨迹、人体姿态、手部关键点、夹爪位姿、深度信息和三维场景结构。

在觅蜂公布的评测中,MPR对头部、手部和夹爪轨迹的重建误差均小于1厘米,环境稠密深度达到亚厘米级,三维场景可以实现可视级还原。

觅蜂科技技术负责人刘力在演讲中进一步介绍,系统对人体和手部关键点的重建误差小于5毫米,数据映射到特定机器人后,末端执行器的跟踪误差小于10毫米。

经过重建,视频中的“拿起杯子”会增加一组可以计算的信息:手从什么方向靠近,抓握姿态怎样变化,杯子经过哪条轨迹,最后停在哪里。

MPR处理后的数据进入MEgo Engine。

刘力将数据处理分为预处理、空间感知、原子动作标注和质量评价,涉及时间对齐、轨迹重建、人体关键点估计、任务拆分、动作映射和数据评分。

真实工作记录通常持续一小时以上,部分视频长达两至三小时。系统融合视觉、惯性和语音信息,把长视频分成完整任务、子任务和单个动作,并为每一层补充语义标注。

觅蜂目前可以识别120多种原子动作,包括抓取、摆放、释放等。泡茶中的倒水可以被单独切出,再用于咖啡制作等包含相近动作的任务。

一段连续工作就此拆成较小的技能单元,模型可以分别学习抓取、移动和倾倒,也可以在训练长任务时重新组合这些动作。

手部重建是MEgo Engine中的一项重点技术。

真实工作中的手经常被物体遮挡,也会快速进出画面,工业手套、清洁泡沫和多人双手交互还会改变手部外观。

觅蜂为此开发了HandPose,该技术结合五目全景感知、手部追踪、三目深度融合、参数化手部重建和相机轨迹恢复,输出手部关键点和连续运动轨迹。

在公司公布的内部评测中,HandPose的PA-MPJPE手部重建误差为4.29毫米,相比次优对照方案降低62%;相邻画面之间的轨迹抖动为1.11毫米。

觅蜂还使用120Hz光学动作捕捉设备建立评测基准。经过时间同步和手眼标定后,真值定位精度达到0.15毫米。系统再将算法输出与真值轨迹对照,检查头部轨迹和手部关节误差。

直播展示了美甲、奶茶制作、宠物洗护和模具维修等案例。HandPose需要在他人双手介入、大面积遮挡、快速运动、泡沫覆盖和厚手套条件下持续恢复手部动作。

04.

失败操作也可以进入训练

数据完成重建和标注后,还要经过ManiEval评价。系统从数据类型、任务类型、传感器质量、语义质量和动作质量五个方面打分。

刘力将ManiEval的处理原则概括为“不过滤,只分级”。

动作准确、轨迹稳定的数据用于模仿学习和策略训练;场景与语义信息丰富的数据用于预训练和特征学习。

真实工作中的不规范操作和失败记录可以用于训练进度判断与错误识别,少见场景和边界样本则用于测试模型面对陌生情况时的表现。

物体滑落、抓握位置偏移和任务被打断,都会留下错误发生前后的状态变化。模型学会识别这些变化,才有机会在执行过程中调整动作。

觅蜂还介绍了REMORA任务进度模型和Value Model。

REMORA判断机器人已经完成哪些步骤,并识别执行中的错误;Value Model从真机运行数据中筛选失败和困难案例,再把有训练价值的片段送回数据系统。

刘力在演讲中将这个过程描述为:模型进入真机执行任务,产生新的交互数据;系统识别进度、错误和失败片段,再用这些数据更新模型。

05.

从京东的工作现场,到腾讯的模型训练

第20,000套MEgo交付后,京东将其放入真实业务场景。

何鹤把京东的角色概括为数据使用方、采集方和场景提供方。

京东拥有物流、零售等业务,既需要机器人数据,也能提供持续发生的真实操作。

何鹤在圆桌中说:“让机器人真正去干活,它要学人怎么干活;真实环境里的数据就是教材。”

与此同时,觅蜂还与腾讯Robotics X实验室签署合作协议,双方将围绕无本体数据开展合作。觅蜂向腾讯提供采集硬件和数据产品,为具身模型训练提供支持。

腾讯Robotics X实验室产品生态负责人朱亚娟表示,团队从2024年底开始考虑跨本体问题,希望一套模型可以用于不同机器人。

第一视角数据帮助模型理解物理环境,“第一视角+夹爪”数据则可以替代一部分使用机器人本体采集的遥操作数据。

觅蜂向腾讯提供的数据将用于多模态模型和具身模型训练,涉及语义理解、环境认知、决策规划和执行控制等环节。

京东提供实际岗位和操作任务,腾讯把数据送进模型,觅蜂负责记录、重建和整理人类经验。MEgo设备、数据产品和处理服务共同组成这门生意。

姚卯青在现场说:“让全世界的数据为AI所用,加速智能体时代的到来。”

2万套MEgo已经进入家庭、办公、零售、生产和餐饮等场景,百万小时数据经过MPR、HandPose、MEgo Engine和ManiEval处理后,开始服务模型公司和机器人团队。

机器人学习新任务需要真实操作作为参照,觅蜂要做的是把原本散落在不同岗位中的工作经验记录下来,整理成模型能够读取和训练的数据。

随着设备继续进入新的场景,这本“机器人教材”也会继续增加任务、物体和失败案例。

-END-

点击查看全文
评论赞0分享
轨迹
觅蜂科技京东科技腾讯

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4