JavaScript is required

戴盟不只卖传感器,也开始训练机器人的“手感”

◎ 戴盟把触觉做进世界模型。

△ 撰文:DONG.ZY

戴盟的最新一轮融资,紧跟在一款触觉世界模型之后。

8月11日,戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投。

前一天,戴盟刚刚发布触觉锚定世界模型Daimon-TWM,并将其称为全球首个以触觉贯穿认知、预测和控制的世界模型。

这已经是戴盟两个月内完成的第二轮融资。今年6月,公司刚获得亿元A轮融资,由汇川产投与中国电信联合投资。

加上此前进入的中国移动链长基金、招商局创投和联想创投,戴盟背后的产业资本已经覆盖工业自动化、通信网络、智能制造和物流等多个环节。

戴盟这家公司从视触觉传感器起步,随后建设触觉数据采集网络,现在又推出世界模型。它想解决的问题,正在从“如何让机器人感受到接触”,转向“如何让机器人理解并利用接触”。

Daimon-TWM参数规模达到10B级。戴盟称,模型可在NVIDIA RTX 5090上实时推理,并具备适配不同机械臂和机器人本体的潜力。

模型接收视觉、语言和触觉信息,判断机器人当前有没有抓稳、物体是否滑动、插接件是否已经卡住。它还会预测继续施力或移动后,接触状态将如何变化,再据此调整动作。

以视频为核心的世界模型通常预测画面和场景状态如何变化,Daimon-TWM则把预测延伸到机器人与物体之间的接触。

基于此,机器人多了一套围绕物理交互运行的控制过程:先读懂当前接触,再预测下一次接触,最后根据真实反馈修正动作。

01.

触觉不能只做附加项

视觉擅长识别物体、判断位置和规划路线。

机器人靠近一个杯子时,相机可以看到杯子的形状、颜色和大致距离,却无法直接判断杯壁已经发生多少形变,手指是否即将打滑,继续用力会不会把杯子捏扁。

接触开始后,许多关键信息还会被机器人自身遮挡。

USB插入接口时,相机看不到接口内部的细微偏差;齿轮套上轴后,视觉也很难判断齿面是否已经咬合。花瓶擦拭看起来只是让海绵沿着曲面移动,机器人却要持续调节压力,让海绵贴住表面,又不能把花瓶推倒。

这些任务有一个共同难点:机器人已经碰到物体,却不知道接触正在朝什么方向变化。

目前的视觉、语言、动作模型通常一次生成一段动作,机器人执行完这段动作,模型再观察环境并规划下一步。

在搬运刚性物体等任务中,这种方式可以正常运行,进入插接、装配、擦拭和柔性物体操作后,接触状态的变化速度可能快于大模型的推理速度。一个很小的偏差如果没有及时修正,很快就会变成卡住、滑落或碰撞。

今年6月,UC Berkeley、NVIDIA、Stanford等机构联合发布T-Rex,李飞飞、Jim Fan、Ken Goldberg、Pieter Abbeel等研究者参与署名。

图片

T-Rex处理的正是机器人如何利用高频触觉完成灵巧操作。

模型先使用22889小时第一视角人类视频进行预训练,再加入100小时同步触觉的双手机器人遥操作数据。后者包含207种日常物体、22种基础动作和7755段操作轨迹,同时记录图像、触觉、机器人状态、动作和语言指令。

T-Rex将控制拆成两种速度。

动作模块以较低频率生成整体动作,触觉模块以更高频率读取接触变化,并在原动作上进行小幅调整。

机器人无需等待下一轮完整视觉推理,便可以根据滑动、形变和受力突变修改动作。

在翻书、挤牙膏、擦鸡蛋、拆卡片、旋拧灯泡等12项任务中,T-Rex的平均成功率达到65%,表现最好的对照模型EgoScale为35%。移除触觉后,T-Rex的平均成功率降至42%。

另一组实验更能说明问题。

π0.5在同一批任务中的平均成功率为17%,研究团队直接为其加入触觉信号后,成功率反而降至6%。

触觉数据的频率、形态和物理含义都与图像不同,把触觉当成普通输入加入视觉模型,模型未必知道哪些受力变化重要,也不知道应该在什么时候根据触觉修改动作。

T-Rex为触觉设置了独立的时序编码和高频修正通道,模型中的视觉隐状态预测模块负责提供未来场景信息,触觉模块则根据接触变化快速调整动作。

T-Rex并非没有预测能力,它会预测未来视觉表征。不过,其触觉专家主要用于接触发生后的快速修正。

Daimon-TWM把预测对象进一步落到触觉状态本身。

机器人不仅要对已经发生的滑动和碰撞作出反应,还要判断继续执行当前动作后,受力、形变和接触位置将怎样变化。

触觉模型的技术问题由此向前走了一步:先让机器人及时使用触觉,再让机器人理解触觉,并借助触觉预测下一步交互。

02.

模型开始预测下一次接触

戴盟把Daimon-TWM称为机器人的“物理交互脑”。

模型包含物理认知、推演决策和瞬时操控三部分,分别处理当前接触、未来变化和实时动作。

USB插入最容易看清三部分如何配合。

机器人先通过视觉找到USB和接口,规划机械臂的大致路线,手指接触USB后,触觉开始记录夹持力、接触位置和滑动变化。

USB靠近接口时,模型判断当前是否已经对准;插入过程中,它继续预测两侧受力将如何变化;一旦出现偏斜,底层控制器抬起USB、调整位置,再重新尝试。

图片

定位、判断、预测和修正发生在同一次操作里,触觉参与决定机器人下一步往哪里移动、施加多大的力。

Daimon-TWM的第一部分负责物理认知。

机器人需要从触觉中识别接触状态、受力、形变、摩擦、滑移和材料属性,为后续动作提供判断依据。

物理属性通常不是简单的二选一。

软和硬之间还存在偏软、适中、较硬等连续差异;粗糙度、摩擦力和形变程度也会随接触位置和作用力变化。

机器人最终选择多大的抓握力,取决于它能否分辨这些差别。

戴盟为此构建了覆盖上万种物体的1000万组触觉数据,并将连续触感整理成程度标签和推理问答。

模型不只学习“这个物体是什么材料”,还要根据接触过程说明自己如何得出结论。

与物理认知模块相关的Touch-R1,使用了来自4种光学触觉传感器的100万组以上同步触觉数据。

不同传感器采用不同的光照、标记点、弹性表面和成像结构,同一种接触落在不同硬件上,画面并不完全相同,模型需要越过这些外观差异,找出共同的受力和形变规律。

Touch-R1采用三阶段训练。

第一阶段根据连续触觉图像预测下一时刻的接触变化,让模型学习表面形变过程;

第二阶段通过带推理过程的问答,将触觉信号与软硬、粗糙度和材料等物理语义对齐;

第三阶段使用触觉证据强化学习,让模型根据真实接触数据修正判断。

训练过程中,系统会分别向模型输入真实触觉、移除触觉、打乱顺序的触觉和经过噪声处理的触觉。真实触觉确实改善判断时,模型才能获得相应奖励。

这种训练针对的是视觉先入为主的问题。

模型看见一个塑料瓶,可能直接根据外观判断材质,而没有读取触觉,即使输入端已经接上传感器,答案仍然可能来自物体类别和视觉经验。

在塑料与橡胶的对比案例中,图片外观更接近塑料,触觉却记录到更加明显的弹性形变。

Touch-R1需要先观察接触表面的变化,再比较相同作用力下的形变量,最后修正视觉给出的判断。

在TouchReason-Bench中,Touch-R1的综合得分达到60.1,触觉专用模型SToLa为47.5,GPT-4o为35.4。

评测内容包括物体属性识别、物理属性排序、跨传感器一致性,以及视觉与触觉发生冲突时,模型能否根据接触证据修改答案。

物理认知解决的是“机器人现在摸到了什么”。

Daimon-TWM接下来还要回答:沿着当前动作继续执行,会发生什么?

模型为此引入一组可学习的统一触觉词元,它们从视觉、语言和触觉观测中提取接触信息,再将不同传感器产生的数据整理到统一的触觉表示中。

触觉传感器可以输出形变图、压力、六维力、滑移或摩擦等不同信号,如果每一种硬件都要单独训练模型,触觉能力很难在不同设备和机器人之间复用。

统一触觉词元把分散的信号转成模型可以共同处理的信息。

在此基础上,Daimon-TWM同时进行触觉思维链和未来触觉预测。

触觉思维链判断机器人处于靠近、轻触、稳定抓握、滑动还是受阻阶段,并识别接下来可能出现的失败。

未来触觉预测采用由粗到细的方式。模型先判断接触正在增强、减弱还是转向失稳,再进一步预测局部接触位置和受力变化。

机器人在执行下一步动作前,可以先在模型内部推演接触结果。

如果继续下压可能导致卡住,模型提前调整位置;如果抓握力不足可能引发滑落,模型在物体移动前增加力量。

大小齿轮装配集中体现了这种能力。

图片

机器人要先抓起齿轮并找到对应轴,再将齿轮压入,齿轮的位置即使只偏一点,齿面也可能相互顶住。

Daimon-TWM根据当前接触推演继续移动后的受力变化,再调整齿轮的角度和位置。戴盟展示的结果中,模型预测的触觉变化与实际采集到的信号保持相近趋势。

这些预测不用还原成一张完整的触觉图像。模型直接把预测结果送入动作生成和控制环节,用来决定下一步如何移动。

第三部分是瞬时操控。

上层模型以较低频率理解任务、预测接触并生成动作,底层触觉控制器持续读取真实反馈,在原动作上叠加小幅修正。

戴盟称,Daimon-TWM的瞬时操控模块以100Hz运行,接触发生后,系统可以按照毫秒级节奏调整动作。

花瓶擦拭时,海绵需要沿曲面持续移动,如果有人改变花瓶位置,原来的擦拭轨迹立即失效。

模型根据接触变化重新判断表面方向,高频控制器随即调整机械臂,让海绵重新贴住花瓶。

收拾碎玻璃的任务更复杂。

透明反光会干扰视觉判断,碎片边缘不规则,抓得太轻容易滑落,抓得太重又可能继续破裂。碎玻璃紧贴桌布时,直接向上提还可能把桌布一起带起。

图片

在戴盟公开的演示中,Daimon-TWM通过接触确认碎片是否抓稳,随后调整玻璃姿态,再将其放进垃圾箱。整个过程中,模型根据触觉变化调整抓握力和移动轨迹。

这项任务同时调用三种能力:识别物体和抓握状态,预测不同动作可能带来的结果,再根据实际接触修正动作。

消融实验:以 USB 插拔成功率验证 Daimon-TWM 的系统性优势

USB任务的消融实验展示了三部分如何逐步提高成功率。

基础模型的成功率为18%;加入实时触觉后升至30%;加入触觉思维链后达到36%;加入粗粒度和细粒度预测后,分别升至44%和52%;最后接入高频控制器,成功率达到62%。

完整评测覆盖铅笔和试管调整、黑板和花瓶擦拭、USB和插头插入,以及大小齿轮装配等8项任务。

Daimon-TWM 在多项任务中与 π0.5 的成功率对比(cln:无扰动;ptb:有扰动)

无扰动时,模型平均成功率为64%,π0.5为26%;加入人为推动、平台角度变化和表面高度变化后,两者分别为53%和6%。

扰动环境拉开的差距说明,未来触觉预测和高频控制需要同时工作。

只有预测,机器人来不及处理突然变化;只做实时反应,机器人又要等偏差已经出现才开始调整。

Daimon-TWM把两者放进同一次操作,让机器人能够提前规划,也能根据现场变化修改动作。

03.

数据从指尖产生

Matthew T. Mason曾在个人主页上写道:“The dexterity of a hand is mostly about the brain, not the hand.”

灵巧操作更多取决于“脑”,而不是手本身。

这句话也恰好解释了戴盟的技术路线,公司先做触觉传感器,随后建设数据采集系统,再把积累的接触信息用于训练模型。

戴盟联合创始人兼首席科学家王煜是Mason的首位毕业博士。2015年,他与李泽湘共同创办香港科技大学机器人研究院并担任创院院长,长期研究机器人操作和视触觉感知。

2023年底,戴盟在深圳启动规模化运营。

段江哗担任创始人兼CEO,负责技术产业化和公司经营;曾在阿里通义实验室从事多模态大模型研究的原玮浩担任首席AI科学家;杜仪湃负责触觉传感器研发,也是戴盟单色光视触觉传感器架构的主要设计者。

图片

原玮浩、王煜、段江哗、杜仪湃

几个人的分工落在戴盟的不同业务环节。

机器人操作研究确定问题,触觉硬件记录物理接触,数据系统扩大训练规模,大模型再把这些数据转成动作能力。

戴盟自研的视触觉传感器可以采集法向力、切向力、接触位置、表面形变、滑移、摩擦、软硬和纹理等十多项信息。

传感器记录的不是一次静态接触,而是机器人从碰到物体,到施力、移动和释放的连续过程。

对世界模型来说,连续过程比单帧触觉图更有用。模型只有看到接触如何随动作变化,才能学习采取某个动作之后,物体与手指会发生什么。

戴盟将这套数据体系命名为Daimon-Infinity。

目前,该数据集已经积累数十万小时含触觉多模态操作数据,覆盖仿真数据、以人为中心采集的无本体数据,以及机器人遥操作数据。

仿真数据可以快速生成大量接触组合;无本体数据通过人手和便携式设备采集日常操作;遥操作数据则同步记录机器人状态和可执行动作。

三类数据分别补充规模、场景和机器人控制信息。

Daimon-Infinity首批1万小时数据已经在ModelScope开源,截至最新发布节点,下载量接近500万次,戴盟计划在年内将整个数据集扩展至百万小时级。

戴盟还与中国移动建设外发式数据采集网络,并在湖南郴州落地具身数据采集“5S店”。项目首期计划投放1000套采集设备,满产后预计每年产生100万小时真实操作数据。

外发式采集把设备带出固定实验室,进入家庭、商业和生产环境。采集对象、工具和操作方式随之增加,机器人可以看到更复杂的真实接触过程。

数据进入训练前,还需要统一传感器格式、校准接触信号、对齐图像与动作,并标记任务阶段和物理属性。

Touch-R1负责处理跨传感器的触觉认知,Daimon-TWM的统一触觉词元继续服务于接触预测和动作控制。

在训练之外,戴盟建立了RobOmni评测基准,用来测试模型的物理交互能力。评测覆盖触觉认知、接触操作和扰动环境下的执行表现,为模型迭代提供任务和指标。

传感器、数据集和评测系统让戴盟可以反复训练并验证模型。

传感器进入机器人后产生新的接触数据,数据用于更新模型;模型再进入新的本体和任务,继续产生操作记录。

戴盟披露,其视触觉设备已经实现万片级出货,累计服务全球200余家客户,其中海外客户超过50家。公司还向OpenAI、Figure、Physical Intelligence、Skild AI、Meta、BMW、Google DeepMind等企业及机构交付产品,并推进模型部署和概念验证合作。

from clipboard

戴盟同时与中国移动、中国电信、联想、汇川技术、招商银行和上声电子等合作,在3C电子、精密制造、家庭与商业服务等场景推进数据采集、测试和部署。

这些硬件和客户关系为Daimon-TWM提供了真实任务。

触觉世界模型需要稳定的数据入口,也需要持续验证操作能力的机器人和工作环境。模型每进入一个新任务,都会遇到新的物体、接触方式和失败情况。

04.

数亿元融资投向一条完整链路

戴盟最新一轮数亿元战略融资由蚂蚁集团领投,老股东继续加注。

两个月前完成的亿元A轮由汇川产投和中国电信联合投资。此前进入的产业资本还包括中国移动链长基金、联想创投和招商局创投。

这些投资方可以直接接入戴盟的制造、数据和应用环节。

汇川技术长期服务工业自动化和制造客户,可以把触觉操作带入装配、插接和精密制造;中国移动与戴盟共建外发式数据采集网络;中国电信提供通信、云网和产业客户资源;联想拥有制造与供应链体系;招商局体系覆盖港口和物流场景。

蚂蚁集团进入后,戴盟的融资叙事也从触觉传感器进一步延伸到物理智能模型。融资公告与Daimon-TWM发布只相隔一天,两项动作共同呈现了公司现在的业务结构。

戴盟早期通过视触觉设备建立客户关系和数据入口,随后用Daimon-Infinity扩大数据规模,再由Daimon-TWM把数据转化为物理认知、接触预测和动作控制。

语言模型可以从互联网获取文字,视觉模型可以使用海量图片和视频,触觉数据必须在物体与手指真正接触时产生,软硬、摩擦、形变和滑移不会完整保存在普通视频里,也很难靠语言标注还原。

因此,触觉模型的竞争不会只看参数规模。

传感器能否稳定量产、不同设备的数据能否统一、采集网络能否扩大、训练结果能否回到机器人上,都会影响模型最终能学到多少物理规律。

戴盟目前展示的任务集中在调整、擦拭、插入、装配和易碎物体处理,这些任务都有连续接触过程,也与3C电子、精密制造和服务场景中的操作需求相连。

早期客户购买的是触觉传感器,随着Daimon-TWM发布,戴盟开始尝试交付一套触觉操作能力:机器人读取压力和形变后,还能判断当前状态、预测接触变化并修改动作。

最新融资支持的正是传感器、数据和模型三项业务同时推进。

T-Rex证明,触觉需要适合自身信号特点的编码方式和反应速度,Daimon-TWM继续把当前接触与未来触觉放进同一个预测过程。

机器人大脑的输入随之改变,机器人不仅通过相机观察世界,也开始从接触中理解物体和动作。

下一轮触觉模型竞争,将围绕三个问题展开:不同传感器产生的信息能否统一,真实交互数据能否持续增加,模型的预测结果能否及时送回动作控制。

灵巧手提供了接触世界的硬件,触觉世界模型开始决定这双手是否真正会工作。

-END-

点击查看全文
评论赞0分享
轨迹
戴盟触觉传感器机器人

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4