JavaScript is required

看一遍视频,机器人就学会一项新工作?

◎ 给机器人看一遍就会,Skild S1重写新任务部署流程

△ 撰文:董志洋

机器人已经能完成越来越复杂的动作,学习新任务仍然依赖一套很重的训练流程。

换一道工序、换一种工具,研发团队往往要重新遥操作机器人,采集数十乃至数百小时数据,再经历模型微调和真机验证。

每项任务都配一轮训练,机器人很难跟上客户现场不断变化的需求。

近日,Skild AI发布旗舰机器人基础模型S1,试图缩短这段流程。

S1使用视频作为任务提示,工作人员示范一次,模型便根据演示控制机器人执行,不更新权重,也不针对新任务进行专项微调或后训练。

在Skild AI公布的演示中,S1完成了种植植物、制作煎饼、手冲咖啡和套件组装四项未见任务。这些任务包含数十个连续步骤,最长接近10分钟。

其中,种植植物从开始录制演示视频到机器人自主运行只用了11分钟。机器人随后完成挖土、放入植物、整理土壤和浇水等操作。

S1把视频放到了机器人部署流程的最前端,过去交给数据采集和模型训练的工作,现在可以先从一次现场示范开始。

01.

11分钟,新任务已经上机

机器人学习一项新工作,通常要先明确任务,再由操作员遥控机器人反复执行,采集图像、状态和动作数据。

数据经过后训练后,团队还要在真实环境中验证效果,最终形成一套面向具体任务的策略。

Skild AI认为,稍复杂的操作任务往往需要数十乃至数百小时的现场数据。数据覆盖足够充分时,即使没有使用基础模型预训练,单独训练的任务模型也可能取得相近的峰值表现。

如果每增加一项任务都要重复采集和训练,基础模型只能缩短训练周期,无法改变机器人进入新场景的基本流程。

S1采用机器人上下文学习。

模型提前在大量带有任务演示的数据上预训练,部署时则把一段新视频放入上下文窗口,根据演示和当前画面直接生成机器人动作。

Skild AI借用了语言模型的发展路径来解释这种变化。

早期语言模型已经具备较强的理解能力,面向具体应用时仍要继续训练。上下文学习成熟后,用户可以通过提示向同一模型交代新概念和新要求。

S1采用了相似思路,任务提示从文字换成了视频。

“把杯子递给我”这样的简单动作,一句话已经足够清楚。换成折叠床笠、把蛋清打发、系绳结或者翻煎饼,文字很难完整交代工具角度、动作顺序、移动幅度和结束状态。

就算是人类学习这类操作时,也会先看别人做一遍。

视频可以把目标和操作过程放在一起,机器人不仅知道要做什么,还能看到工具怎样接近物体、动作按照什么顺序发生,以及演示者如何判断任务已经完成。

Skild AI在项目文章中引用了机器人学者Jim Fan的观点。当训练数据足够丰富时,模型面对相似场景中的新物体,可能已经可以零样本完成抓取。判断上下文学习是否发挥作用,还要看测试任务与训练数据相隔多远。

Skild AI据此设置了两个评价维度。

第一,任务是否进入过预训练数据;

第二,任务属于持续5至25秒的单项动作,还是需要组合多项技能、持续数分钟的长序列操作。

前一个维度区分模型是在调用已有能力,还是根据演示获得新行为;后一个维度考察机器人能否记住进度,把多个动作接成一项完整工作。

Skild AI称,S1首次把机器人基础模型的上下文学习推进到预训练中未见、最长持续10分钟的操作任务。

02.

S1从视频中读取任务

S1把演示视频当作任务说明,不按人的手部轨迹逐帧复现。

演示者使用人的双手,执行端是机器人,演示和部署还可能采用不同视角,物品摆放与现场环境也会变化,模型需要先理解演示者的目标,再判断人和机器人该怎样用各自的身体完成同一项操作。

整个过程包含几项工作。

S1要识别任务涉及哪些物体,理解这些物体的用途;还要把人的动作转换成机器人能够执行的动作,并在运行中持续记录进度。否则,机器人可能只模仿出局部姿态,无法继续完成后续步骤。

Skild AI使用以一次完整任务为单位组织的训练数据,每组数据都包含一段任务演示和相应的机器人执行过程,任务不再通过固定类别或者一句文字定义,而是藏在演示的动作和物体关系中。

场景里存在多种可能的动作时,模型必须回看演示才能确定下一步。预训练数据越丰富,同一场景可以对应的任务越多,模型也越依赖演示内容,而不是仅凭当前画面猜测目标。

从元学习的角度看,预训练先教S1如何看懂演示。机器人运行时再根据当前视频完成任务,不需要更新模型参数。

Skild AI公布的已见任务、未见任务、扰动测试和错误恢复演示,全部使用同一套模型权重。

训练数据决定了S1能够从视频中读出多少信息。

Skild AI同时使用机器人遥操作、UMI采集、第一视角人类视频和仿真数据,四类数据在真机接近程度、任务数量和采集成本上各有侧重。

遥操作数据由目标机器人直接执行,图像、关节状态和动作最接近部署硬件,它需要机器人设备和操作员配合,扩充速度较慢。

第一视角人类视频覆盖更多日常任务,采集成本也更低,人的身体结构与机器人不同,模型需要从画面中提取任务意图,再把人的动作转成机器人能够完成的操作。

UMI在真机接近程度、任务多样性和采集效率之间相对均衡。

仿真数据可以快速扩充规模,也能让机器人反复尝试动作,但任务丰富度取决于仿真环境和资产。

Skild AI同时扩充四类数据,遥操作提供机器人动作基础,第一视角视频扩大任务范围,UMI和仿真补充不同场景及操作数据。

Skild AI没有把数据规模当作唯一指标。公司称,每投入1美元采集数据,就会投入约3美元进行质量控制,检查动作精度、任务连贯性和标注准确度。

上下文学习依赖演示和任务之间的稳定关系,同一种操作如果对应多个混乱标签,或者任务过程中夹杂大量无关动作,模型很难判断视频究竟要求机器人完成什么。

S1基于NVIDIA AI基础设施训练,以支撑多种机器人数据的大规模计算。Skild AI此次主要公布S1的上下文学习表现,后续还将继续介绍模型的训练方法。

03.

十分钟任务,需要记住做到哪一步

S1先展示了7组预训练范围内的自主操作,这些任务用于观察模型如何调用已经掌握的操作动作。

种植植物、制作煎饼、手冲咖啡和套件组装则要求S1根据视频获得新动作,或者把已有动作按照新的顺序重新组合。四项任务都没有进入预训练数据,每项任务只提供一段演示视频。

种植植物需要机器人先用工具挖开土壤,为植物腾出位置,再把植物放入花盆、整理土壤并浇水。

挖土等动作没有出现在S1的预训练任务中,模型要从演示里理解工具怎样使用,以及挖土与放入植物之间的关系。

制作煎饼包含厨具操作和食物处理,锅、铲子与煎饼之间的相对位置会不断变化,机器人还要在合适的时机完成翻面。

文字可以说明“翻煎饼”,视频则呈现铲子怎样进入、沿什么方向移动,以及机器人需要如何转动工具。

手冲咖啡包含放置滤纸、将滤纸压入滤杯、加入咖啡粉和注水等步骤,滤纸没有放好,后面的动作就失去了基础。

S1需要根据执行结果判断当前步骤是否完成,再决定是否继续。

套件组装要求机器人从多个零部件中选择对象,按照演示给出的关系推进装配。当前使用哪个部件、哪些步骤已经完成,都会影响下一步动作。

长序列任务增加的不只是动作数量,机器人要保存任务进度,还要处理局部动作失败带来的变化,一个步骤没有做到位,后续观察到的场景就会偏离演示视频。

Skild AI在测试中主动增加了这类变化。

工作人员会在机器人接近目标时移走物体、更换物品,或者改变现场光照,演示视频没有展示这些干扰,S1仍然继续执行任务。

动作失败后,S1有时会重新尝试。

在滑板轮组装演示中,机器人没有因为一次操作失败就跳到下一步,而是再次处理没有装好的部件。

现场缺少演示中的工具时,S1也会调整做法。

演示视频使用浇水壶给植物浇水,执行现场只提供水杯,机器人便改用水杯。演示要求向杯中倒果汁,而杯子已经接近装满时,机器人只补充少量液体。

Skild AI将其视为S1具备一定物理常识的表现,模型没有照搬演示中的具体物体,而是保留任务目标,再根据现场条件选择工具和动作。

演示本身出现错误时,S1也可能修正。

在一段处理鸡蛋的视频中,演示者提前把鸡蛋掉落并弄乱桌面,机器人执行时没有复现失误,而是用更平稳的动作完成相应步骤。

视频在这里更像一份工作示范,它告诉机器人操作目标和大致过程,机器人再根据自己的身体和现场状态完成动作。

04.

7倍差距,出现在陌生任务中

Skild AI从预训练数据中筛选出一组受控数据,分别训练上下文学习模型和语言条件VLA。两者使用相同的数据和算力,模型架构也基本一致,主要差别是任务提示的编码方式。训练规模从1千小时逐步扩大到10万小时。

在已见任务中,语言提示模型起步更快。

训练数据为1千小时时,语言条件VLA的平均单步骤成功率为53%,上下文学习模型为43%。

语言可以把任务压缩成少量文字信息,数据规模较小时,模型更容易利用这种低维提示。视频包含的内容更多,上下文模型需要更丰富的数据才能学会从中筛选有效动作。

随着预训练数据增加,上下文学习模型在已见任务上逐渐反超。演示视频可以进一步限定任务的执行方式,减少语言指令带来的歧义。

真正拉开差距的是未见任务。

训练规模达到10万小时时,语言条件VLA在未见任务中的平均单步骤成功率为9%,上下文学习模型达到66%,相差约7倍。

面对翻煎饼这样的新动作,“翻转煎饼”几个字只说明了目标,演示视频还提供铲子进入的位置、运动方向和翻转时机。模型可以从视觉变化中寻找动作关系,再换成机器人自己的运动方式。

长序列任务中的动作组合也有类似差别。语言可以列出操作步骤,却很难完整表达两个动作之间如何衔接。演示把工具姿态、物体状态和操作顺序放进同一个连续过程。

Skild AI还把一次上下文演示与专项后训练放到同一条曲线上比较。

S1没有针对测试任务训练,只接收一段演示视频,平均单步骤成功率达到66%。另一套语言条件模型使用1至2000段遥操作样本进行后训练。

根据实验曲线的插值结果,语言条件模型大约需要380段后训练演示,才能达到S1一次上下文演示对应的成功率。使用2000段演示后,专项训练模型的成功率升至86%。

专项后训练可以通过更多数据继续提高性能。S1选择先压缩新任务上线所需的时间,让机器人凭一次演示获得可以执行的能力。

这组实验统计的是平均单步骤成功率。长序列执行中,某一步失败后,测试人员会帮助机器人恢复,再继续评价后面的步骤。这样可以避免前面的失误中断整项测试,也能记录模型在每个操作环节的表现。

Skild AI还测试了两种分布变化。

第一组测试逐步让执行现场偏离预训练条件;第二组保持训练条件不变,只扩大提示视频与执行现场之间的差异。两组测试都设置了L1至L5五档难度。

L1沿用相同物体和位置;L2将所有物体随机移动15厘米并旋转30度;L3扩大到30厘米和45度;L4更换用途相同的物体,并加入约15厘米的高度变化;到了L5,物体被重新布置,一半动作需要换到另一只机械臂执行。

小幅位置变化没有明显改变两类模型的执行方式。物体被替换或者需要重新安排机械臂后,机器人必须生成新的运动方案。

第一组实验中,语言条件VLA在L5的性能降幅最高约为上下文学习模型的3倍。

第二组实验考察演示视频与执行现场的差异。S1可以适应物体位置改变,也能处理用途相同的替代物。到了L5,演示给出的动作安排与现场需要明显不同,模型表现才出现较大下降。

S1延续了Skild AI此前的机器人上下文学习路线。

2025年9月,公司发布面向运动控制的LocoFormer,让模型通过上下文中的实时经验适应不同机器人身体和环境。2026年2月,团队取得操作任务中的分布内上下文学习结果。5月,S1完成首次煎饼翻面。8月,Skild AI正式公布S1。

Skild AI称,S1已经进入商业合作项目。公司还计划把机器人在现场产生的执行数据送回预训练体系,继续扩大任务和动作覆盖范围。

过去,企业给机器人增加一项工作,需要数据采集团队、模型团队和现场工程师共同完成。S1把第一步交给了任务演示:现场人员先把工作做一遍,模型负责理解视频,再让机器人接手。

这种方式也会改变机器人数据的用途。演示视频既可以进入预训练,也能在部署现场直接调用模型。机器人厂商交付的不再只是预先写好的技能清单,还包括机器人到达现场后继续学习新工作的能力。

机器人学习新工作的速度,开始成为基础模型竞争的一部分。人先做一遍,机器人随后接手,Skild AI正把这套流程变成S1的产品能力。

-END-

点击查看全文
评论赞0分享
轨迹
机器人人工智能基础模型上下文学习

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4