JavaScript is required

谷歌升级机器人“大脑”,Gemini Robotics 2开始管全身、换本体、组队干活

◎ 谷歌给机器人换了一颗能“带队”的大脑。

△ 撰文:DONG.ZY

一台机器人能拿东西,和它能独立收拾房间,是两回事。

前者只需要完成一个动作,后者要自己走到目标附近,选择站位,协调全身完成抓取,再记住任务进度,把物体送到正确位置。中间任何一步出错,机器人都得知道哪里出了问题。

7月30日,Google DeepMind发布Gemini Robotics 2。演示中,Apptronik Apollo 2机器人接到一句指令:“把洒水壶放进货架底层的绿色收纳箱。”

Apollo 2走到桌边拿起洒水壶,转向货架,移动到合适位置,再弯下身体完成放置。整个过程同时调用腿部、躯干、双臂和手部,机器人不再站在固定工作台前,只用上半身执行任务。

与Gemini Robotics 2一起发布的,还有负责高层任务规划的Gemini Robotics ER 2,以及在机器人本地运行的Gemini Robotics On-Device 2。

Google DeepMind把机器人需要的几种能力拆成了不同层级:VLA模型控制身体,具身推理模型管理任务,端侧模型负责本地运行和硬件适配。

谷歌没有推出自己的机器人,却把Apollo人形机器人、Franka双臂平台、五指灵巧手和两指夹爪都接入了同一套模型体系。

这比发布一款机器人更能体现谷歌的目标:把Gemini放到不同机器人硬件之上。

01.

机器人终于不只会站着干活

Gemini Robotics的上一代模型,主要控制人形机器人的上半身,任务集中在桌面附近。机器人站在固定位置,通过双臂完成抓取、整理和工具操作。

桌面任务省去了移动环节,也缩小了全身控制的范围。机器人不用走向目标,很少需要在抓取时同步处理站位、身体平衡和视角变化。

Gemini Robotics 2把控制范围从上半身扩大到完整人形机器人,模型接收图像和文字,再输出机器人动作,可以控制腿部、躯干、双臂和末端执行器。

这项变化首先扩大了机器人的可操作空间。

物体可以放在桌面、地面或货架上,机器人需要根据目标位置走动、弯腰、下蹲或伸展,再让手臂进入合适的抓取区域。身体姿态改变后,摄像头视角和机械臂可达空间也会变化,模型必须在运动过程中重新安排后续动作。

Apollo 2搭配Inspire灵巧手完成了三类全身抓取测试:从桌面抓取的成功率为68.4%,从地面抓取为45.7%,从货架抓取为76.3%。

地面抓取的结果最低,相比桌面和货架,机器人从地面拿取物体时,需要更大幅度地调整躯干和重心,手臂接近目标时的观察角度也更受限制。

全身控制不是在机械臂任务前面加一段行走,移动、站位、平衡和操作会互相影响,模型要处理的是一条连续动作链。

Google DeepMind还让同一个Gemini Robotics 2模型检查点进入三套硬件:Apollo 2搭配SharpaWave灵巧手、Apollo 2搭配Inspire灵巧手,以及Franka Duo双臂机器人搭配Robotiq夹爪。

这三套组合的差异很大。

Apollo 2是完整人形机器人,Franka Duo是双臂操作平台;SharpaWave和Inspire采用多指结构,Robotiq则是两指夹爪。它们拥有不同的关节数量、控制接口和动作空间。

同一个模型检查点能够跨越这些硬件,说明Google DeepMind正在减少VLA模型对单一本体结构的依赖。

其中,SharpaWave是一款接近人手尺寸的五指灵巧手,拥有22个主动自由度。

Gemini Robotics 2控制Apollo 2搭配SharpaWave,执行了拧灯泡、系垃圾袋、使用簸箕和封闭密封袋等多指任务。

拧出灯泡的成功率达到92%,拧入灯泡为36%;系垃圾袋、使用簸箕和封闭密封袋的成功率分别为44%、32%和40%。

多指操作没有因为自由度增加而自动变得更灵巧。

机器人拧出灯泡时,可以沿着已有螺纹反向旋转;重新拧入则要先完成对准,再持续控制旋转方向和轴向位置。垃圾袋和密封袋还会随抓握发生形变,需要双手在操作过程中不断调整接触位置。

Franka Duo搭配Robotiq两指夹爪时,一般抓取放置、不同工具配套和精密插入的成功率分别达到74.2%、78.9%和89.6%。

两指夹爪的动作空间更简单,接触方式也更受约束。五指手可以使用更多为人设计的工具,却要同时安排多根手指的姿态、接触顺序和作用力。

Google DeepMind也承认,多指灵巧操作仍然具有挑战。

Gemini Robotics 2已经把一套VLA模型从桌面操作推向完整人形机器人,也让模型开始适应不同机器人身体和末端执行器。机器人获得了更大的活动范围,控制难度也从“手怎么动”扩大到“整副身体如何配合”。

02.

ER 2开始盯着机器人把任务做完

全身控制解决了机器人怎样行动,却没有回答另一个问题:它能不能把一项工作做完。

整理房间、收拾厨房或执行工业流程,往往持续数分钟。机器人要找到目标、安排步骤、执行动作、检查结果,还要处理某一步没有成功的情况。

如果模型只根据最初的指令生成动作,任务很容易在中途断掉。机器人移动物体后,现场状态已经改变;柜门没有完全打开,后面的拿取动作也要跟着调整。

Gemini Robotics ER 2负责管理这段过程。

ER 2基于Gemini 3.5 Flash,可以接收文字、图像、视频和音频,支持最高128K上下文。它不直接控制关节,而是观察环境、拆解任务、维护执行进度,再把具体动作交给下层VLA模型。

机器人执行当前动作时,ER 2可以继续规划下一步。执行结果与预期不符,它会重新尝试或调整后续计划。

Google DeepMind称,ER 2可以处理持续数分钟、包含数百次决策的长任务。模型能够识别任务何时开始、何时结束,还能判断关键事件发生在哪个时间点。

在任务结果判断测试中,ER 2根据图像识别任务是否成功的准确率为87.7%,根据视频判断的准确率为82.4%。任务进度分类准确率为57.4%。

完成状态通常有一个明确结果,进度判断更复杂。模型需要从连续画面中识别机器人已经完成哪些步骤,当前动作是否有效,以及接下来应该进入哪一环。

这项能力直接影响长任务的连续性。

单个技能成功率再高,只要某一步失败后没有被系统发现,后续动作就会沿着错误状态继续执行。ER 2把结果检查和重新规划加入任务链,让机器人能够从中间位置继续处理问题。

在控制真实VLA模型的测试中,ER 2取得60.0%的任务成功率,上一代ER 1.6为48.6%。控制仿真VLA时,两者分别为42.9%和37.4%。

ER 2还可以调用搜索、函数调用、代码执行、结构化输出和网址上下文等工具。

机器人获得的信息不再只来自摄像头,它可以查询外部资料、读取软件系统中的信息或完成必要计算,再把结果转成任务安排。

这是Gemini在数字Agent领域积累的能力,开始向物理任务迁移。不同之处在于,数字Agent调用错误工具,通常只会得到错误结果;机器人一旦执行了错误动作,就可能碰撞设备、损坏物体或影响附近人员。

Google DeepMind因此把安全判断放进了高层模型。

此次发布的ASIMOV-Agentic基准,用于评估具身推理模型能否拒绝来自VLA的不安全工具调用、判断任务是否可行,以及在无法确认时主动请求人类介入。

ER 2在安全指令遵循测试中的准确率为97.9%,在人类距离机器人1米范围内的安全评测中取得93.0%。检测到人员靠得过近时,模型可以触发安全工具,让机器人停止。

安全之外,ER 2还加入了多机器人协作。

不同机器人可以交换信息,判断彼此擅长什么,并自主分配任务。移动平台可以负责转运,机械臂处理固定工位,人形机器人操作为人设计的工具。ER 2负责把这些能力组织到同一个任务里。

机器人组队的难点不只是通信。

上层模型还要掌握每台机器人的位置、执行进度和身体能力。某台机器人没有完成任务,系统需要重新分配剩余步骤;场景状态发生变化,其他机器人也要同步调整。

ER 2把具身推理的范围从一台机器人的动作规划,扩大到多种机器人之间的任务调度。对于拥有不同本体和工位的复杂场景,这比让所有任务都由一台通用机器人完成更现实。

03.

少于200个示例,模型就能换一副身体

机器人行业长期存在一个难以回避的问题:没有统一硬件。

人形机器人、双臂平台、协作机械臂和移动机器人拥有不同关节结构、传感器配置和控制频率。同一个“拿起杯子”指令,落到不同机器人上,对应的动作输出并不相同。

模型能否跨本体复用,决定了机器人公司需要为新硬件重新采集多少数据、训练多长时间。

Gemini Robotics On-Device 2处理的是硬件适配和本地运行。

这款模型基于Gemini Robotics 1.5技术和端侧Gemma模型,接收文字、图像及机器人本体状态,输出机器人动作。模型直接运行在机器人设备上,可以避开网络延迟和互联网连接限制。

本地运行对机器人比对聊天应用更重要,机器人要连续响应物体移动、人员接近和接触变化,网络抖动可能直接打断动作。部分工业和家庭场景也不适合持续上传现场数据。

On-Device 2继承了上一代的运动迁移技术。Google DeepMind称,只需数小时适配时间、通常少于200个示例,模型就可以进入形状、传感器和自由度不同的新双臂机器人。

Google DeepMind在Dexmate、SO101和Trossen平台上展示了这种适配能力。

在SO101平台上,On-Device 2最终成功率达到53.3%,上一代为6.7%;在Dexmate平台上,新模型达到75.6%,上一代为33.3%。

少于200个示例,让新硬件接入模型的成本有了更明确的衡量尺度。

过去,一款机器人更换手臂、夹爪或传感器后,原有动作数据未必还能直接使用。硬件厂商往往需要重新采集数据,再针对新的动作空间进行训练。

On-Device 2先保留模型从多种本体中学到的共同能力,再用新机器人的少量数据完成动作适配。硬件厂商可以围绕自己的关节、传感器和运动范围继续训练,不必从头构建完整的VLA系统。

不过,三款模型距离全面开放还有不同距离。

Gemini Robotics 2处于私有预览;Gemini Robotics ER 2已经在Google AI Studio和Gemini API开放公开预览,同时在Gemini Enterprise Agent Platform进行私有预览;Gemini Robotics On-Device 2目前只向受信任测试者开放。

Google DeepMind先把高层具身推理能力交给开发者,涉及真实机器人控制的VLA和端侧模型,则继续通过合作伙伴扩大硬件测试。

本次发布中,Google DeepMind列出的机器人合作伙伴包括Apptronik、Boston Dynamics和Agile Robots。实际测试还使用了Franka、Robotiq、Inspire和Sharpa等企业的硬件。

Google DeepMind没有推出自己的机器人整机,也没有要求所有厂商使用同一种机械结构,它选择把Gemini放在硬件之上,再通过跨本体模型和端侧适配进入不同机器人。

这条路线会让机器人公司的分工变得更清楚。

整机厂商继续解决关节、驱动、负载、续航和制造问题;模型公司负责理解指令、规划任务、生成动作,并让这些能力在不同本体之间迁移。

当机器人从单项演示走向连续工作,竞争标准也会跟着改变。模型要控制完整身体,要记住长任务做到哪一步,还要在换机器人之后迅速恢复操作能力。

Google DeepMind没有制造下一台人形机器人,它正在争夺下一批机器人的大脑。

-END-

点击查看全文
评论赞0分享
轨迹
谷歌机器人具身智能

欢迎关注我们!

上海恩翌信息科技有限公司
1NE时代-小恩
188-1775-0862
沪ICP备17041240号-4