Skip to content
Published on

Gemini Robotics 2 与机器人基础模型 —— 全身控制真正改变了什么

分享
Authors

引言 —— 7 月 30 日,拧开灯泡 92%,拧上去 36%

2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2。如果说上一代模型大体还局限在上肢和桌面作业,这一次的核心主张是:由单一策略来控制整个人形机器人 —— 走路、弯腰、伸手、操作物体,全都在内。

发布材料里最值得研究的部分不是演示视频,而是一张表。在 Apptronik Apollo 2 搭配 SharpaWave 多指手的配置下,拧开灯泡的成功率是 92%,拧上灯泡的成功率却只有 36%。同一只手,同一个灯泡,同一个灯座,方向相反而已。系垃圾袋 44%,密封拉链袋 40%,使用簸箕 32%。

这种不对称性,恰好概括了这个领域当前的状态。拧开这个动作,通常只需要朝一个方向施力,误差不会累积。拧上这个动作则需要对准螺纹、感知阻力,一旦卡住还要退回来重新对位。一旦接触介入进来,难度就会呈台阶式上升。

本文照原样解读这些公布的数字,但会区分清楚哪些是实测数据、哪些只是视频演示,以及这些结果究竟经过了多大程度的验证。

视觉-语言-动作模型到底是什么

传统的机器人软件栈是分层的:感知(从摄像头图像估计物体和姿态)、规划(生成到目标姿态的路径)、控制(把路径转换为关节力矩)。每一层都是单独开发、单独调优的,层与层之间的接口,是人为设计的表示形式 —— 物体的六自由度姿态、一串路径点、关节轨迹。

VLA 把这几层折叠进一个网络里。输入是若干张摄像头图像、一句自然语言指令,以及本体感觉(关节角度、力传感器),输出是下一个时间步的动作片段。中间那层显式表示消失了。"喷壶"这个概念不再以某个六自由度姿态的形式明确存在于某处,而是分布在权重里。

这种结构的优势在于没有接口损耗。感知阶段把物体近似成一个圆柱体时丢掉的信息,控制阶段就不会再需要它了。而且由于语言是输入的一部分,新任务可以用一句话来指定,而不必写代码。

缺点也恰好出在同一个地方。一旦失败,你没法知道是哪一层出了错。到底是没看见物体、选错了抓取姿态,还是用力不对,全都被压缩成同一个数字(成功或失败)。这个可观测性问题,本文后面还会再谈到。

这次发布把模型拆成了三个。

  • Gemini Robotics 2 —— VLA 本体。把视觉和语言转换为电机控制指令,控制人形机器人的全身以及双臂机器人。
  • Gemini Robotics ER 2 —— 具身推理模型。扮演负责高层规划的"大脑"角色,规划多步骤任务、与人对话、协调多台机器人之间的协作。据 MarkTechPost 的技术梳理,它基于 Gemini 3.5 Flash,上下文长度为 128k,最多可输出 64K token。
  • Gemini Robotics On-Device 2 —— 一个直接在机器人硬件上本地运行的轻量级 VLA,构建在 Gemini Robotics 1.5 和 Gemma 系列之上。

这种拆分在实践中很有意义。规划可以放心地放在云端以秒级速度运行,但控制必须在机器人本体上以毫秒级速度运行。网络一旦中断,规划可以暂停,但控制不能停。

全身控制为什么真的很难

"现在连腿也能控制了"这句话很容易被低估。从上肢操作转向全身控制,问题的性质发生了变化。

底座不再是固定的了。 在固定在桌子上的双臂机器人上,夹爪的位置误差就是各臂关节误差之和。而在人形机器人上,还要再加上脚与地面的接触、躯干姿态、重心转移。仅仅是伸手去拿喷壶这个动作本身,就会带动重心移动,而这个反作用力必须由腿部来吸收。也就是说,对手臂下达的指令,变成了腿部的控制问题。

自由度一旦增加,数据需求会呈非线性增长。 从双臂 14 个自由度跳到人形机器人的 30~40 个自由度,搜索空间会爆炸式增长。DeepMind 自己公布的 On-Device 2 模型卡片也明确把这一点列为局限 —— 卡片写道,该模型"在泛化到分布外任务,以及控制高自由度机器人方面存在局限",评估主要在站立姿态下的双臂操作任务中进行,移动平台或全身控制相关的风险不在当前评估范围之内(模型卡片)。

失败的代价不一样。 在桌面上失败,顶多是东西掉了。一台人类体型的机器人在行走过程中失败,则会摔倒。安全余量留得大,成功率就会下降;留得小,危险性就会上升。看这些公布出来的成功率数字时,这个权衡具体设在哪个位置,并没有公开。

照原样解读公布的数字

把 DeepMind 发布材料和 MarkTechPost 梳理中能确认的数值翻译过来,如下所示。

评估维度机器人与手部任务报告的成功率
全身操作Apollo 2 + Inspire 手从货架上取物76.3%
全身操作Apollo 2 + Inspire 手从桌面上取物68.4%
全身操作Apollo 2 + Inspire 手从地板上取物45.7%
多指灵巧操作Apollo 2 + SharpaWave 手拧开灯泡92%
多指灵巧操作Apollo 2 + SharpaWave 手系垃圾袋44%
多指灵巧操作Apollo 2 + SharpaWave 手密封拉链袋40%
多指灵巧操作Apollo 2 + SharpaWave 手拧上灯泡36%
多指灵巧操作Apollo 2 + SharpaWave 手使用簸箕32%
夹爪Franka Duo + Robotiq精密插入89.6%
夹爪Franka Duo + Robotiq工具套件整理78.9%
夹爪Franka Duo + Robotiq常规拾取与放置74.2%

关于怎么解读这些数字,补充几点。

第一,从地板上取物的成功率是 45.7%,这才是全身控制的真实现状。 货架(76.3%)和桌面(68.4%)不需要大幅弯曲躯干,而地板作业同时要求姿态转换和保持平衡。这三个数字的顺序,恰好和这个假设完全吻合。

第二,夹爪精密插入达到 89.6%,而多指手拧上灯泡只有 36%,这就是灵巧操作的现实。平行夹爪自由度低,控制更容易,而且插入这个动作往往能借助孔洞本身充当夹具来吸收误差。多指手的接触点多,每根手指的力分配直接决定了结果。发布材料本身也明确指出,多指操作依然是个难题。

第三,试验次数没有公开。 92% 究竟是 25 次里成功 23 次,还是 200 次里成功 184 次,置信区间会完全不同。判定成功与否的标准同样没有公开 —— 灯泡必须点亮才算成功,还是只要和螺纹咬合就算成功?在我能接触到的资料范围内,这两项信息都没能找到。

ER 2 一侧的数字也一并公布了。五级进度分类的准确率是 57.4%,特定时刻定位的准确率是 91.3%,平均绝对误差 0.96 秒,在三种控制模式(真实 VLA、模拟 VLA、人类远程操作)下,工具编排能力全部优于 ER 1.6。进度分类只有 57.4% 这个数字,意味着"判断任务现在进行到哪一步"这项能力才刚过一半,而这项能力直接关系到自主恢复。

具身泛化 —— 真正难的部分

机器人基础模型与语言模型的决定性差异正在于此。文本里一个 token 的含义在哪里都一样,但机器人的动作空间因身体而异。关节数量、连杆长度、力矩上限、摄像头位置、夹爪种类全都不一样,所以在一个机器人身上学到的"动作",没法原样搬到另一个机器人上。

On-Device 2 主张的正是这一点 —— 它能在几个小时内、通常用不到 200 个示例,就适应一个新的双臂具身。随之公布的,还有仅在后训练阶段引入的新平台上的数值。

  • SO101: 适应前 6.7%,适应后 53.3%。上一代(On-Device 1)是从 0.0% 到 6.7%。
  • Dexmate: 适应前 24.4%,适应后 75.6%。上一代是从 13.3% 到 33.3%。

该怎么看这些数字呢?绝对性能(53.3%、75.6%)还达不到可用于生产环境的水平。但比较对象是上一代模型,在同等条件下从 6.7% 提升到 53.3%,把它解读为样本效率的提升是合理的。也就是说,这不是在主张"它表现很好",而是在主张"它能用更少的数据更快地爬升"。

有一点需要留意。这两个平台都是双臂机器人。正如模型卡片自己写明的,这个模型在控制高自由度机器人方面存在局限,评估也主要围绕站立姿态下的双臂操作展开。因此,这种适应速度是否能延续到人形机器人的全身控制上,公开材料里并没有给出证据。

多机器人协作也应该用同样的视角来看。有一场演示,让 Apollo 2 和 Franka F3 Duo 这两种不同类型的机器人,通过共享的语义理解来交换子任务。这在概念上很重要 —— 如果协作的接口是语言,而不是硬件协议,混用不同机器人的成本就会大幅下降。不过这终归是一场演示,并没有附带单独的成功率数字。

机器人领域的"评估"到底意味着什么

对于从语言模型领域过来的人来说,读机器人领域的结果时最让人困惑的就是评估这一环。搞清楚三点,就能更容易看懂。

成功率的定义因论文而异。 做了多少次试验、每次是否随机化了物体的初始摆放位置、失败后是否允许重试、过程中是否有人工介入、成功与否是人工判定还是自动判定 —— 这些全都不一样。同一个任务名称之下,可能装的是完全不同的实验。

"未见过的任务"的定义也不一样。 究竟是训练数据里没见过的物体、没见过的摆放方式、没见过的指令句子,还是没见过的动作,难度各不相同。一般来说,难度会按场景泛化(新物体、新背景)、指令泛化(新句子)、行为泛化(新动作)的顺序递增,如果论文不说明自己评估的是哪个维度,就没法做比较。On-Device 的模型卡片说明评估了这三个维度,但没有公布分维度的具体数值。

仿真与现实之间的差距依然存在。 仿真器对刚体接触做的是近似处理,摩擦、打滑、形变这些因素依然对不太上。所以在接触密集的任务上 —— 处理衣物、整理线缆、倾倒粘稠液体 —— 仿真表现和真机表现之间的差距最大。在我能确认的范围内,这次发布材料里没有找到关于 sim-to-real 的明确说明。只提到 On-Device 的评估是"在仿真和真机基准测试中都进行了"。

要把一个公布出来的成功率数字连同置信区间一起解读,至少需要一并公开以下这些内容。目前这个领域里,能把这些全部公开的发布相当罕见。

task            "拧上灯泡"
embodiment      Apollo 2 + SharpaWave 手 + 灯座治具版本
n_trials        试验次数。没有这个数字,92% 和 36% 之间的差距也无从解读。
success_def     成功的判定标准。是"螺纹咬合",还是"灯泡点亮"?
judged_by       人工判定还是自动判定?如果是人工,几个人判定,如何达成一致?
init_conditions 每次试验是否都随机化了初始摆放?
retries         失败后是否允许重试?允许的话,成功率的定义就会变。
human_in_loop   除了复位之外,是否存在人工介入?
seen_in_train   这个任务和物体是否出现在训练数据里?
safety_margin   速度和力度的限制设在哪里?余量越小,成功率越容易显得高。

而且从根本上说,机器人领域没有共用的基准测试。不像语言模型有若干标准评测、所有人在同样的条件下跑同一套测试,机器人这边任务集合、摄像头布置甚至机器人本身,论文与论文之间都略有不同。这种碎片化正是滋生"挑好看数字来展示"这种做法的结构性土壤。

什么是挑好看的数字,什么是真实测量值

诚实地区分一下。

可以当作测量值来看的:上表中的这些成功率、On-Device 2 适应前后的数值、ER 2 的进度分类和时刻定位数值。这些都是以带有明确任务说明的数字形式给出的。不过由于缺少试验次数和判定标准,没法计算置信区间。

应该当作演示来看的:清理垃圾、搬运喷壶、往录音机里放磁带、更换灯泡、系垃圾袋这些视频。谷歌把这些称为"完全自主"动作的"实时画面"。Engadget 在报道中指出,这些机器人是通过人类远程操作、视频示例和仿真,针对视频里展示的每一项任务专门训练出来的,并明确指出这不是一台通用设备。同一篇报道还提到,作者本人"对这类东西相当怀疑",并指出 AI 是可能出错的,而在一台体型如人、重量不轻的机器人身上,出错可能是致命的。

经过第三方验证的:没有。在我能确认的范围内,Gemini Robotics 2 的任何一个数字,都没有被独立机构复现或验证过。硬件(Apollo 2、Franka Duo)和模型都无法从外部自由获取,这使得复现在结构上就很困难。ER 2 目前只通过 Google AI Studio 和 Gemini Enterprise Agent Platform 的私有预览提供,VLA 和端侧模型也只向早期接入的合作伙伴开放。

安全性这一侧倒是有一块可以核实的部分。一个名为 ASIMOV-Agentic 的安全基准测试已经以 CC-BY-4.0 协议发布在 Hugging Face 上,还附有一份单独的安全技术报告。DeepMind 表示,ER 2 在约束遵守和人类近距离接触相关的基准测试中,是他们迄今为止最安全的机器人模型。基准测试被公开出来,至少意味着外部人士可以用同一把尺子去衡量另一个模型 —— 这是一个有实质意义的差别。

说句实话,发布材料把 36%、32% 这样偏低的数字原样放进表格里,这件事本身在这个领域就很少见 —— 毕竟挑几个好看的成功率来展示实在太容易了。这不代表结果已经被验证,但至少让读者能看清哪些地方还做不到。

结语 —— 剩下的问题不是数据,而是失败的可观测性

我认为这次发布真正改变的东西有三样。移动和操作被统一进了同一个策略里,适应新身体的成本降到了几个小时的量级,不同种类的机器人能以语言为接口进行协作也得到了验证。这三者方向都是对的。

没有改变的是这些。

  • 接触一旦介入,成功率就会崩塌。 拧开和拧上灯泡之间那 56 个百分点的差距,正是对这一点最好的概括。这究竟是靠加数据就能解决的问题,还是触觉感知和阻抗控制那一侧的问题,目前还没有定论。
  • 没有办法对失败进行调试。 VLA 把感知、规划、控制折叠成了一个整体,代价是失败原因没法再按层拆解。ER 2 进度分类准确率只有 57.4%,意味着机器人自己判断"现在出问题了"的能力也就刚过一半,自主恢复能力得建立在这之上。
  • 评估是碎片化的。 只要没有共用的基准测试,公布出来的成功率就没法用来做厂商间的横向比较。在"同时公开试验次数和判定标准"成为常规做法之前,表格里的数字只有拿来和同一个团队的上一版本比较时才有意义。

机器人基础模型现在所处的位置,看起来很接近语言模型 2020 年前后所在的位置。能力曲线明显在向上走,只是眼下还没有一把所有人都能共用的尺子来度量它。