
Gemini Robotics 2:Google 把机器人的动作、推理和本地适配拆成三层
Google DeepMind 的 Gemini Robotics 2 把全身动作、连续视频进度理解和本地机器人适配分给三个模型,本文拆解各层证据、指标与部署边界。
Google DeepMind 7 月 30 日发布 Gemini Robotics 2,核心交付是一套分工清晰的机器人模型栈:VLA 负责把视觉和语言变成运动,ER 2 负责理解环境、规划步骤、监控进度和调用工具,On-Device 2 负责在机器人本地执行并快速适配新的身体形态。公开证据支持这三层各自变强,但还不支持「任意机器人都能自主完成任意任务」这个更大的结论。1
三个模型,三种闭环
| 模型 | 在机器人系统里的位置 | 这次公开的变化 | 当前边界 |
|---|---|---|---|
| Gemini Robotics 2 VLA(官方正文简称 Gemini Robotics 2) | 低层动作模型 | 从上肢桌面操作扩展到双臂、全身运动和更灵巧的手部操作 1 | 多指灵巧操作仍然困难,公开材料没有给出端到端任务成功率 1 |
| Gemini Robotics ER 2 | 高层具身推理与工具编排 | 通过连续视频理解进度,发现关键时刻,协调 VLA、机器人 API 和多机器人协作 2 | 公开使用渠道主要是 API、AI Studio 和私有预览,模型仍会产生错误判断 3 4 |
| Gemini Robotics On-Device 2 | 本地 VLA | 在机器人设备上运行,用几小时、通常少于 200 个示例适配新的双臂形态 1 | 受限于分布外任务和高自由度机器人,当前仅向 Trusted Testers 提供 5 |
这不是把同一个模型简单拆成三个 SKU。三者对应的是三个不同的控制回路:动作模型需要低延迟和身体适配,推理模型需要处理长任务与失败恢复,本地模型则要在网络不可靠或不能联网时继续工作。Google 的开发者文档也把 ER 2 的能力拆成空间推理、Agentic Vision、任务编排、流式交互和视频进度理解。3
VLA 的进步:同一检查点控制不同身体
过去的难点不只是让机器人「知道该拿什么」,还包括把同一个意图映射到不同的腿、臂、手、传感器和自由度。DeepMind 这次展示同一个 Gemini Robotics 2 检查点控制三种形态:搭载 SharpaWave 手的 Apptronik Apollo 2、搭载 Inspire 手的 Apollo 2,以及安装 Robotiq 夹爪的 Franka Duo。任务覆盖全身运动、夹爪操作和多指操作。1
全身控制的变化很具体。以 Apollo 2 为例,模型可以根据「把底层架子上的浇水壶放进绿色箱子」这样的指令,走到桌旁、弯腰取物、移动到货架,再把物体放到指定位置。五指 SharpaWave 手可以完成打结、封 Ziplock 袋等动作;Franka Duo 的双指平行夹爪则被用于紧密装箱。官方仍然说需要继续提升精度和速度,距离人类水平灵巧度还有距离。1
这组展示说明了两个层次的迁移。模型可以把空间和语言意图传给不同的执行器,也可以在同一机器人上协调脚步、躯干、手臂和手指。但「多种身体可用」不等于「任意身体免调参」:官方图注明确指出,整体和夹爪类任务达到中高成功率,多指灵巧操作仍是难点。公开博客没有披露训练数据量、控制频率、各类任务的完整分母或统一的跨身体基准,因此不能从演示推断出通用的运动控制能力。1
ER 2 把「任务做完了吗」变成可测的时间问题
VLA 负责动作,ER 2 负责判断下一步是否该动作。Google 将它定义为高层具身推理模型:它接收文字、图像、视频和音频,理解物理环境,把 VLA 或自定义机器人 API 当作工具,并在多步骤任务中持续编排这些工具。ER 2 基于 Gemini 3.5 Flash,公开模型卡给出的上下文窗口上限为 128K。4
连续视频的价值在于给每一步动作加上反馈。机器人拧灯泡、倒咖啡或系垃圾袋时,系统不能只问「下一步是什么」,还要判断当前动作是否已经成功、失败,还是仍在进行。ER 2 的进度分类把视频中的每一帧划入五个完成度区间;Google 博客报告其准确率为 57.4%。在关键时刻定位任务上,报告准确率为 91.3%,平均绝对时间距离为 0.96 秒,并称其执行速度约为更大模型类别的 4 倍。2
ER 2 的流式版本把这个闭环做得更像机器人控制器,而不是一次性问答。官方提供
gemini-robotics-er-2-streaming-preview,通过 Gemini Live API 建立有状态的双向连接;应用把导航、抓取、说话等动作声明为工具,执行器完成动作后回传结果,模型再选择下一步。文档要求物理动作使用 BLOCKING 行为,让模型等动作完成后再做决定;视频输入当前限制为每秒一帧 JPEG。6多机器人协作也依赖这层语义编排。不同机器人可以共享任务状态,分派子任务并完成交接:轮式机器人适合室内移动,人形机器人可能更适合复杂地形,ER 2 负责把它们放进同一个任务流程。这个设计的意义不是让每个机器人都变成全能体,而是让专长不同的执行器共享一个可追踪的任务状态。2
On-Device 2 解决的是延迟和适配成本
依赖云端推理的机器人会遇到两个硬约束:网络延迟会打断反馈回路,断网则无法继续执行。Gemini Robotics On-Device 2 面向本地设备运行,输入包括文字、图像和机器人本体感知数值,输出是数值化的机器人动作。模型卡把它定位为适用于多种双臂机器人的本地 VLA,并说明它目前只向 Trusted Testers 分发。5
它的卖点是适配速度:DeepMind 称新双臂形态通常只需几小时、少于 200 个示例就能适配,即使形状、传感器和自由度差异很大。这个数字更接近「把模型迁移到新身体的起始成本」,不是「机器人学会所有任务只需要 200 个示例」。1
模型卡同时给出限制:On-Device 2 对分布外任务和高自由度机器人仍然不擅长;它主要在站立式双臂操作上评估,移动平台和全身控制的安全风险不在当前评估范围内。官方建议用高层具身推理模型做语义安全,用低层控制器负责无碰撞运动、平衡和力控制,再加上针对硬件的功能安全机制。5
公开可用的部分,离机器人落地还有多远
截至这次发布,ER 2 可在 Google AI Studio 和 Gemini API 使用,并在 Gemini Enterprise Agent Platform 中私有预览;VLA 和 On-Device 2 面向早期访问伙伴,On-Device 2 的模型卡则写明只向 Trusted Testers 分发。也就是说,开发者现在更容易试用的是高层推理和编排,真正输出电机动作的模型仍处于受控访问阶段。145
安全部分也应该按层看。DeepMind 发布了 ASIMOV-Agentic,用来评估具身推理模型能否拒绝不安全的工具调用、判断任务是否可行,并在不确定时请求人工介入;Google 还报告 ER 2 在安全指令遵循和人类近距离场景上有改进,能够在人靠近时让人形机器人停止。1
这些措施不是安全认证。开发者文档仍提醒模型会产生错误信息,复杂查询和高思考级别会增加延迟;ER 2 模型卡明确要求谨慎用于生产、商业或公共环境,并禁止把 Robotics Models 用于医疗、交通等安全关键场景。34
这次发布真正改变的是机器人系统的分工方式:VLA 把意图落到身体动作,ER 2 用连续视频检查动作是否推进,On-Device 2 把一部分控制回路放回本地。三层叠起来,机器人可以更长时间地执行任务,也更容易在不同身体之间迁移;但公开材料没有给出统一的端到端任务成功率、成本、人工接管率或任意形态机器人的安全保证。当前最稳妥的判断是:Gemini Robotics 2 把「能做动作」推进成「能感知进度、协调执行和快速适配」,距离无需针对身体和环境做工程约束的通用机器人,仍有一段明确的距离。
References
- 1Gemini Robotics 2 brings whole body intelligence to robots
- 2Gemini Robotics ER 2:powering robotics with video understanding, task orchestration, and multi-robot collaboration
- 3Gemini Robotics ER API overview
- 4Gemini Robotics ER 2 - Model Card
- 5Gemini Robotics On-Device 2 - Model Card
- 6Robotics with streaming
Related content
- Sign in to comment.
More from this channel›
- OpenAI 公布十项数学与理论计算机科学结果:Lean 证书把证据链推进到哪一步
- Seedance 2.5:从 30 秒长叙事到时间戳编辑,视频生成开始接近一条时间线
- Science One Framework:Google 把自主科研的验收标准改成「每个结论都能追证据」
- GPT-5.6 的 20% serving 成本下降:OpenAI 把优化推进到内核和 Agent harness
- ARC-AGI-3 从 13.3% 到 38.3%:OpenAI 拆解 Agent 基准的 harness 影响
- OpenAI 的 8 个科研计算案例:Agent 加速了代码,验证仍由人把关
- Claude Mythos Preview 找到 HAWK 与 7 轮 AES 的新攻击
