Google DeepMind 于 2026 年 7 月 30 日介绍 Gemini Robotics ER 2,并将其定位为面向机器人应用的一次能力升级。公开摘要集中强调视频理解、工具编排和多机器人协作,目标是让机器人在现实任务中进行推理、协作并解决问题。相比只谈感知或动作生成,这一表述更关注如何把“看见”“安排步骤”“调用工具”和“共同执行”接成连续任务链。

三项能力为何要放在一起

从产品定位看,视频理解为机器人处理动态场景和任务过程提供输入,编排负责在多个步骤与可用工具之间组织执行,多机器人协作则进一步引入分工和配合。三者结合的意义,不只是增加功能清单,而是指向更完整的机器人应用链路:系统既要理解正在发生什么,也要决定下一步使用哪些能力,以及何时需要其他机器人参与。

这也说明,ER 2 的关注点不局限于单个动作是否成功,而是机器人能否围绕现实目标持续组织行为。不过,现有材料没有说明视频信息如何进入决策,也没有披露任务规划、记忆、通信或底层控制机制,暂时不能据此判断具体技术路线。

现阶段能确认什么

Google DeepMind 将这项进展描述为视频理解、工具编排和多机器人协作上的显著变化,但摘要没有提供实验设置、基准结果或对比数字。因此,目前更适合把 ER 2 看作一项明确的能力定位,而不是已经得到完整量化验证的性能结论。

对开发者而言,值得继续关注的工程问题包括:长视频或连续观察下的理解是否稳定,工具调用失败后能否恢复,多机器人之间如何同步状态,以及协作收益能否覆盖通信与调度成本。材料也未说明支持哪些机器人形态、工具接口和部署环境,现阶段无法判断接入门槛与通用程度。

我的判断

ER 2 的价值在于把机器人智能从单体感知与执行,推进到任务级编排和多主体协作这一更接近真实应用的问题上。视频理解、工具调用与协作如果能形成稳定闭环,可能有助于处理步骤更长、环境变化更多的任务。

但仅凭当前摘要,还不足以判断这一“能力跃迁”在可靠性、实时性和跨场景泛化上是否成立。它更像值得跟踪的系统方向,而非可以直接据此做部署决策的成熟方案。真正决定实用性的,仍会是可复现评测、失败案例、硬件适配范围,以及多机器人协作相对单机方案带来的实际增益。