返回信息流
新闻事件
A重点76
Google DeepMind (X)
4 个来源

谷歌DeepMind发布Gemini Robotics 2:新一代物理AI系统

谷歌DeepMind宣布推出Gemini Robotics 2,这是一款下一代物理AI系统,能够实现人形机器人的全身控制、高级灵巧操作以及多机器人协作。该系统包含三个模型:视觉-语言-动作模型、真实世界视频理解模型以及可快速适应新机器人本体的本地模型。这标志着机器人在家庭和工作场所部署迈出了重要一步。

SynthePulse Insight · AI 深度解读

Gemini Robotics ER 2:视频理解驱动的机器人“大脑”

版本 1 · 1 个来源

Google DeepMind 发布 Gemini Robotics ER 2,一个为机器人设计的“高级大脑”,通过实时视频理解、任务编排和多机器人协作,让机器人能更灵活地应对物理世界。

  • Gemini Robotics ER 2 是一个“具身推理”模型,作为机器人的高级大脑,负责理解物理世界、规划多步骤任务,并将执行交给低层 VLA 模型。
  • 模型通过连续视频流跟踪进度、实时纠错,并知道何时进入下一步,相比 ER 1.6 有显著提升。
  • 支持多机器人协作,使多个机器人能在共享空间共同完成单个机器人无法完成的复杂工作流。
  • 已通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 向开发者公开。
  • 集成 Gemini Live API,使用双向流式端点优化延迟,实现流畅的任务编排,避免“停下思考”的停顿。
  • 与 Boston Dynamics 的 Spot 合作演示,通过自然语言指令让机器人取物,代码已在 GitHub 开源。
展开章节目录从“思考”到“行动”:实时视频理解驱动的任务编排

从“思考”到“行动”:实时视频理解驱动的任务编排

Gemini Robotics ER 2 的核心突破在于将视频理解与任务编排深度结合。模型通过持续观看机器人自身的视频流,实时跟踪任务进度,在出现错误时自主调整,并精确判断何时进入下一步。这种“时间智能”解决了机器人领域一个长期难题:如何知道任务何时完成。

与上一代 ER 1.6 相比,ER 2 在工具编排方面持续领先,评估覆盖真实 VLA、模拟 VLA 和人类远程操控三种控制模式。模型的设计允许机器人“边行动边思考”,即同时进行下一步推理和当前动作执行,避免了传统“停下思考”的停顿。

多机器人协作:从单机智能到群体智能

ER 2 首次引入多机器人协作能力,使多个机器人能在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流。这标志着机器人从独立执行任务向群体智能的跨越。

模型通过声明低层控制接口(如 VLA 模型或导航 API)为工具,并流式传输多模态视频、音频或文本,实现灵活的协作编排。开发者可以基于此构建多机器人协同的物理 AI 应用。

开放生态:API 与开源示例降低开发门槛

Gemini Robotics ER 2 已通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform(私有预览)向开发者开放。模型集成 Gemini Live API,利用双向流式端点优化延迟敏感任务,实现流畅的实时交互。

为加速应用落地,Google DeepMind 提供了配置和提示示例,并与 Boston Dynamics 合作展示了 Spot 机器人通过自然语言指令取物的 demo。相关代码已在 GitHub 开源,开发者可直接复用。

可信度边界

本文信息全部来自 Google DeepMind 官方博客,属于第一方产品发布声明。所有能力描述均为公司自称,未经第三方独立验证。

核心结论

Gemini Robotics ER 2 通过视频理解、实时任务编排和多机器人协作,为机器人提供了更强大的“大脑”,但实际性能仍需开发者通过公开 API 自行验证。