谷歌DeepMind发布Gemini Robotics 2:新一代物理AI系统
谷歌DeepMind宣布推出Gemini Robotics 2,这是一款下一代物理AI系统,能够实现人形机器人的全身控制、高级灵巧操作以及多机器人协作。该系统包含三个模型:视觉-语言-动作模型、真实世界视频理解模型以及可快速适应新机器人本体的本地模型。这标志着机器人在家庭和工作场所部署迈出了重要一步。
谷歌DeepMind宣布推出Gemini Robotics 2,这是一款下一代物理AI系统,能够实现人形机器人的全身控制、高级灵巧操作以及多机器人协作。该系统包含三个模型:视觉-语言-动作模型、真实世界视频理解模型以及可快速适应新机器人本体的本地模型。这标志着机器人在家庭和工作场所部署迈出了重要一步。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Google DeepMind 发布 Gemini Robotics ER 2,一个为机器人设计的“高级大脑”,通过实时视频理解、任务编排和多机器人协作,让机器人能更灵活地应对物理世界。
Gemini Robotics ER 2 的核心突破在于将视频理解与任务编排深度结合。模型通过持续观看机器人自身的视频流,实时跟踪任务进度,在出现错误时自主调整,并精确判断何时进入下一步。这种“时间智能”解决了机器人领域一个长期难题:如何知道任务何时完成。
与上一代 ER 1.6 相比,ER 2 在工具编排方面持续领先,评估覆盖真实 VLA、模拟 VLA 和人类远程操控三种控制模式。模型的设计允许机器人“边行动边思考”,即同时进行下一步推理和当前动作执行,避免了传统“停下思考”的停顿。
ER 2 首次引入多机器人协作能力,使多个机器人能在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流。这标志着机器人从独立执行任务向群体智能的跨越。
模型通过声明低层控制接口(如 VLA 模型或导航 API)为工具,并流式传输多模态视频、音频或文本,实现灵活的协作编排。开发者可以基于此构建多机器人协同的物理 AI 应用。
Gemini Robotics ER 2 已通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform(私有预览)向开发者开放。模型集成 Gemini Live API,利用双向流式端点优化延迟敏感任务,实现流畅的实时交互。
为加速应用落地,Google DeepMind 提供了配置和提示示例,并与 Boston Dynamics 合作展示了 Spot 机器人通过自然语言指令取物的 demo。相关代码已在 GitHub 开源,开发者可直接复用。
本文信息全部来自 Google DeepMind 官方博客,属于第一方产品发布声明。所有能力描述均为公司自称,未经第三方独立验证。
Gemini Robotics ER 2 通过视频理解、实时任务编排和多机器人协作,为机器人提供了更强大的“大脑”,但实际性能仍需开发者通过公开 API 自行验证。
主报道
主报道来源
另有 3 个来源报道