专题 · FULL STORY

谷歌Gemini Robotics 2模型发布

谷歌DeepMind的Gemini Robotics机器人模型此前流出2.0版本更新爆料。随后官方正式发布了新一代视觉-语言-动作模型及具身推理模型,引发广泛关注。

2026-07-30 ~ 2026-07-31 · 2 集 · 22 条

第 1 集 · Google Gemini Robotics 2.0 曝光(2026-07-30,2 条)

Google DeepMind 的 Gemini Robotics 机器人模型即将迎来 2.0 版本的重大更新。最新推文爆料暗示了“Gemini Robotics, take 2”,预示着该模型在继 4 月份发布之后,已取得新的技术进展并曝光了全新演示,引发外界对其后续能力的期待。

第 2 集 · 谷歌DeepMind发布Gemini Robotics 2模型(2026-07-30,20 条)

Google DeepMind 正式发布新一代视觉-语言-动作(VLA)模型 Gemini Robotics 2 及具身推理模型 Gemini Robotics ER 2。新模型矩阵打破了传统机器人依赖预编程或遥操作的限制,赋予人形机器人、工业机械臂等设备全身智能控制与跨本体协作能力,标志着具身智能从局部桌面任务向适应现实人类环境的全身智能过渡。

已确认

  • 核心发布:官方推出 Gemini Robotics 2 及 ER 2 模型,共同构成驱动具身智能突破的模型矩阵。其中 ER 2 模型已上线 Gemini API 和 Google AI Studio。
  • 全身控制:Gemini Robotics 2 能够协调从脚趾到指尖的动作,使机器人在保持平衡行走的同时,于狭窄杂乱空间中完成伸展和弯腰等动作。
  • 灵巧操作:模型具备跨不同末端执行器(如机械手或夹爪)的精细操作能力,可完成打结、拧灯泡等高难度动作。据作者 Matt Wolfe 介绍,新模型实现了 22 个自由度的精准操控,并支持端侧运行。
  • 多机协作:引入多机器人团队协作功能,允许不同类型机器人间进行通信与协同,解决单机无法独立完成的复杂工作流程。
  • 具身推理:Gemini Robotics ER 2 作为机器人的高级“大脑”,可直接连接 Gemini Live API。相比上一代与基线版 Gemini 3.6 Flash,其在视频理解、任务编排、高级空间推理及多机器人协作上取得显著进展。

为什么重要

  • 此次发布标志着机器人智能向真正的通用适应性迈进。通过“一个大脑适配任何机器人”的理念,新系统大幅提升了综合感知、运动协调及多步骤任务规划能力,有望在家庭和工作场所等复杂未知环境中发挥更实际的辅助作用。