专题 · FULL STORY

谷歌Gemini Robotics 2:从曝光到实测

谷歌新一代具身智能模型Gemini Robotics 2及ER 2经历了从传闻曝光到正式发布的完整过程。新模型突破了上半身任务局限,实现全身智能,实测显示其在准确性与鲁棒性上表现惊艳,但泛化能力仍受限。

2026-07-30 ~ 2026-08-07 · 6 集 · 86 条

第 1 集 · Google Gemini Robotics 2.0 曝光(2026-07-30,2 条)

Google DeepMind 的 Gemini Robotics 机器人模型即将迎来 2.0 版本的重大更新。最新推文爆料暗示了“Gemini Robotics, take 2”,预示着该模型在继 4 月份发布之后,已取得新的技术进展并曝光了全新演示,引发外界对其后续能力的期待。

第 2 集 · 谷歌发布Gemini Robotics 2与ER 2,赋能机器人全身智能(2026-07-30,71 条)

谷歌DeepMind正式发布新一代视觉-语言-动作(VLA)模型Gemini Robotics 2及具身推理模型Gemini Robotics ER 2。新模型打破传统机器人依赖预编程或遥操作的限制,赋予人形机器人全身智能控制、高级灵巧操作与跨本体协作能力,标志着具身智能从局部桌面任务向适应现实人类环境的全身智能过渡。

已确认

  • 核心发布:官方推出Gemini Robotics 2及ER 2模型,共同构成驱动具身智能突破的模型矩阵。其中ER 2模型已上线Gemini API和Google AI Studio,可直接连接Gemini Live API。
  • 全身控制:Gemini Robotics 2能够协调从脚趾到指尖的动作,使机器人在保持平衡行走的同时,于狭窄杂乱空间中完成伸展和弯腰等动作。在演示中,该模型为Apptronik的Apollo 2机器人提供了全身智能,使其能完成复杂厨房家务。
  • 灵巧操作:模型具备跨不同末端执行器(如机械手或夹爪)的精细操作能力,可完成打结、拧灯泡等高难度动作。据Matt Wolfe介绍,新模型实现了22个自由度的精准操控,并支持端侧运行。
  • 多机协作:引入多机器人团队协作功能,允许不同类型机器人间进行实时通信与协同(如分别负责抓取、组装和质检),解决单机无法独立完成的复杂工作流程。
  • 具身推理:Gemini Robotics ER 2作为机器人的高级“大脑”,相比上一代与基线版Gemini 3.6 Flash,其在视频理解、任务编排、高级空间推理及多机器人协作上取得显著进展。
  • 实际演示:据bousmalis,Gemini Robotics 2在FR3 Duo硬件上成功完成长达20分钟的不间断实时工具分拣任务,展现出泛化的灵巧操作精度。

为什么重要

  • 此次发布标志着机器人智能向真正的通用适应性迈进。通过“一个大脑适配任何机器人”的理念,新系统大幅提升了综合感知、运动协调及多步骤任务规划能力,有望在家庭和工作场所等复杂未知环境中发挥更实际的辅助作用。

还有 51 条相关讨论 →

第 3 集 · 谷歌 DeepMind 发布 Gemini Robotics 2 模型(2026-08-02,4 条)

Google DeepMind 正式发布了 Gemini Robotics 2 机器人模型族。新模型实现了重大突破,不仅能够完全通过仿真学习新任务并成功转移到现实世界,有效弥合了 sim2real 差距,还增加了全身控制、灵巧精细操作以及多机器人协同合作的能力,标志着向实现真正实用的自适应机器人迈出了重要一步。

第 4 集 · GPT-5.6与Gemini机器人模型实测表现惊艳但泛化受限(2026-08-03,3 条)

近期专家与网友对 Gemini-Robotics-ER-2 和 GPT-5.6-Sol 等机器人模型进行了实测。结果显示,这些模型在准确性和鲁棒性上表现惊艳,但在实际部署中仍面临挑战。测试中甚至出现了机械臂失控掉落桌外的翻车情况。研究者指出,跨环境泛化能力不足是当前具身智能的痛点,而突破这一瓶颈的关键在于获取更多真实的物理世界数据。

第 5 集 · Google DeepMind发布Gemini Robotics 2模型(2026-08-04,4 条)

Google DeepMind 发布了 Gemini Robotics 2 视觉-语言-动作模型。该模型突破了以往仅能处理上半身桌面任务的局限,实现了对整个人形机器人从脚趾到指尖的全面控制。作为机器人的“大脑”,它通过实时分析视频流精确判断动作时机,支持多机器人协同,并在未知场景中展现出强大的泛化能力与极高的鲁棒性。

第 6 集 · 谷歌 DeepMind 发布 Gemini Robotics 2(2026-08-07,2 条)

谷歌 DeepMind 发布了新一代物理 AI 模型 Gemini Robotics 2。作为先进的视觉-语言-动作模型,它旨在为新一代自适应机器人提供智能核心。该模型实现了全身控制、高级灵巧操作以及多机器人协作能力,进一步推动了具身智能技术的发展。