专题 · FULL STORY

谷歌Gemini Robotics 2发布与实测进展

谷歌DeepMind发布Gemini Robotics 2及ER 2模型,突破上半身任务局限,实现全身智能控制与具身推理。后续实测表明,该模型在准确性与鲁棒性上表现惊艳,但泛化能力仍存在局限。

2026-07-30 ~ 2026-08-09 · 7 集 · 92 条

第 1 集 · Google Gemini Robotics 2.0 曝光(2026-07-30,2 条)

Google DeepMind 的 Gemini Robotics 机器人模型即将迎来 2.0 版本的重大更新。最新推文爆料暗示了“Gemini Robotics, take 2”,预示着该模型在继 4 月份发布之后,已取得新的技术进展并曝光了全新演示,引发外界对其后续能力的期待。

第 2 集 · 谷歌发布Gemini Robotics 2与ER 2,赋能机器人全身智能(2026-07-30,71 条)

谷歌DeepMind正式发布新一代视觉-语言-动作(VLA)模型Gemini Robotics 2及具身推理模型Gemini Robotics ER 2。新模型打破传统机器人依赖预编程或遥操作的限制,赋予人形机器人全身智能控制、高级灵巧操作与跨本体协作能力,标志着具身智能从局部桌面任务向适应现实人类环境的全身智能过渡。

已确认

  • 核心发布:官方推出Gemini Robotics 2及ER 2模型,共同构成驱动具身智能突破的模型矩阵。其中ER 2模型已上线Gemini API和Google AI Studio,可直接连接Gemini Live API。
  • 全身控制:Gemini Robotics 2能够协调从脚趾到指尖的动作,使机器人在保持平衡行走的同时,于狭窄杂乱空间中完成伸展和弯腰等动作。在演示中,该模型为Apptronik的Apollo 2机器人提供了全身智能,使其能完成复杂厨房家务。
  • 灵巧操作:模型具备跨不同末端执行器(如机械手或夹爪)的精细操作能力,可完成打结、拧灯泡等高难度动作。据Matt Wolfe介绍,新模型实现了22个自由度的精准操控,并支持端侧运行。
  • 多机协作:引入多机器人团队协作功能,允许不同类型机器人间进行实时通信与协同(如分别负责抓取、组装和质检),解决单机无法独立完成的复杂工作流程。
  • 具身推理:Gemini Robotics ER 2作为机器人的高级“大脑”,相比上一代与基线版Gemini 3.6 Flash,其在视频理解、任务编排、高级空间推理及多机器人协作上取得显著进展。
  • 实际演示:据bousmalis,Gemini Robotics 2在FR3 Duo硬件上成功完成长达20分钟的不间断实时工具分拣任务,展现出泛化的灵巧操作精度。

为什么重要

  • 此次发布标志着机器人智能向真正的通用适应性迈进。通过“一个大脑适配任何机器人”的理念,新系统大幅提升了综合感知、运动协调及多步骤任务规划能力,有望在家庭和工作场所等复杂未知环境中发挥更实际的辅助作用。

还有 51 条相关讨论 →

第 3 集 · 谷歌 DeepMind 发布 Gemini Robotics 2 模型(2026-08-02,4 条)

Google DeepMind 正式发布了 Gemini Robotics 2 机器人模型族。新模型实现了重大突破,不仅能够完全通过仿真学习新任务并成功转移到现实世界,有效弥合了 sim2real 差距,还增加了全身控制、灵巧精细操作以及多机器人协同合作的能力,标志着向实现真正实用的自适应机器人迈出了重要一步。

第 4 集 · GPT-5.6与Gemini机器人模型实测表现惊艳但泛化受限(2026-08-03,3 条)

近期专家与网友对 Gemini-Robotics-ER-2 和 GPT-5.6-Sol 等机器人模型进行了实测。结果显示,这些模型在准确性和鲁棒性上表现惊艳,但在实际部署中仍面临挑战。测试中甚至出现了机械臂失控掉落桌外的翻车情况。研究者指出,跨环境泛化能力不足是当前具身智能的痛点,而突破这一瓶颈的关键在于获取更多真实的物理世界数据。

第 5 集 · Google DeepMind发布Gemini Robotics 2模型(2026-08-04,4 条)

Google DeepMind 发布了 Gemini Robotics 2 视觉-语言-动作模型。该模型突破了以往仅能处理上半身桌面任务的局限,实现了对整个人形机器人从脚趾到指尖的全面控制。作为机器人的“大脑”,它通过实时分析视频流精确判断动作时机,支持多机器人协同,并在未知场景中展现出强大的泛化能力与极高的鲁棒性。

第 6 集 · 谷歌DeepMind发布Gemini Robotics 2,实现全身智能控制(2026-08-07,6 条)

谷歌DeepMind于8月7日正式发布新一代机器人智能模型Gemini Robotics 2。作为视觉-语言-动作模型(VLA),该模型为新一代自适应机器人提供智能层,将多模态理解与全身控制相结合,实现全身智能控制、高级灵巧操作和多机器人协作三大突破。官方发布了与代号Apollo的机器人交互的视频,展示自然语言对话与具身智能表现。这标志着具身智能在全身协调与协作能力上的重要进展。

已确认

  • 模型定位:Gemini Robotics 2作为先进的VLA模型,是机器人的智能大脑,使其能够推理每一个动作并执行复杂任务。
  • 核心能力:官方宣布实现三大突破,包括全身智能控制(如人形机器人自主行走)、高级灵巧操作(如处理鸡蛋)以及多机器人协作。
  • 官方演示:发布了与代号Apollo的机器人交互的视频,重点演示了自然语言对话与具身智能表现。
  • 幕后分享:团队探讨了设计考量,例如在人形腿与轮式机器人之间的选择。

尚未确认

  • 具体的技术细节、参数规模和训练数据未在帖子中披露。
  • 实际应用场景与商业化落地计划尚未公布。

为什么重要

Gemini Robotics 2将多模态理解与全身控制深度结合,是物理AI领域的重要进展。其展现的全身控制与多机器人协作能力,有望推动人形机器人在复杂环境中的实用化,对工业、服务等应用场景具有潜在影响。

第 7 集 · 谷歌发布Gemini Robotics ER 2模型(2026-08-09,2 条)

Google DeepMind正式发布了Gemini Robotics ER 2模型,旨在为机器人提供更高级的“大脑”。该模型实现了重大技术突破,支持机器人在运动时进行实时思考,具备实时视频理解、多机器人协作以及亚秒级超低延迟能力。这些升级将极大提升机器狗等设备的复杂环境感知与协同作业水平。