Google 连发三款具身智能模型,突破机器人“时间智能”
aigclink · x · 2026-07-31
Google一口气发布了三款面向具身智能的模型,核心在于解决让机器人不仅“能干活”,还能“知道活干完没”的时间智能问题。
- Gemini Robotics 2:视觉-语言-动作(VLA)模型,负责机器人的物理运动控制(闭源)。
- Gemini Robotics ER 2:具身推理模型,负责“大脑”功能,能看视频、规划多步任务并编排,将执行交给 VLA(闭源)。
- On-Device 2:可在本地端侧运行,几小时内即可适应新的机器人躯体(开源)。
ER 2 的核心突破:
- 进度分类:将视频帧分为五档进度,准确率达 57.4%。
- 精确找时刻:识别关键事件发生帧(如停止倒咖啡),准确率 91.3%,平均误差仅 0.96 秒,以低算力实现亚秒级延迟。
- 无缝交互:接入 Gemini Live API 双向流,边做边想无卡顿,并能原生调用 Google Search 等工具。
- 多机协作:实现了 Apollo 2 与 Franka F3 Duo 的任务交接,并演示了用语音指挥波士顿动力 Spot 取物。
ER 2 现已通过 Gemini API 和 AI Studio 向开发者开放。
所属事件:谷歌发布Gemini Robotics 2与ER 2,赋能机器人全身智能(69 条相关)→
「具身」频道最新
- 实测特斯拉最新自动驾驶:跨州长途实测表现优于人类 — Scobleizer · 2026-08-01
- 特斯拉FSD实测:一次跑通数百公里,仅走错一次匝道并自行纠正 — Scobleizer · 2026-08-01
- 加州初创打造两米高半马机器人,专攻火灾等灾区救援 — SydSteyerhart · 2026-08-01
- AI 让《使命召唤》心跳传感器成真:无线电波感知物理世界 — bilawalsidhu · 2026-08-01
- VLM run 将 Gemini Robotics ER 2 接入 Orion 2 视觉智能体 — spillai · 2026-08-01
- 机器人目标导航测试:接近终点时意外跳出「魔性舞步」 — carlosdponx · 2026-08-01