TEMPO 给 VLA 补上时间上下文,机器人接瓶成功率从 44% 升到 74%
_krishna_murthy · x · 2026-10-08
UC Irvine 团队在 CoRL 2026 口头报告发表 TEMPO,解决 VLA 模型在动态操作(接球、向移动容器倒水、从路人手中拿瓶)中的失败问题。
- 问题诊断:VLA 单帧观测导致两类失败——运动模糊(无法预判运动物体未来状态)与状态混叠(视觉相似但需不同动作),且与模型规模和推理延迟无关,瓶颈在缺失时间上下文。
- 方法:不动主干,给预训练 VLA 增加两路时序输入——冻结视频基础模型提取的运动摘要、紧凑的本体感知历史,训练与部署开销极小。
- 结果:1500+ 次真机评测(每个成功率 50 次运行),Bottle Handover 成功率 44%→74%,是唯一解决状态混叠的方法。
- 开源:论文、代码、数据及含 5 万+标注帧的 TEMPO-Bench 全部公开。
「具身」频道最新
- ProHand 2 Power 灵巧手亮相 IROS 2026,触觉与力控成行业共识 — imankitgoyal · 2026-10-08
- Surface RTX Spark Ultra 售价 2599 美元起,Dev Box 5999 美元开订 — ryanshrout · 2026-10-08
- 机器人进英国诊所自动备牙,牙医角色是诊断而非操作 — LexiLove · 2026-10-08
- 微软将推 Builder PC,与 Copilot+ PC 区分高端 AI 设备线 — ryanshrout · 2026-10-08
- 抗冲击巡检无人机亮相:可深入人类难以抵达场所做 3D 扫描 — LexiLove · 2026-10-08
- Generalist AI 展示 GEN-1.5 机器人反复装配液压密封圈 — LexiLove · 2026-10-08