MotionVLA 入选 CoRL 2026:让机器人记住运动而非帧
yshan2u · x · 2026-09-08
华中科技大学 Xinggang Wang 团队的 MotionVLA 被 CoRL 2026 接收,论文已挂 arXiv(2606.08288)。
核心主张:VLA 模型该记住的是「运动」,而不是一帧帧画面。现有方法给模型喂历史帧、深度或 4D 特征来解决长时程操作的歧义,但当注入的证据不满足运动一致性时,会引入几何漂移、时序线索碎片化和动作生成不稳定。
方法:
- 把过去一小段视频窗口转成紧凑、时间连续的轨迹场 token;
- 当前视觉 token 从这段历史中检索与任务相关的运动信息;
- 在轨迹监督下重新耦合回 VLA 主干。
在仿真基准和初步真机实验中,MotionVLA 提升了长时程操作表现,动作执行更平滑直接。结论:有效的 VLA 记忆关键不是堆更多 4D 上下文,而是提供可用于控制的运动一致证据。
「具身」频道最新
- 开发者给复刻档案库做了刷短视频式手机 UI — Josikinz · 2026-09-08
- USC 实验室发布 SIMPLE:60 项全身任务仿真基准评测 VLA 模型 — zhengyiluo · 2026-09-08
- 群体机器人研究:资源匮乏环境下高社交性进化优势消失 — abenitezburraco · 2026-09-08
- 用 GPT-6 Astra 造 3D 网站,人形机器人解剖成 1168 个 CAD 部件 — freelerobot · 2026-09-08
- 伯克利研究员:机器人控制别只跑 VLA,harness 加工具调用更便宜可靠 — rbhar90 · 2026-09-08
- 网友让 Grok 遥控 Roland 钢琴,即兴弹奏浪漫风格曲目 — yunta_tsai · 2026-09-08