视觉信号遇瓶颈?FM-VLA 引入力觉解决机器人动作模糊

stepjamUK · x · 2026-08-06

当前主流的视觉-语言-动作(VLA)模型大多基于马尔可夫假设,直接将当前视觉帧映射为下一步动作。为了弥补时序信息的缺失,主流做法通常是堆叠更多的视觉历史帧或增加图像上下文。

然而,对于“连续按三次按钮”这类场景几乎不发生视觉变化的任务,单纯依靠视觉会产生严重的歧义。FM-VLA 提出了一种新思路:引入高频的力/力矩传感器信号。力觉数据在每次按压时都会产生清晰、独特的峰值,从而消除了视觉无法分辨动作次数的模糊性。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →