视觉信号遇瓶颈?FM-VLA 引入力觉解决机器人动作模糊
stepjamUK · x · 2026-08-06
当前主流的视觉-语言-动作(VLA)模型大多基于马尔可夫假设,直接将当前视觉帧映射为下一步动作。为了弥补时序信息的缺失,主流做法通常是堆叠更多的视觉历史帧或增加图像上下文。
然而,对于“连续按三次按钮”这类场景几乎不发生视觉变化的任务,单纯依靠视觉会产生严重的歧义。FM-VLA 提出了一种新思路:引入高频的力/力矩传感器信号。力觉数据在每次按压时都会产生清晰、独特的峰值,从而消除了视觉无法分辨动作次数的模糊性。
「具身」频道最新
- Walden Robotics:机器人自主性是一个比例而非二元开关 — adnothing · 2026-08-06
- 机器人强化学习教程:用 PPO 算法训练智能体保持平衡 — ShawnHymel · 2026-08-06
- AI 自动化机械进军建筑业:太阳能与基建场景加速落地 — aarthir · 2026-08-06
- 独立开发者迭代机器人设计:模块化拼装提升可维修性 — _Stocko_ · 2026-08-06
- 自研触觉传感器让机器人“感受”画笔,提升抓取精细度 — MonaJalal_ · 2026-08-06
- OpenAI 招聘曝光硬件版图:进军个人 AGI 设备与机器人量产 — flowersslop · 2026-08-06