MotorMind:通用 VLM 免训练操控真机机器人,成功率 95%
UIUC-CS · hf · 2026-10-05
UIUC 提出 MotorMind,让通用视觉语言模型(VLM)直接操作机器人,无需专用策略训练、coding agent 或 SAM3 等外部工具。
- 思路:用「中层动作表示」把 VLM 提议的动作接到确定性机器人控制与反馈上,配异步监控与后台记忆更新,让 VLM 像人类遥操作员一样观察-行动-根据执行反馈调整
- 零样本成绩:LIBERO-PRO 基础套件成功率 66.7%(扰动下 53.8%),此前零样本方法最高仅 13.3%/19.2%
- 真机:在 xArm6 上跨直接操作与人为扰动场景平均成功率 95%
- 换更强 VLM 骨干可进一步提升;剩余失败主要源于视觉定位、具身推理与动作知识,随 VLM 能力增强而减少
结论:配备合适中层动作表示与异步执行框架后,通用 VLM 即可实现有效的零样本机器人操作。
「具身」频道最新
- Waymo 用户体验疑现退化:频繁卡死、急刹与突然变道 — henloitsjoyce · 2026-10-05
- 开源 Muse Gadgets SDK 上手:用 ESP32 自制 Muse 周边硬件 — op7418 · 2026-10-05
- 玩家让 Half-Life: Alyx 原生跑在 Vision Pro 上,无需 PC 和串流 — banteg · 2026-10-05
- 特斯拉 FSD 车队里程破 150 亿英里,一天跑完人类 60 辈子 — XFreeze · 2026-10-05
- 天津大学团队推出仅 3 克、可藏在头发里的非侵入脑机接口 — yogthos · 2026-10-05
- 华为已量产381款τ芯片;现代汽车将部署2.5万台Atlas机器人 — 创业邦 · 2026-10-05