NUS Show-Harness:给 VLM 一套语义接口就能操控真机器人

机器之心 · wechat · 2026-09-27

新加坡国立大学 ShowLab 团队发布 Show-Harness,思路是不再训练更大的机器人策略,而是在基础模型与机器人之间加一层语义动作接口:让 VLM 用"前后/左右移动、旋转、抓取、释放"等可读的语义单元做细粒度决策,由各机器人的解释器转成本地控制命令,跨本体只需换解释器。模型通过 perceive–reason–act 闭环持续修正,而非输出长计划盲执行。

真机实验覆盖 Franka 与 AgileX(含双臂),零样本 frontier VLM 跨任务成功率 89%、跨环境 100%、跨本体 93%,基线最高仅 57%65%;轻量后训练的 Qwen3.5-2B(仅 LoRA 更新约 3% 参数)在 sim-to-real 中用 230 条仿真示范真机完成 13/20 任务,可训练 VLA 基线均为 0/20。控制变量实验显示:动作名称换成 A–F 仍达 95% 成功率,而名称与物理约定同时移除则跌至 5%,说明接口的关键在稳定的"符号—物理效果"约定。

团队还推出 GUMI——把同一套语义动作做成浏览器 GUI,人类可用键盘遥操作、Computer-Use agent 可像操作网页一样控制机器人,并顺手采集 (observation, action) 数据用于训练。配套发布多模态具身智能综述与 Awesome 列表。论文、代码、模型、数据均已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →