Show-Harness: Just a VLM Agent Can Play Robots
Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou
cs.RO, cs.AI, cs.CV, cs.MM
2026-09-10
新加坡国立Show Lab用离散语义动作把VLM接到真机上。Gemini-3.1 Pro零样本十任务成功率89%,2B模型少量微调到86%,同数据下VLA大约39%。
VLM已经认得物体、空间关系和长程目标,但这套知识进不了机械臂。VLA把骨干微调成回归连续动作,语义被压成不透明的像素到电机映射,换任务、换环境、换本体往往要重收数据。层次化智能体走另一头:模型只出子任务或API程序,真正怎么动交给下游控制器,模型和物理执行是断开的。
Show Lab认为缺的是接口。Show-Harness把控制收成一套离散语义动作:相对当前参考视角的前后左右上下、绕轴旋转、抓放、结束。每一步幅度小、看得到后果,VLM继续对细粒度物理负责。本体相关的阻抗控制、逆解、工作空间限制,全部关在解释器里。
每步把多视角图像和本体感觉收成上下文,可选插件做子任务规划、失败恢复、动作分块、自适应步长。VLM输出一个语义动作,解释器把它变成有界的笛卡尔增量。Franka用阻抗跟踪,AgileX用逆解出关节,仿真器走操作空间指令。新本体只换解释器,模型面对的词表不变。
同一接口支撑两种用法。零样本:闭源前沿VLM直接控真机,默认Gemini-3.1 Pro、中等思考预算,近处2 cm、远处4 cm。微调:Qwen3.5-2B只对语言模型线性层做rank-64 LoRA,大约3%参数,动作用原词表预测,不加动作头。演示由GUMI采集,键盘或浏览器里的智能体点同一套语义键,无需遥操作硬件。真机164条、7.8K决策步,Franka和AgileX混训;仿真到真机另有230条仿真演示。
十个物体–容器任务,每任务10次,物体摆放随机,50步超时算失败。积木、香蕉、网球见过;泰迪和棋子对微调模型是OOD。
| 设置 | π0.5 | G-VLA | Show-Harness ZS | Show-Harness FT |
| 跨任务平均 | 39% | 57% | 89% | 86% |
| 跨环境平均 | 40% | 65% | 100% | 88% |
| 跨本体平均 | 41% | 52% | 93% | 87% |
| 仿真到真机 | 0/20 | / | / | 13/20 |
零样本换本体只换解释器:Franka 48/50,AgileX 45/50。代码即策略的CaP-X跨任务只有13%。把解释器步长从2 cm改到1 cm、不重训,精细任务上ZS从60%到82%,FT从40%到65%;π0.5同样演示只有18%,补精细数据后才到62%。去子任务规划,成功率掉到60%,模型常拖着物体不抬起。多视角相对只看全局从约58%到96%。推理密集型任务上,ZS加情境规划85%,FT和π0.5单独只有10%和0%。
对做具身智能的人,这条路的含义很具体:先别急着把VLM炼成电机回归器。一个对模型友好、对执行确定的动作词表,能把闭源模型的升级直接变成机器人升级,也能让2B模型在几个GPU小时里用上同一套控制。GUMI还把数据采集从专用遥操作台降到键盘和浏览器,跨本体复用同一批语义轨迹。
这不是说VLA没价值。连续动作在接触丰富、高速轨迹上仍可能更合适。Show-Harness证明的是,抓取放置、跨场景、跨臂这种当前主力评测上,接口选择对成功率的影响可以大于模型容量。
评测几乎全是平行夹爪的单臂、双臂操作,论文自己也写了:人形和灵巧手还没做,触觉和力反馈也没有。十个主任务是同一类抓取放置,物体–容器组合在撑多样性。零样本默认Gemini-3.1 Pro,闭源接口涨价或改行为,现场表现会跟着变。微调策略的最小上下文拿掉了不少插件,和零样本不是同一套 harness,直接比89%对86%并不干净。仿真到真机13/20说明能迁,离能用还有距离。每任务10次,统计误差不小。解释器步长、安全边界仍要人标定,换桌高、换夹爪不一定零成本。