PerturBot 用扰动训练打破视觉-语言-动作模型的捷径依赖

Mingyu Liu · hf · 2026-10-06

佐治亚理工团队指出 VLA 策略普遍存在「模态捷径」:模型会忽略决定动作的关键证据,依赖演示数据中的表面规律行事——例如物体靠近腕部相机改变了目标位置模型却无视、动词改变后仍触发旧搭配动作、夹爪什么都没抓到照样执行抬起。

PerturBot 通过三种手段让捷径失效:在腕部视角施加不改变任务的扰动、用决策相关字幕增强指令、混入随机与失败轨迹段并重新标注其行为。推理流程不变,可与规模化训练互补。

团队还提出 GroundingFscore,一种离线诊断指标,衡量策略对捷径的依赖程度:成功率只说明任务表现,GroundingFscore 揭示策略扩展是否健康、是否真正依赖任务证据。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →