上交团队提出 GSR:破解 VLA 模型指令泛化难题
机器之心 · wechat · 2026-08-06
当前视觉-语言-动作(VLA)模型在指令泛化上存在严重缺陷,仅改写任务表述便会导致动作执行成功率暴降。上海交大与无界动力的联合团队发现,这是因为等价措辞在多模态融合中引入了特征偏移,并被下游动作模块放大。
团队提出了 GSR(Grounded Semantic Re-Binding) 方法:使用冻结的 T5 编码器独立提取稳定的任务语义,并根据不同 VLA 架构重新注入特征流,最后重新训练动作专家。实验表明,该方法无需使用改写指令训练,即可让轻量级模型泛化能力大幅提升(如 SmolVLA 成功率从 4.47% 跃升至 49.12%),甚至对已预训练的大模型也有增益。
「具身」频道最新
- 独立开发者用 AI 辅助设计电路板,计划攻克量产并卖产品 — pramodk73 · 2026-08-06
- 美国机器人禁令波及初创企业:BOM 本土化率需超 65% — mattfreed · 2026-08-06
- BridgeVLA++ 框架引入时空记忆,大幅提升 3D 机器人操作泛化性 — Peiyan Li · 2026-08-06
- Nori L3 双臂家用机器人发布,售价 1688 美元 — CyberRobooo · 2026-08-06
- 庞伯特多运动 AI 教练机器人众筹破 400 万美元 — 创业邦 · 2026-08-06
- 北京 72 台机器人上岗公园:涵盖巡逻清洁与捕蚊 — pstAsiatech · 2026-08-06