Anchor-Align:解决 VLA 微调遗忘问题,泛化性大幅提升
_krishna_murthy · x · 2026-08-26
伊利诺伊大学香槟分校等机构提出 Anchor-Align 方法,解决视觉-语言-动作 (VLA) 模型在行为克隆 (BC) 微调后泛化能力退化的问题。
核心问题:直接用 BC 微调 VLA 会覆盖预训练的表征,导致视觉和语义泛化能力丧失;简单的混合图像-文本数据共训练也无法解决语言-动作对齐问题。
解决方案:Anchor-Align 引入两个目标:
- 视觉-语言锚定 (Vision-Language Anchoring):从冻结的 VLM 副本中逐层蒸馏表征,防止表征漂移。
- 语言-动作对齐 (Language-Action Alignment):将动作目标转换为离散的运动方向标签,在同一个机器人观测上联合训练语言和动作预测。
效果:在实体 xArm7 机器人上,Anchor-Align 将成功率从 28% 提升至 54%(另一种架构从 37% 提升至 60%)。在仿真中(LIBERO、CALVIN 等基准),该方法在 OOD 扰动、感知鲁棒性和长视界任务上均表现出一致的改进。
「具身」频道最新
- 开源机器人吸尘器 OOMWOO:基于树莓派与 ROS 2 本地运行 — JeremyCMorgan · 2026-08-26
- 为羊膜带综合征患者设计的机械假手 — _Stocko_ · 2026-08-26
- 机器人跑步大赛:比 F1 赛车还燃 — cixliv · 2026-08-26
- 仿真蒸馏难如数据规模化?机器人训练路线之争 — KyleMorgenstein · 2026-08-26
- 研究者探讨机器人世界模型,参加达姆施塔特自主学习研讨会 — breadli428 · 2026-08-26
- 中国人形机器人销量远超美国公司 — teortaxesTex · 2026-08-26