Anchor-Align: Recovering OOD Generalization in VLA Fine-tuning

_krishna_murthy · x · 2026-08-26

Researchers from UIUC and others introduce Anchor-Align, a method to address the degradation of generalization capabilities in Vision-Language-Action (VLA) models after Behavior Cloning (BC) fine-tuning.

Core Problem: Fine-tuning VLMs with BC progressively overwrites pretrained representations essential for visual and semantic generalization. Simple co-training on web image-text data fails to resolve language-action misalignment.

Solution: Anchor-Align augments BC with two objectives:

Results: On a physical xArm7 robot, Anchor-Align improves success rates from 28% → 54% and 37% → 60% across two VLA architectures. Consistent improvements in OOD perturbations, perceptual robustness, and long-horizon tasks were demonstrated in simulations (LIBERO, CALVIN).

Original post →

More from Embodied

Embodied channel →