Anchor-Align 让 xArm7 真实机器人成功率升至 54%
Dwip Dalal · hf · 2026-07-23
论文结论
这篇工作提出 Anchor-Align,试图解决 VLA(vision-language-action)策略在用机器人示教做行为克隆微调时,原本有用的视觉/语义表示会被逐步覆盖的问题。
- 方法包含两部分:
- Vision-Language Anchoring:从冻结的 VLM 拷贝里蒸馏分层表示,减少表征漂移。
- Language-Action Alignment:把动作目标转成离散的运动方向标签,让语言和动作在同一机器人观测上共同训练。
- 在真实 xArm7 机器人上,两种常用 VLA 架构的成功率分别从 28% 提升到 54%、从 37% 提升到 60%。
- 在仿真中,它在 LIBERO-PRO、LIBERO-Plus、CALVIN 等基准上,对分布外扰动、感知鲁棒性和长程控制也都有稳定提升。
「具身」频道最新
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11