Anchor-Align 让 xArm7 真实机器人成功率升至 54%
Dwip Dalal · hf · 2026-07-23
论文结论
这篇工作提出 Anchor-Align,试图解决 VLA(vision-language-action)策略在用机器人示教做行为克隆微调时,原本有用的视觉/语义表示会被逐步覆盖的问题。
- 方法包含两部分:
- Vision-Language Anchoring:从冻结的 VLM 拷贝里蒸馏分层表示,减少表征漂移。
- Language-Action Alignment:把动作目标转成离散的运动方向标签,让语言和动作在同一机器人观测上共同训练。
- 在真实 xArm7 机器人上,两种常用 VLA 架构的成功率分别从 28% 提升到 54%、从 37% 提升到 60%。
- 在仿真中,它在 LIBERO-PRO、LIBERO-Plus、CALVIN 等基准上,对分布外扰动、感知鲁棒性和长程控制也都有稳定提升。
「具身」频道最新
- 机器人手指驱动演示:答案很直接,就是能 — IanPritchard · 2026-07-23
- Michelle Sun:软件工程师该转向硬件,十年机会在实体智能 — Fowe · 2026-07-23
- Kepler v0.1 把机器人视觉触觉位姿合成一体 — freelerobot · 2026-07-23
- 人形机器人开始处理真实家电搬运任务 — CurieuxExplorer · 2026-07-23
- 讯飞系机器人新公司押注世界模型与本体认知 — 量子位 · 2026-07-23
- 手机本地 Agent 16 毫秒循环里玩 Space Invaders、解迷你填字 — AI Engineer · 2026-07-23