ActionPiece 重构 VLA 动作分词,LIBERO 达 94.8%

DeepCybo · hf · 2026-09-17

针对自回归视觉-语言-动作(VLA)模型中的动作分词器,论文指出传统的逐点重建指标(如 MSE)无法刻画动作调整是否被保真压缩,相似动作可能被压到同一代表动作,导致不同情境下的微调被削弱甚至反转。

作者提出物理秩一致性(PRC)指标,衡量分词重建后局部物理距离排序的保真度;并推出 ActionPiece,通过表征学习与量化的联合监督保持物理动作关系:物理秩保持约束编码器与量化特征距离的远近排序,量化正则化将同一排序施加到码字分配分布上。

在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 取得 94.8%、LIBERO-Plus 未见任务 68.8%、SimplerEnv 71.9%、VLA-Arena L0-L2 51.5%。消融显示两个目标共同提升 PRC 与策略成功率。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →