PolicyTrim 让 VLA 机器人少走弯路,执行速度最高提 5.83 倍

新智元 · wechat · 2026-07-21

这篇工作提出了 **PolicyTrim**:一种面向 **VLA 机器人** 的后训练方法,目标不是只把单次推理变快,而是让机器人在真实执行中**少走弯路、少做冗余动作**,从而整体更快完成任务。 - 论文把问题定义为 **policy efficiency(策略效率)**:完成任务到底需要多少个可靠动作 chunk、多少个真实物理步骤,而不只是模型一次推理的延迟。 - 方法分两阶段: - **可靠动作 chunk 扩展**:尽量把一个动作序列里可安全执行的部分拉长。 - **冗余感知步数压缩**:对更短、更直接的成功轨迹给予奖励,压缩重复纠错和回退动作。 - 结果上,作者报告了 **3× 动作 chunk 利用率**、最高 **51.4%** 的物理步数减少,以及在 LIBERO 上、使用 π0.5 时最高 **5.83×** 的端到端加速,成功率仍保持在 **98% 以上**。 - 论文还在 **ManiSkill**、**Meta-World** 和真实机器人 **Agilex Piper** 机械臂上验证,标准设置下平均可获得约 **1.86×** 加速。 - 核心结论是:对机器人来说,提升效率不只靠“算得更快”,也要靠“做得更直接”;这两条路径还能叠加。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →