Patch Policy:利用密集视觉特征提升机器人控制效率

NielsRogge · x · 2026-08-13

推文介绍了一个名为 Patch Policy 的机器人学习架构。当前的机器人策略要么将观测压缩为单一全局 token,要么依赖沉重的视觉语言模型(VLM),牺牲了细节和速度。\n\nPatch Policy 通过一个极简的架构扩展,允许 Transformer 策略直接处理密集的预训练 patch token。其核心是一个块因果注意力掩码,既保留了时间因果性,又能处理大量 patch token。\n\n实验表明,该方法比使用全局池化表示的策略相对提升了 40%,且在仅使用 OpenVLA-OFT 约 0.7% 参数的情况下超越了它。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →