Patch Policy:0.7%参数量反超7B VLA模型
研究团队提出名为 Patch Policy 的机器人操控方法,证明了精细操控任务不一定需要依赖 7B 参数级别的视觉语言模型(VLM)。该方案凭借极小的参数量在单张 5090 显卡上,取得了比 OpenVLA-OFT 高出 18% 的操控成绩,因极具实用价值而引发关注。
已确认
Patch Policy 的核心架构思路是保留视觉的密集空间特征。它使用在互联网数据上预训练且完全冻结的 ViT,不提取单一全局向量或 CLS token,而是将所有密集的 patch tokens 直接输入给一个小型的基于 Transformer 的策略头进行决策。据作者 @furongh 透露,该策略头在处理时还结合了块因果掩码(block-causal mask)机制。
为什么重要
传统视觉运动策略往往面临两难:要么把整帧压成向量丢失精细空间信息,要么从头训练视觉骨干从而放弃大规模预训练收益。Patch Policy 通过极简的架构改动解决了这一问题。研究数据显示,其参数量仅为 OpenVLA-OFT 的 0.7%,却大幅超越了大型 VLA 模型的表现,为高效能、低算力需求的机器人控制提供了新范式。
2026-07-22 ~ 2026-07-23 · 5 条相关
一手来源
- Patch Policy 用冻结 ViT 和块因果掩码做机器人控制 — furongh ·
- 机器人论文:稠密 patch 特征胜过更大的视觉语言模型 — stepjamUK ·
- 【源头】机器人论文:稠密 patch 特征胜过更大的视觉语言模型 — stepjamUK · 2026-07-22
- Patch Policy 保留密集空间细节做机器人操控 — chris_j_paxton · 2026-07-23
- Patch Policy 用 0.7% 参数量,操控成绩反超 7B VLA 18% — ylecun · 2026-07-23
- Patch Policy 用 0.7% 参数量在单张 5090 上胜过 OpenVLA-OFT — ChongZzZhang · 2026-07-23
- 【源头】Patch Policy 用冻结 ViT 和块因果掩码做机器人控制 — furongh · 2026-07-23