Patch Policy:0.7%参数量反超7B VLA模型

研究团队提出名为 Patch Policy 的机器人操控方法,证明了精细操控任务不一定需要依赖 7B 参数级别的视觉语言模型(VLM)。该方案凭借极小的参数量在单张 5090 显卡上,取得了比 OpenVLA-OFT 高出 18% 的操控成绩,因极具实用价值而引发关注。

已确认

Patch Policy 的核心架构思路是保留视觉的密集空间特征。它使用在互联网数据上预训练且完全冻结的 ViT,不提取单一全局向量或 CLS token,而是将所有密集的 patch tokens 直接输入给一个小型的基于 Transformer 的策略头进行决策。据作者 @furongh 透露,该策略头在处理时还结合了块因果掩码(block-causal mask)机制。

为什么重要

传统视觉运动策略往往面临两难:要么把整帧压成向量丢失精细空间信息,要么从头训练视觉骨干从而放弃大规模预训练收益。Patch Policy 通过极简的架构改动解决了这一问题。研究数据显示,其参数量仅为 OpenVLA-OFT 的 0.7%,却大幅超越了大型 VLA 模型的表现,为高效能、低算力需求的机器人控制提供了新范式。

2026-07-22 ~ 2026-07-23 · 5 条相关

一手来源