机器人论文:稠密 patch 特征胜过更大的视觉语言模型
stepjamUK · x · 2026-07-22
这篇机器人论文的核心观点是:做精细操控,不一定需要一个 10 亿参数级的视觉语言模型,关键在于别把视觉里的空间细节压扁。
Patch Policy 做了什么
- 不把每帧观测压成一个全局向量或 CLS token
- 也不从头训练视觉骨干
- 而是直接把预训练 ViT 输出的稠密 patch 特征,冻结后送进任意 transformer policy head
为什么有效
作者认为,方法的关键是把两种注意力结构分开:
- 帧内使用双向注意力,保留细粒度空间关系
- 跨帧使用因果 masking,保证时间顺序正确
结果
- 在 4 个仿真和3 个真实测试套件上,稠密 patch 特征相对全局池化 baseline 提升约 40%
- 对比微调后的 OpenVLA-OFT,Patch Policy 在仅约 0.7% 参数量下仍领先 18%,推理延迟约 11 ms
- 一旦把 patch 特征换成 pooled 或卷积压缩特征,性能会全面下降
作者的结论是:对操控任务来说,真正重要的是保留 patch 级结构,而不是把 backbone 做得更大。
所属事件:Patch Policy:0.7%参数量反超7B VLA模型(5 条相关)→
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11