机器人论文:稠密 patch 特征胜过更大的视觉语言模型
stepjamUK · x · 2026-07-22
这篇机器人论文的核心观点是:做精细操控,不一定需要一个 10 亿参数级的视觉语言模型,关键在于别把视觉里的空间细节压扁。
Patch Policy 做了什么
- 不把每帧观测压成一个全局向量或 CLS token
- 也不从头训练视觉骨干
- 而是直接把预训练 ViT 输出的稠密 patch 特征,冻结后送进任意 transformer policy head
为什么有效
作者认为,方法的关键是把两种注意力结构分开:
- 帧内使用双向注意力,保留细粒度空间关系
- 跨帧使用因果 masking,保证时间顺序正确
结果
- 在 4 个仿真和3 个真实测试套件上,稠密 patch 特征相对全局池化 baseline 提升约 40%
- 对比微调后的 OpenVLA-OFT,Patch Policy 在仅约 0.7% 参数量下仍领先 18%,推理延迟约 11 ms
- 一旦把 patch 特征换成 pooled 或卷积压缩特征,性能会全面下降
作者的结论是:对操控任务来说,真正重要的是保留 patch 级结构,而不是把 backbone 做得更大。
「具身」频道最新
- 特斯拉多头盯 Cybercab 与 Optimus 建设,押注资本开支兑现 — JOBhakdi · 2026-07-22
- Tesla 传出向 HW3 推送由 HW4 蒸馏的 FSD 更新 — Teknium · 2026-07-22
- IKFast 之后,Rosen Diankov 发布 ssik 接棒解析逆运动学 — ZeYanjie · 2026-07-22
- 本地量子LLM:单光子量子随机数驱动token采样,跨越多元宇宙 — Reddactor · 2026-07-22
- 超维动力发布全栈具身智能:115 自由度人形机器人打乒乓球,灵巧手开售 — 新智元 · 2026-07-22
- 英伟达开源医疗机器人物理仿真框架,训练时间缩至两分钟 — NVIDIA Blog · 2026-07-22