Patch Policy 借稠密视觉特征实现机器人操控新突破
近期研究提出名为 Patch Policy 的机器人操控架构,指出精细操控无需依赖数十亿参数的视觉语言模型,关键在于保留视觉空间细节。该方案通过让 Transformer 控制器直接消费预训练 ViT 的密集 patch token,避免了将整帧图像压缩为单一向量造成的信息丢失。实验表明,该架构仅用 0.7% 的参数量,在单张 5090 显卡上操控成绩便反超了 7B 参数的 OpenVLA-OFT 模型 18%。
2026-07-22 ~ 2026-07-23 · 4 条相关
- 机器人论文:稠密 patch 特征胜过更大的视觉语言模型 — stepjamUK · 2026-07-22
- Patch Policy 保留密集空间细节做机器人操控 — chris_j_paxton · 2026-07-23
- Patch Policy 用 0.7% 参数量,操控成绩反超 7B VLA 18% — ylecun · 2026-07-23
- Patch Policy 用 0.7% 参数量在单张 5090 上胜过 OpenVLA-OFT — ChongZzZhang · 2026-07-23