Patch Policy 借稠密视觉特征实现机器人操控新突破

近期研究提出名为 Patch Policy 的机器人操控架构,指出精细操控无需依赖数十亿参数的视觉语言模型,关键在于保留视觉空间细节。该方案通过让 Transformer 控制器直接消费预训练 ViT 的密集 patch token,避免了将整帧图像压缩为单一向量造成的信息丢失。实验表明,该架构仅用 0.7% 的参数量,在单张 5090 显卡上操控成绩便反超了 7B 参数的 OpenVLA-OFT 模型 18%。

2026-07-22 ~ 2026-07-23 · 4 条相关