丢弃 92% 视觉 token 仍保留 93.5% 性能,CMU×Meta 发布免训练剪枝法 CoVeR

Scobleizer · x · 2026-09-10

CMU 机器人所与 Meta 合作提出 CoVeR:一种面向多视角 3D 推理的免训练、确定性视觉 token 剪枝方法。

核心问题:用多个视角图像让 2D VLM 做 3D 推理时,token 数暴涨——LLaVA-OneVision-7B 在 12 视角下产生 8,748 个视觉 token,其中约 31% 是同一物理表面在不同相机下的空间重复。既有基于注意力或编码器特征的剪枝器不擅长处理这种几何冗余,会保留少数显著区域的近似重复观测而遗漏场景其他部分。

做法:CoVeR 完全不依赖注意力分数、视觉特征或再训练,仅用 3D 坐标:将有位姿图像和深度反投影为 3D 特征点,用自适应体素网格做覆盖初始化去除跨视角重复,再做覆盖扩展补足欠表达区域,直到精确命中 token 预算。

结果:

提供交互式 demo(可悬停查看各相机保留了哪些 token),代码即将开源。Robert Scoble 评论指出「用更少数据得到相近结果,对机器人很重要」。

所属事件:CMU 联合 Meta 推出免训练 token 剪枝法 CoVeR(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →