丢弃 92% 视觉 token 仍保留 93.5% 性能,CMU×Meta 发布免训练剪枝法 CoVeR
Scobleizer · x · 2026-09-10
CMU 机器人所与 Meta 合作提出 CoVeR:一种面向多视角 3D 推理的免训练、确定性视觉 token 剪枝方法。
核心问题:用多个视角图像让 2D VLM 做 3D 推理时,token 数暴涨——LLaVA-OneVision-7B 在 12 视角下产生 8,748 个视觉 token,其中约 31% 是同一物理表面在不同相机下的空间重复。既有基于注意力或编码器特征的剪枝器不擅长处理这种几何冗余,会保留少数显著区域的近似重复观测而遗漏场景其他部分。
做法:CoVeR 完全不依赖注意力分数、视觉特征或再训练,仅用 3D 坐标:将有位姿图像和深度反投影为 3D 特征点,用自适应体素网格做覆盖初始化去除跨视角重复,再做覆盖扩展补足欠表达区域,直到精确命中 token 预算。
结果:
- 仅保留约 8% 视觉 token,在 3 个基准上平均保留 93.5% 的全 token 性能;
- 在激进(约 8%)预算下比此前 SOTA 剪枝器平均准确率高 3.9 个百分点;
- 14% 保留率时 LLM TFLOPs 减少 8.6 倍、KV cache 缩小 7 倍,ScanQA 相对下降仅 1.1%。
提供交互式 demo(可悬停查看各相机保留了哪些 token),代码即将开源。Robert Scoble 评论指出「用更少数据得到相近结果,对机器人很重要」。
所属事件:CMU 联合 Meta 推出免训练 token 剪枝法 CoVeR(2 条相关)→
「具身」频道最新
- 把 Replit Agent 装进机器人:自主建站并一键发布 — amasad · 2026-09-11
- TARS Robotics 推出具身基础模型 AWE:1 个模型、15+ 任务、零重训练 — heyshrutimishra · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 开发者用 Copilot CLI 加 Astra 调试 ESP32 小硬件 — DanWahlin · 2026-09-11
- 5500 小时真实驾驶数据训出 VATIX 开源驾驶世界模型 — abursuc · 2026-09-11
- 机器人 Reachy Mini 被纳入 NVIDIA 组合后不再低调 — RachelVT42 · 2026-09-11