把 3D 视觉语言的 token 压到 1/11:3DZip 用特征多样性锚点选 token

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

Changwoo Baek, Kyeongbo Kong

ECCV 2026

cs.CV, cs.LG

2026-08-02

3D VLM 的 3D token 太多吃显存;3DZip 粗体素化加多样性锚点选 token,1410→128 仍保 94.7% 精度、快 1.9 倍。

这篇在解决什么

3D 视觉语言模型(3D VLM,让大模型看懂三维场景、回答关于物体的问答)的瓶颈是 token 太多:一个场景点云动辄上万个 3D token 喂进 LLM,既慢又爆显存,长视频场景更严重。一个房间扫一遍可能产生上千个 token,几段视频拼起来直接把上下文塞满。已有 2D 压 token 的方法(FastV 等)直接搬到 3D 不好用,因为 3D token 带空间结构,按注意力重要性一刀切,容易把零散却关键的小物体 token 丢掉,而这些小物体往往正是问答要问的目标。

方法

3DZip 是训练后、即插即用的三阶段 token 压缩,不需要微调权重:

三个阶段从粗到细:先按空间去冗余,再按特征保多样,最后按空间归并到预算。

结果

在 SQA3D(3D 场景问答)上:

token 数SQA3D 精度保留率
1410(原始)55.7100%
12853.294.7%
6492.3%
3288.9%

压到 128 token(约原来的 1/11)时精度只掉 2.5 个点,推理从 342ms 降到 178ms(1.92 倍),FLOPs 从 9.18T 降到 0.90T,KV 缓存从 722MB 降到 101MB。即便压到 32 token,仍保留近九成精度。它超过 FastV、SparseVLM、VisionZip、VisPruner、DTC 一众 2D 和 3D 压 token 方法,并且能迁移到 Video-3D-LLM、SR-3D 等其他 3D VLM 架构,说明这套压缩不绑死某一个模型。

为什么重要

3D VLM 要走向真实场景(机器人导航、AR 交互),token 爆炸是绕不过的工程坎:场景一大、视频一长,显存和延迟都顶不住。3DZip 给了一条不重训、显存省 7 倍的路子,意味着同样的显卡能处理大得多的场景或更长的视频。对做具身和空间智能的人,这是直接能上线的推理优化,而不是一篇停在基准数字上的论文。

局限与存疑

术语

原文与代码

相关论文

全部论文解读