砍掉八成视觉 token 仍保 97%~100% 能力:VLM 压缩改看「带符号消息」

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang

cs.CV

2026-08-03

中科院提出免训练的 GMC 视觉 token 剪枝法,在 Qwen2.5-VL-7B 上砍掉 80% 视觉 token 仍保留 97.78%~100.36% 能力,超过所有 Top-K 基线。

这篇在解决什么

VLM(vision-language model,视觉语言模型)把高分辨率图片切成上千个视觉 token,每个都要过语言解码器、占 prompt KV cache。一张文档图能产生上万 token,推理又慢又贵。

现成的压缩办法(FastV、VisionZip、DivPrune、MMTok 等)几乎都是同一套:给每个视觉 token 算个独立的重要性分数,按分数留 Top-K。这套思路有个盲点。文本 query 从视觉 token 那里消费的是一束「带符号的注意力消息」:来自不同视觉位置的贡献加权相加,方向相反的等大贡献会相互抵消。把 query 看成读孤立小块,就会让 Top-K 反复堆在同一个高响应区域,漏掉稀疏但互补的证据(一个柱子加一根坐标轴才凑得出答案),还把被删掉那批 token 携带的信息整批扔了。

方法

GMC(Grounded Message Coreset Pruning)不训练,在解码器某一层之前插入一步。核心是把压缩拆成两个耦合子问题:在哪选载体(support allocation),以及每个载体该背什么(message realization)。

选载体时不再只看单 token 分数,而是把 query 真正会用到的消息承载者当成三类客户群去覆盖:

覆盖目标是一个加权 facility-location 形式,作者证明它归一化、单调、子模,于是批量贪心就能给出可证明近似的解。分摊式责任带来一个直接好处:一个高响应区域一旦被代表,旁边冗余的高分块边际价值立刻归零,重复堆叠从根上治住。

定内容时,把每个被删的 token 按语义、局部、空间相似度派给选中的载体(多对一),算加权质心。关键在保住「带符号的人群一阶矩」:方向相反、相互抵消的贡献也如实保留,不只留大模长。再做 RMS 尺度恢复。载体停在自己原始的多模态坐标上,让解码器原生的紧凑注意力重新算出这束带符号消息,信息和位置都不丢。

两个挡位:GMC-H2 在第 2 层前压(token 层工作量只留约 16%,省算力),GMC-L16 在第 16 层前压(工作量留约 61%,保真更高)。

结果

主战场 Qwen2.5-VL-7B(N=1296 视觉 token),数字是 Full-relative(全量 = 100):

方法(K=256,砍 80.2%)均值
FastV92.86
DivPrune92.44
VisionZip92.16
MMTok93.40
HAWK94.61
GMC-H297.78
GMC-L16100.36

更狠的 K=128(砍 90.1%)下,FastV 82.98、MMTok 83.86、HAWK 87.53,GMC-H2 拿到 93.51,GMC-L16 拿到 99.11,优势随预算收紧进一步拉大。

幻觉指标上 GMC-L16 比全量还干净:POPE 87.04 对全量 87.07,AMBER 87.17 对 86.33 反超,物体幻觉 CHAIRs 28.80 对 37.60、CHAIRi 7.41 对 9.05,全面好过 VisionZip 和 MMTok。

迁移到 LLaVA-1.5-7B(L16,免架构调参)在 K=64/128 拿到 99.76/99.86。文档部署 DocVQA(15,876 个 token)下,GMC-H1 保住 98.87% ANLS,端到端 1.258× 加速,prompt-KV 砍 73.94%。

受控实验把「选载体」和「定内容」拆开验证:support 构建是主导因子,候选 logit 误差最能预测有害翻转。固定所有后置操作只换选择器,GMC 在 L16 仍超四个选择器 2.7412.61 点。

为什么重要

VLM 推理贵,主要贵在视觉 token 多。能免训练砍掉 80% 还不掉点,意味着现有 Qwen、LLaVA 检查点插一层就能大幅降 KV cache 和解码成本,不用重训。

更值钱的是认知层的贡献:压缩的真正目标是 query 消费的那束带符号消息,跟单 token 分数高低无关。这解释了为什么独立 Top-K 在 K 很小时崩盘,它一直在保模长、没保符号。对做 VLM 部署、尤其是长文档和高分辨率场景的人,这是直接能用的杠杆。

局限与存疑

省的 token 不等于省的墙钟时间。token 层工作量确实砍掉很多,但 client 构建、选择、transport、压缩这套管线本身要花时间,所以 DocVQA 实测端到端只快 1.1761.258×,远没有 80%90% token 那么戏剧化。

H2 挡位在 K=128 掉到 93.51%,要极致省算力就得接受掉点;L16 高保真但 token 层工作量只省到约 61%。

大于 100% 的数字是相对共享全量基线算的(该 backbone 下全量设为 100),不是绝对超人,别误读成压缩后比全量更强。MME 置信区间最宽(重采样方式所致),空间 bank 在部分配置里只是低权重先验、边际效果小。

术语

原文与代码

社区讨论

相关论文

全部论文解读