中科院提出GMC剪枝法:视觉Token压缩90%性能不降

量子位 · wechat · 2026-08-12

视觉语言模型(VLM)处理高分辨率图像时会产生大量视觉 Token,导致显存占用大、推理缓慢。传统 Top-K 筛选法容易丢失关键细节并引发视觉幻觉。中科院自动化所紫东太初团队提出了核心集剪枝方法 GMC,通过双阶段架构(互补证据筛选与群体互补信息传输),在不重训模型、无额外依赖的前提下实现高保真压缩。

实验表明,在 Qwen2.5-VL 等模型上,即使将视觉 Token 压缩掉 90%(仅保留 128 个),仍能保持 99% 的原有性能,甚至通过去噪轻微提升了理解能力。此外,该方法在长文档场景下实现了 1.25 倍的端到端推理加速,并大幅降低了 KVCache 占用,有效破解了多模态模型“压缩必掉精度”的难题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →