中科院提出GMC剪枝法:视觉Token压缩90%性能不降
量子位 · wechat · 2026-08-12
视觉语言模型(VLM)处理高分辨率图像时会产生大量视觉 Token,导致显存占用大、推理缓慢。传统 Top-K 筛选法容易丢失关键细节并引发视觉幻觉。中科院自动化所紫东太初团队提出了核心集剪枝方法 GMC,通过双阶段架构(互补证据筛选与群体互补信息传输),在不重训模型、无额外依赖的前提下实现高保真压缩。
实验表明,在 Qwen2.5-VL 等模型上,即使将视觉 Token 压缩掉 90%(仅保留 128 个),仍能保持 99% 的原有性能,甚至通过去噪轻微提升了理解能力。此外,该方法在长文档场景下实现了 1.25 倍的端到端推理加速,并大幅降低了 KVCache 占用,有效破解了多模态模型“压缩必掉精度”的难题。
「模型」频道最新
- Meta 与 NVIDIA 同日发 30B 模型:Agent 本地化与云端路由的对决 — eyishazyer · 2026-08-12
- 30B模型太吃内存?开发者探讨普通电脑跑SLM的最优解 — elie2222 · 2026-08-12
- 论文破解 Claude 与 GPT 隐藏推理过程 — Zealousideal_Sort74 · 2026-08-12
- 开发者实测:Claude Opus 等模型生成代码暗藏严重安全漏洞 — OwariDa · 2026-08-12
- ChatGPT 被赞精通三语深度语码转换,碾压 Grok 与 Gemini — Shot_Tap_9053 · 2026-08-12
- Falcon-Perception 0.6B 模型实现高效本地图像分割 — vanstriendaniel · 2026-08-12