剪枝后答案仍在:SCOPD 用在线自蒸馏找回 VLM 92% 的全上下文性能

CSProfKGD · x · 2026-10-01

研究团队发现,对视觉语言模型做激进视觉 token 剪枝(如仅保留 10%)后 Pass@1 下降,但 Pass@K 采样多次常能找回正确答案——视觉证据并未丢失,而是模型没能稳定利用,即「表征-利用差距」。同批剪枝 token 上 64 次采样使成功率从 53.2% 升至 79.6%,而完全去掉图像后成功率仅 2.8%-4.2%,证明答案确实来自保留的视觉信息。

方法:SCOPD(Sparse-Context On-Policy Self-Distillation)让模型用剪枝 token 自己推理,同时由全上下文的 EMA 教师副本对相同轨迹逐 token 监督;SCOPD+ 进一步把监督聚焦在最依赖视觉证据的 token 上。在 Qwen2.5-VL-7B + VisionZip 下,13 个图像基准平均成绩从 86.37 提升至 92.43(满上下文的 92.43%),比仅剪枝高 6.06 分,视觉 token 减少 90%。论文、代码与模型即将发布。

所属事件:SCOPD自蒸馏方法让VLM剪枝后仍保留92%性能(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →