SCOPD:剪枝仅留10%视觉token,VLM仍保92%性能
uoft · hf · 2026-09-29
多伦多大学团队发布 SCOPD(Sparse-Context On-Policy Self-Distillation),针对推理型 VLM 中视觉 token 剪枝导致的性能损失提出新解释与解法。
核心发现:表示-利用鸿沟
- 传统观点认为剪枝掉的是任务相关的关键视觉信息,但作者用固定上下文 Pass@K 分析证明:同一剪枝表示上重复采样可恢复许多贪心解码漏掉的例子——有用信息仍在,只是模型用得不可靠。
方法
- 学生模型从剪枝后的视觉 token 生成推理轨迹,拥有完整上下文的特权教师对相同 on-policy 前缀做监督
- 无需真值标注、不改架构、不增加推理开销
- SCOPD+ 额外用小视觉预算干预定位视觉敏感位置并选择性蒸馏
结果
- 仅保留 10% 视觉 token 时:Vanilla 模型在 13 个基准上保留 86.37% 性能,SCOPD 提升至 90.49%,SCOPD+ 达 92.43%
- 结论:高效推理不只取决于剪枝后留下什么信息,更取决于模型学得多可靠地使用它
「多模态」频道最新
- Dreamina 时间戳提示词加单图参考的实测玩法展示 — gen_ericai · 2026-09-29
- 用 C++ 自制管线测试时间戳提示词生成「盲女巫」图像 — gen_ericai · 2026-09-29
- Kling 4.0 多参考生成实测:一次合成角色、场景、物件,还能多语言复用 — SarahAnnabels · 2026-09-29
- BananaStudio:跑在 Gemini Canvas 里的全分辨率图像生成工作台 — Z3ROCOOL22 · 2026-09-29
- Suno Studio 演示:录一段人声即可转成电吉他等任意音色 — suno · 2026-09-29
- Qwen 2.1 图像默认工作流被吐槽,改 CFG=3、12 步后细节超 Krea 2 — Dear-Spend-2865 · 2026-09-29