剪枝后答案仍在:SCOPD 用在线自蒸馏找回 VLM 92% 的全上下文性能
CSProfKGD · x · 2026-10-01
研究团队发现,对视觉语言模型做激进视觉 token 剪枝(如仅保留 10%)后 Pass@1 下降,但 Pass@K 采样多次常能找回正确答案——视觉证据并未丢失,而是模型没能稳定利用,即「表征-利用差距」。同批剪枝 token 上 64 次采样使成功率从 53.2% 升至 79.6%,而完全去掉图像后成功率仅 2.8%-4.2%,证明答案确实来自保留的视觉信息。
方法:SCOPD(Sparse-Context On-Policy Self-Distillation)让模型用剪枝 token 自己推理,同时由全上下文的 EMA 教师副本对相同轨迹逐 token 监督;SCOPD+ 进一步把监督聚焦在最依赖视觉证据的 token 上。在 Qwen2.5-VL-7B + VisionZip 下,13 个图像基准平均成绩从 86.37 提升至 92.43(满上下文的 92.43%),比仅剪枝高 6.06 分,视觉 token 减少 90%。论文、代码与模型即将发布。
所属事件:SCOPD自蒸馏方法让VLM剪枝后仍保留92%性能(2 条相关)→
「模型」频道最新
- 网友实测 GPT-6.1-Sol 通宵跑多智能体项目,仅耗 3% Pro 额度 — intellectronica · 2026-10-01
- Dwarfstar 定制量化:Qwen 在 96GB M3 Ultra 上跑得又快又稳 — TheRealJesus2 · 2026-10-01
- Codex 负责人:主账号用量近乎无限,额度规则急需重设 — taherdhanera · 2026-10-01
- Claude Opus 5.5 以 167 分登顶 Epoch 能力指数,微弱领先 GPT-6 Astra — scaling01 · 2026-10-01
- DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节,持久缓存缩 8 倍 — jbhuang0604 · 2026-10-01
- Every 实测 Fable 5.1:更强更便宜,token 用量仅 Opus 5 一半 — every · 2026-10-01