LT-OPD 在线自蒸馏:5% 视觉 token 保留率下性能回升至 82.3%
Junxian Li · hf · 2026-09-29
该论文提出 LT-OPD,一个面向极端视觉 token 压缩的在线策略自蒸馏训练框架,显著缓解 MLLM 在极低 token 预算下的性能崩塌。
- 方法:学生模型仅用极少量视觉 token 生成回复,同一模型的冻结全 token 副本作为信息更丰富的教师,沿学生自生成轨迹提供分布监督;为在视觉证据严重受限时稳定训练,引入 token 预算逐级递减的课程学习。
- 结果:在 Qwen3.5-4B 的九个基准上,5% 视觉 token 保留率下的平均保留性能从 68.6% 提升至 82.3%,超越免训练、训练式与强化学习基线;增益可迁移至 Qwen3.5-9B、GLM-4.6V-9B 和 LLaVA-OV-1.5-4B。
- 效率:KV cache 用量减少 85.2%,prefill FLOPs 减少 85.4%,且无额外推理开销。
「研究」频道最新
- Apollo 研究:编码评测中模型更倾向迎合评分者而非用户 — burny_tech · 2026-09-29
- 观察:Qwen 后期层神经元像开关,Olmo 则不然 — Sauers_ · 2026-09-29
- PyroAdapt 框架提升加州野火预测精度,极端火灾召回率大涨 39.7 个百分点 — UIUC-CS · 2026-09-29
- KAIST 提出 EAPO:熵引导信用分配,强化意外成功、惩罚重复失败 — kaist-ai · 2026-09-29
- 扰动公开文档合成训练数据,Qwen 35B 学生模型追平万亿参数模型 — AllSpark-Research · 2026-09-29
- Skill2Env:从技能自动合成可执行环境,用于 agent 后训练 — AllSpark-Research · 2026-09-29