OPD-V:利用模态平衡作为特权信息优化视觉推理
Aniri · hf · 2026-08-06
现有多模态大模型(MLLM)的视觉推理常受“模态不平衡”困扰,导致文本信息主导生成,视觉特征被忽略。本文提出 OPD-V,一种视觉在策略自蒸馏(OPSD)新范式。
- 核心发现:通过构建正负教师实验,证明“模态平衡”本身可作为特权信息引导自蒸馏。
- 信任区域:利用正模态平衡对数边际定义“模态平衡信任区域”,精准选择用于自蒸馏的在策略 token。
- 实验效果:在 6 个基准、4 种 MLLM 骨干和 5 种后训练方法上,OPD-V 持续提升推理性能并降低训练成本。
「模型」频道最新
- 开发者吐槽 Claude 安全护栏过严:简直是扫兴 — daniel_mac8 · 2026-08-06
- Paul Graham 探讨 LLM 数学强于写作,专家共识归因可验证奖励 — chris_j_paxton · 2026-08-06
- 曝 DeepSeek 即将大幅上调 API 价格 — AlyoshaV · 2026-08-06
- 马斯克宣布推出 Grok Imagine 图片生成功能 — elonmusk · 2026-08-06
- Inkling-small 音频推理与工具调用双榜表现优异 — simonguozirui · 2026-08-06
- 扎克伯格预告将分享更多关于开源的信息 — realmvp77 · 2026-08-06