Remember-R1:解决多模态模型长链推理中的「视觉遗忘」
新智元 · wechat · 2026-08-08
多模态模型在长链推理中容易产生「分布性视觉遗忘」:随着生成文本增多,模型对图像的依赖逐渐减弱,转而依赖语言先验。为解决此问题,研究团队提出了 Remember-R1 模型。
核心思路:不改变推理流程,而是在强化学习(RL)后训练阶段引入三种过程奖励,强制模型在整条推理链中持续调用视觉证据:
- 视觉词汇奖励:约束模型在后续推理中持续提及关键视觉词组。
- 视觉记忆奖励:通过提取注意力机制,惩罚模型在推理后期视觉注意力快速下降的行为。
- 关键区域奖励:确保模型的注意力持续落在与问题真正相关的图像区域上。
实验效果:Remember-R1-7B 在七项基准测试中全面提升。例如,MathVista 提升 7.5 分,MMVet 提升 12.93 分,且未牺牲基础的视觉感知能力。该研究为长程智能体和长视频理解等任务提供了重要的后训练优化启示。
「研究」频道最新
- GPT-6 Astra 登顶 Terminal-Bench Science,领先第二名 31.4 分 — DeryaTR_ · 2026-09-21
- 蚂蚁开源 Code2Skill:从代码中批量合成可验证智能体技能 — ant-intl · 2026-09-21
- RecreationWorld:跨五平台的计算机使用智能体基准,GPT-6 得分 58.1% — Shuai Bai · 2026-09-21
- OmniVBench 发布:18 项细粒度任务评测全类型参考到视频生成 — Wenxue Li · 2026-09-21
- 研究警告「科学判断坍缩」:AI 审稿数据回流训练将压缩评分多样性 — Sy-Tuyen Ho · 2026-09-21
- 苹果发布 MintAct:统一视觉智能体模型,OSWorld 拿 48.9 分 — apple · 2026-09-21