Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen
cs.CV
2026-08-02
多模态推理链越长越淡忘图像。本文在原始推理轨迹上叠三个过程级奖励(覆盖视觉关键词、维持后期注意力、聚焦题目相关区域),不改推理流程,3B/7B 上 MathVista 涨 13.6/7.5。
多模态大模型做复杂题目时越来越依赖长链思维,先一步步推理再给答案。链条一长,问题就来了:模型对图像的注意力随生成步推进不断衰减,后面的 token 更多被前面已经写出来的文字推着走,图像证据被淡忘。这就是本文要处理的「视觉遗忘」(visual forgetting)。一个会数几何体个数的模型,推理到后半段可能凭空脑补出一个并不存在的蓝色球,再据此把答案数错。
此前两类做法都有短板。一类在推理过程中把图像或特征重新喂回上下文(visual re-introduction),能找回视觉证据,但反复处理图像会推高推理算力和显存,还打断推理连贯性。另一类在训练时插入「视觉声明」代理交互(visual claim proxy),但监督落在了这些额外插入的代理上,并没有直接约束模型本来的那条推理链。
Remember-R1 走第三条路:不改推理流程,把过程级监督直接压到模型自己生成的那条轨迹上。
框架用 GRPO 做强化学习,关键在奖励设计。除常规的答案正确奖励 racc,另加三个过程级奖励,分别盯住视觉证据的三个维度。
训练数据在 ViRL39K 上扩注:用 Qwen-VL-Max 给每张图抽一组「视觉关键词」(物体类别、颜色、数量、空间短语,例如「左侧最高的柱子」),再给题目相关的证据区域标 bounding box。答案只在标注阶段用,绝不喂给策略模型。人工核验后得到 38,657 条带标注样本。
三个奖励各有分工:
总奖励是四项相加。三个维度的互补性作者也给了 benchmark 级佐证:正确回答比错误回答平均多匹配视觉关键词(20.76 对 12.50)、后期注意力衰减更小、对关键区域的注意力更稳。
在 Qwen2.5-VL-3B 和 7B 上,跑七个 benchmark:推理向(MathVision、MathVista、LogicVista)、综合多模态(MMVet、MMMB、MMStar)、感知(RealWorldQA)。
| benchmark | 基线 3B | 本文 3B | 基线 7B | 本文 7B |
| MathVision | 20.90 | 24.68 | 23.20 | 26.64 |
| MathVista | 51.90 | 65.50 | 62.30 | 69.80 |
| LogicVista | 40.49 | 42.95 | 47.26 | 49.05 |
| MMVet | 52.98 | 63.44 | 59.44 | 72.37 |
| MMStar | 54.73 | 59.54 | 63.93 | 64.73 |
| RealWorldQA | 65.22 | 65.88 | 69.28 | 69.67 |
相对各自的 Qwen2.5-VL 基线,3B 在 MathVista 涨 13.6、7B 涨 7.5,是涨幅最猛的一项。7B 版在 MMVet 拿到 72.37,超过专门做视觉遗忘缓解的 DeepSketcher-7B(69.54)和 TVC-7B(60.41)。
消融上去掉任何一个奖励都掉点,且去掉 rvoc 后模型倾向产出更抽象、文字主导的推理。只用答案正确奖励的 GRPO 在 MathVista 只到 60.20,明显不如完整版的 65.50,说明光靠最终答案监督压不住过程。注意力曲线分析显示,Remember-R1 在推理中后段对图像的注意力衰减明显更慢。
对做视觉推理的从业者有两点实际价值。一是不动推理:训练完就是普通模型部署,没有重喂图像的额外算力税,落地简单。二是它把「视觉遗忘」从一个观察现象变成了可优化的训练信号,用注意力权重当代理直接写进奖励函数,思路干净,可以复用到其他需要持续对齐外部证据的长链任务(文档、图表、视频)。
要清醒的是,相对那些同样主打视觉遗忘缓解的 7B 对手,Remember-R1 的领先幅度不大(MathVista 69.80 对 69.10),更像稳态改进而非压倒性突破。
论文没有单设局限章节,下面几处是隐含问题加读下来的疑问: