Remember-R1:解决多模态模型长链推理中的「视觉遗忘」

新智元 · wechat · 2026-08-08

多模态模型在长链推理中容易产生「分布性视觉遗忘」:随着生成文本增多,模型对图像的依赖逐渐减弱,转而依赖语言先验。为解决此问题,研究团队提出了 Remember-R1 模型。

核心思路:不改变推理流程,而是在强化学习(RL)后训练阶段引入三种过程奖励,强制模型在整条推理链中持续调用视觉证据:

实验效果:Remember-R1-7B 在七项基准测试中全面提升。例如,MathVista 提升 7.5 分,MMVet 提升 12.93 分,且未牺牲基础的视觉感知能力。该研究为长程智能体和长视频理解等任务提供了重要的后训练优化启示。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →