MM-R2 多模态 RAG 先规划再检索,InfoSeek 准确率 54.3% 超最强基线近 8 个点

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

cs.AI, cs.CV

2026-06-24

多模态 RAG 常把图文压成一句文字再检索,容易带偏。MM-R2 先把「查什么、看图里哪个物体、答案要满足什么」结构化,再在一个聚类成的知识地图上选单元、下查询,InfoSeek 准确率比最强基线高近 8 个点。

这篇在解决什么

多模态 RAG(mRAG)要回答的是「看这张图、问这个问题」的题。现有做法基本两种:要么把图文各自检索一遍再拼结果,要么把整张图连同问题压成一句文字再去检索。两种都会把检索带偏,因为问题想问什么、要落到图里哪个具体物体上,这件事在检索前没被讲清楚。另一个病是检索空间太扁:所有证据塞进同一个向量空间用一个相似度排序,通用但松散的内容反而盖过精确的领域证据。

方法

MM-R2 的卖点是「先想清楚再检索」。它把每一条图文问题先变成一个结构化的「意图状态」三元组:要查什么知识(信息需求)、落在图里哪个物体上(视觉指代)、答案要满足什么约束(类型、粒度、范围)。这三样确定了,检索才有准星。

检索不再对着整锅向量,而是先在一个结构化的 KnowledgeMap 上做:语料(InfoSeek 的 600 万维基百科段落)被 HDBSCAN 聚成一批语义连贯的检索单元,每个单元配一段 LLM 生成的标题和描述用来路由。Agent 分两步:先选单元,再在选中的单元里下具体的 grounded 查询。这样「去哪搜」和「搜什么」被拆开了。

训练侧,作者造了 MM-R2-Traj 这个数据集:90 万条多步检索轨迹(86 万训练、4 万验证,平均 2949 token),每条带 intent、toolcall、toolresponse、summary、answer 这些标签。模型用两阶段练:先 SFT 5000 步,再 GRPO 90 步,都基于 Qwen2-7B。

结果

两个基准。

方法InfoSeek Unseen-QUnseen-EAll
Wiki-R1-7B47.842.344.1
CoRe-MMRAG45.246.946.5
MM-R254.156.054.3

MM-R2 在 InfoSeek 上比最强基线 CoRe-MMRAG 高出 6.3、9.1、7.8 个点。不同检索预算下,Top-1 是 47.9%、Top-2 是 51.0%、Top-5 是 54.3%,给得越多越准。路由本身也学得对:Route Recall@1 从 0.23 提到 0.74,说明模型真的学会了「该去哪个单元找」。

Encyclopedic VQA 上 MM-R2 到 39.4%,超过多数基线,但明显低于 LLaVA-mR2AG 的 55.1%(后者用 Google Lens 检索)。

为什么重要

把「检索意图」从一次模糊的相似度匹配,拆成「先定指代和约束、再选单元、再下查询」这种显式规划,是这篇能迁移到其他 agentic RAG 的核心思路。可解释性也跟着上来:检索轨迹有了结构,出了错能看是路由错了还是查询错了。对做视觉问答加知识检索的人,这套「先规划后检索」比堆检索器更值得试。

局限与存疑

论文没有独立的 Limitations 节。作者自己承认 KnowledgeMap 的划分不是唯一正解,只是个近似路由框架,边界划错时一个查询会跨多个单元。更关键的对照缺口:MM-R2 用自家 dense retriever 加维基语料,而最强对手 LLaVA-mR2AG 用 Google Lens 这种商用检索,在 Enc-VQA 上被它压了 15 个点。这不是同一条件的对照,「谁更强」在这里没法干净比较。另外 90 万轨迹是合成的,质量依赖生成它的 teacher 模型,论文没展开讨论这条数据链的偏差。

术语

原文与代码

社区讨论

相关论文

全部论文解读