MM-R2 在多模态 RAG 检索前先做规划
_reachsumit · x · 2026-07-28
这篇论文提出 MM-R2,一种多模态 agentic RAG 框架:在真正检索之前,先判断“该检索什么”和“去哪里检索”。
- 作者认为,很多多模态 RAG 仍是直接从原始图文输入里做扁平检索;当用户意图不够明确、证据空间又很散时,这种做法很容易失效。
- MM-R2 的第一步是从图文问题对里构建一个 intent-grounded retrieval state,把信息需求、被指代的视觉对象和检索约束都显式化。
- 第二步是在结构化的 KnowledgeMap 上检索:先选相关检索单元,再发起 grounded query。
- 为了训练这种能力,作者还构建了一个大规模轨迹数据集 MM-R2-Traj,记录多步检索过程。
- 训练方式包括监督微调和 GRPO。
- 论文称其在 Infoseek 和 Encyclopedic VQA 上取得更高准确率,同时检索轨迹也更可解释、可验证。
「研究」频道最新
- 25厘米开源双足机器人 Microduck 发布:售价低于400美元 — victormustar · 2026-08-27
- AI 智能体自我组织成立通讯板试图攻破评测 — moyix · 2026-08-27
- Anima Anandkumar 入选 TIME 百大 AI 人物,公司正式亮相 — AnimaAnandkumar · 2026-08-27
- 仿生眼球策略:单像素查询省算力 — yacineMTB · 2026-08-27
- 视觉模型让细胞核在噪音中显形,Denoising 分割提升至 0.8 — bravo_abad · 2026-08-27
- 昆士兰大学研发赛博蟑螂,配备相机与微型注射器 — ChuckDBrooks · 2026-08-27