DocMemo:三层记忆加贝叶斯选页做多模态长文档问答,PaperTab 涨 15 个点

DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding

Hanshu Yao, Janfeng Zhong, Niu Lian, Jinpeng Wang

cs.AI, cs.CL, cs.IR, cs.MM

2026-08-07

长文档问答要在上百页里找稀疏证据,静态 top-k 检索错了无法回头,迭代检索又不传递跨轮状态。DocMemo 用文档结构、页面信念、问题情景三层记忆,靠贝叶斯更新加 Thompson 采样动态选页,三个基准平均 77.6,PaperTab 比次优高 15 个点,平均只跑 1.24 轮。

这篇在解决什么

多模态长文档问答(比如问一份上百页的财报或论文里的某个数字)要在文本、表格、图里找到稀疏又分散的证据。主流做法是在开头就检索一个固定的 top-k 页集,然后回答,这叫静态检索。它的硬伤是一旦开头检错了页,后面没法纠正。

近期的迭代做法允许多轮检索,但通常每轮重建上下文,没有真正的跨轮状态传递,等于反复独立检索,没法追踪「页面相关性在几轮之间怎么变」。DocMemo 把长文档推理重新定义成动态证据探索,给检索过程装上一个会更新、会记忆的状态。

方法

DocMemo 的核心是一套三层检索记忆,把持久信息和动态信息分开存。

推理时用 Thompson 采样从每页的 Beta 分布抽 θi,候选分 scorei = (1−λt)ci + λt·θi,λ 的调度是 [0, 0.3, 0.6, 0.6],越往后越依赖后验。还有两个关键机制:空间邻近传播(某页被判相关,邻页 α 按 γ^|j−i| 加分,r=2、γ=0.5,依据是认知负荷理论里的空间连续性);自适应粒度(对信息密集区补页面级裁剪,比如最多 5 个表格裁块、图像最长边 1500px),弥补整页表示丢细节。

结果

三个基准:MMLongBench-Doc(1082 题、135 篇文档、最长 112 页)、LongDocURL(2325 题、396 篇)、PaperTab(393 题、307 篇论文)。GPT-4.1 做二元判分。

方法MMLongLongDocPaperTab平均
SimpleDoc60.672.365.466.1
DocMemo71.381.180.477.6

DocMemo 在 MMLong、LongDoc 上分别比次优高 3.7、8.8 个点,PaperTab 高 15.0 个点。效率上平均只跑 1.24 轮(SimpleDoc 固定 3 轮),相对计算成本 0.41、效率约 2.4 倍。Thompson 采样 71.28 对比贪心选择 68.62。消融里去掉页面信念记忆或贝叶斯更新,掉到 68.80;纯 OCR(去掉视觉)掉到 58.6,纯视觉 69.3,说明多模态缺一不可。

为什么重要

长文档问答是文档智能和 agent 检索的核心能力,而「检索不能动态纠错」是普遍痛点。DocMemo 给的方案是把检索建模成带信念状态的探索,用贝叶斯更新和 Thompson 采样在「利用已发现的证据」和「探索新页」之间平衡。对做 RAG 和 agent 的人,三层记忆的拆分(结构、页面信念、问题情景)和空间邻近传播都能直接借鉴,而且它用更少的迭代拿到更高的分,说明动态检索不是越多次越好,而是要带状态。

局限与存疑

论文没有单设局限章节,但从内容能看出几处:第三轮的边际收益已经明显递减(单轮准确率从第 1 轮 72.0 掉到第 3 轮 46.2);离线预处理有成本,视觉嵌入要 1.2GB 存储、10 篇文档约 0.51 小时;整页表示会丢细节(靠自适应粒度裁剪弥补,但裁剪策略本身较粗,最多 5 个表格裁块是人为上限)。另外全部靠 GPT-4.1 做答案评判,判分模型本身的偏差没有被讨论。

术语

原文与代码

社区讨论

相关论文

全部论文解读