What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering
Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang
cs.AI
2026-08-15
长文档多模态问答的瓶颈在重排不在召回:给每页预生成视觉描述等结构化标注,五个检索池的 F1 全部大幅上涨。
几十到几百页、图文表混排的长文档问答,主流做法是先检索再阅读:检索器选页,VLM 对着选出的页答题。这篇指出瓶颈已经换位:在 MMLongBench-Doc 上,BGE-M3 的 Recall@20 高达 0.86,证据页基本都在前 20 候选里,可 F1@5 只有 0.254,连视觉检索器 ColPali 也只有 0.332。问题不在找得到,在从 20 个表面相似的候选里挑出那几页真证据。直觉的解法是在中间插一个 LLM 重排器,实验证明它基本无效:只看原始文本片段重排,BGE-M3 的 MRR 原地踏步(0.524→0.523),ColPali 反而从 0.692 跌到 0.598,纯文本判断压过了视觉检索信号。长文档的关键证据大量锁在表格、图表和版式里,文本片段天然装不下。
Trident 的选择是保留便宜的纯文本 LLM 重排器,离线给每页预生成结构化标注,让重排器看得见视觉内容。
重排器是 GPT-4.1,视觉描述用 GPT-4o-mini,全流程免训练。
| 配置(MMLongBench-Doc) | F1@5 | MRR |
| BGE-M3 原始 top-5 | 0.254 | 0.524 |
| BGE-M3 + 纯片段 LLM 重排 | 0.374 | 0.523 |
| BGE-M3 + 仅视觉描述 + 重排 | 0.518 | 0.692 |
| BGE-M3 + 完整标注 + 重排 | 0.546 | 0.744 |
| ColPali 原始 top-5 | 0.332 | 0.692 |
| ColPali + 完整标注 + 重排 | 0.581 | 0.788 |
同一套标注+重排协议用在五个候选池(BM25、BGE-M3、RRF、ColPali、多轴图)上全部涨分,且全部超过最强自适应基线 PageIndex(0.480)。ColPali 池的提升最有信息量:它的检索阶段已经编码了页面图像,重排阶段的标注仍能把 F1 从 0.332 拉到 0.581,说明视觉描述不只是给文本检索器补视觉信息,它本身就是重排器读得懂的证据表示。端到端上 ColPali+标注+重排+Trident-S 拿到最高分,两个 LLM judge 的排序一致(κ=0.913);LongDocURL 上检索趋势同样迁移,Trident-R 的 F1 以 0.398 居首。
工业 RAG 里「VLM 生成页面描述再给文本链路用」是常见做法,学术界长期默认它丢视觉细节、上不了台面。这篇系统地证明:标注足够结构化,免训练的文本 LLM 重排器能打平甚至超过昂贵的多模态重排器,每 100 页索引成本 0.256 美元、摊销到所有后续查询。做长文档 RAG 的团队可以直接抄这套架构。Trident-S 要按题型用:只在开放式综合题上有 +1.7 到 +6.6 的准确率增益,选择题和短抽取题按设计绕过。
作者承认:离线索引要花钱(虽然便宜)、五池隔离实验只在 MMLongBench-Doc 上做、LongDocURL 只是外部迁移检查。读下来再补两点:大部分增益来自视觉描述一个字段,主题/实体/结构三轴的边际贡献合计约 0.03,系统复杂度与收益不成比例,作者自己也说字段贵时该退到 caption-only 变体;重排与描述用的是 GPT-4.1 和 GPT-4o-mini,换小模型或开源模型只说可替换,没有给数字。