MULTI3IR: A Benchmark for Multi-perspective Multi-domain Multi-modal Information Retrieval
Seokwon Song, Sohyeon Kim, Gunhee Kim
EMNLP 2026
cs.IR
2026-08-31
首尔大学用10.5万Stack Exchange问句衡量多视角覆盖。现有多模态检索器挤在单一视角上;SPIN向中间层注入可学习噪声,Qwen3-VL的HC@10从25.6%升到37.8%。
开放式问题往往暗含好几个视角。「为什么蓝色食物那么少」可以问色素化学,也可以问文化心理。现有IR基准大多是封闭事实;即便标了多答案,支撑文档也常常困在单一学科、单一模态。
检索多样化的老办法更贵。查询扩展每次推理要调LLM;多向量检索要文档级相关标注。这篇EMNLP 2026工作同时给数据集和一条几乎不改骨干的纠偏方法。
Multi3IR从77个Stack Exchange站点收帖,保留至少4条答案的问题。GPT-5-mini从答案里抽视角,再用句向量去重(余弦>0.8丢掉)和MiniCheck做蕴含过滤。每个视角当查询,从Google图片和C4各取top-10,Qwen3-VL-30B核对是否只支持这一个视角。主题域由EAI-Distill-0.5b标注。
规模:104,916条问句、521,739个视角、101万文档。每问平均4.98个视角、3.34个学科域、1.91种模态。人工核查测试集1,000问:视角相关99.1%、不重复96.2%,文档独占支持90.2%。
SPIN(Steering Perspectives by Injecting Noise)冻住检索器,只在中间层给查询隐状态加上m个可学习噪声向量,再走完剩余层,得到m个查询向量。对齐目标是视角描述的嵌入,不是文档。正损失用noisy-OR:每个视角至少被其中一个向量盖住;负损失要求所有向量都拒掉批次内其他问题的视角。推理时m路独立检索,Round Robin合并。注入点取0.5L,三个骨干分别是第16、14、18层。m=5。文档塔全程冻结。
零样本检索器挤在一个主导视角上。把标注好的视角描述当查询再Round Robin,原先漏掉的文档就能被找回,瓶颈在查询向量,不在文档空间。
Qwen3-VL-Embedding-8B,全库101万候选:
| 方法 | HC@10 | SC@10 | 监督 |
| Naive | 25.55 | 36.22 | 无 |
| Naive + 文档微调 | 28.06 | 41.41 | 文档 |
| LLM扩展 | 25.33 | 37.75 | 视角 |
| ARE | 33.36 | 44.73 | 文档 |
| SPIN | 37.83 | 59.35 | 视角 |
| Oracle视角查询 | 52.31 | 70.04 | — |
MM-Embed上SPIN的HC@10是35.24对Naive的28.83;GME-Qwen2是34.02对21.81。同样用视角监督,SPIN比LLM扩展高出8到13个HC@10点。文档监督的ARE也落后SPIN约4个HC@10点和14个SC@10点。
迁到未见过的PIR和BeRDS,三个骨干的HC@10仍涨。PIR上约+9到+12;BeRDS上GME从64.95涨到85.05。中间层注入是关键:L18随m增大继续涨,L30很快平台。20.5K参数的SPIN在HC@100上打过LoRA(1.05亿参数)7.5个点。模态覆盖在k=100时78.2,接近Oracle的81.1;学科域覆盖68.3,离Oracle的84.8还远。正例在嵌入空间散得最开的四分位,m=5相对Naive的HC@100增益是+24.4。
开放检索的失败模式被写清楚了:不是文档找不着,是查询向量只代表一个读法。SPIN用视角描述当监督、用中间层噪声当多向量,绕开文档级标注和推理时的LLM改写。
2万参数、骨干冻结,适合已经上线的多模态检索器打补丁。Oracle仍高一截,说明视角发现本身还有空间。学科域覆盖落后模态覆盖,下一步更像要学「换一个学科再搜」,而不只是换一种说法。
m固定为5,真实问题的视角数从4到9都有,不能按查询自适应。SPIN训练没用上支撑文档,视角描述加文档联合监督可能还能涨。数据管道全自动,LLM偏见可能进标注;软覆盖的裁判是GPT-5-mini。测试集人工核过,训练集没有同等力度。评测在101万金文档池里做,不是开放网络。