Think Before You Link: Rarity, Reasoning, and Retrieval in Multilingual Entity Linking
Parinthapat Pengpun, Simran Khanuja, Graham Neubig
EMNLP 2026 Main Conference
cs.CL
2026-09-10
Wikidata结构稀有与浏览量尾部平均只重叠37%。Pangea在这些切片上最多掉39.9点。Qwen3-VL-8B边推理边搜维基,全量87.9%(+6.9),稀有切片最高+23.3%。
多模态实体链接要把文本里标出的实体,连同配图,对上知识库里的那一条。图经常带着文字说不清的信号:日文只写「游轮」,船体上写着 Diamond Princess,才能链到正确条目。
现有系统在常见实体上还能打,到长尾就塌。此前衡量「稀有」几乎只用流行度,维基页面浏览量、入链数这一类。流行度测的是有没有人看,测不出一个实体在知识图谱里写得清不清楚、跨语言有没有条目。一个实体可以很火但 Wikidata 很瘦,也可以冷门但文档很厚。例子就在测试集里:2016 Indian banknote demonetisation 英文页写得很满,图谱却稀;Muttahida Qaumi Movement 正好反过来。
CMU NeuLab 在 MERLIN 上把这两种稀有拆开。MERLIN 覆盖印地语、印尼语、日语、泰米尔语、越南语。输入是段落、配图和标注 mention,输出是对应的英文维基标题,打分用 exact-match。
稀有分两族指标,都从维基和 Wikidata API 拉。维基一侧看编辑投入:90 天浏览量、反向链接、篇幅、修订次数、编辑人数、分类数、外链、参考文献、配图。Wikidata 一侧看结构连通和跨语言覆盖:出入链、语言版本数、statement 数、qualifier 数、条目年龄。实体在某指标上落在测试集底部 5%,就算该指标下的稀有。底部 5% 集合两两平均只重叠 37%,有的指标对只重叠 10%。
链接系统本身不训练。骨干是 Qwen3-VL 的 Thinking 和 Instruct 两套,2B / 4B / 8B 对照,同一架构才能把推理、检索和规模拆开。检索语料是英文维基,两条路并行:BM25 做词面匹配,multilingual-e5-large-instruct 把标题加描述嵌进 FAISS。每一步看图看文、发查询、读回片段,再决定要不要继续搜,最多 20 轮。所有 RAG 配置强制第一次调用。预实验里 2B 经常直接作答,名义上的 RAG 会退化成没检索。第一轮之后工具调用交给模型。推理痕迹是自由文本,第二模块再把痕迹压成唯一维基标题。
对照三条公开数字:GEMEL 58.7%,mGENRE 72.9%,Cultural Pangea-7B 81.1%(当时 MERLIN 上的 SOTA)。另加一条检索感知基线 CulturalPangea-RAG:Pangea 不会调工具,只能把 top-5 检索的标题和描述硬拼进输入。
Cultural Pangea 全量 81.1%,底部 5% 切片掉 15.4–39.9 个点。浏览量切片掉 37.7,Wikidata statement 切片掉 37.0,分类数切片掉 39.9。结构尾部和流行度尾部几乎不是同一批实体。只看浏览量,会漏掉一大片同样会失败的条目。
最好配置 8B-Think+Embed 全量 87.9%,比 Pangea 高 6.9 个点。印地语和印尼语各 +10.0,日语只 +2.1。按重定向宽松计分,优势还剩 4.9。15 个稀有切片里 14 个增益大于全量增益。
| 切片(底部 5%) | 8B-Think+Embed | 相对 Pangea |
| 全量 | 87.9 | +6.9 |
| Qualifier | 68.4 | +23.3 |
| Statement | 66.1 | +22.1 |
| Wikidata 出链 | 66.3 | +21.7 |
| 语言版本数 | 63.9 | +16.3 |
| 页面浏览量 | 57.5 | +14.1 |
推理和检索拆开看,结论很硬。8B-Think 加上 embedding 检索,全量只 +3.8,语言版本稀有切片变成 +18.8,大约 5 倍。Think 对 Instruct、两边都不检索时,稀有切片上差异不显著,p 大于 0.5。Instruct 加 BM25 在全量上 -4.9:它每条平均搜 3.2–3.7 次,查询之间几乎不思考,到第 15 次之后原样重复查询占到 34%,常见实体上噪声盖住参数记忆。到了结构稀有切片,同一套 BM25 又能 +8.1 到 +12.6,因为参数里本来就没有答案。Thinking 模型每条只搜 1.0–2.2 次,相邻查询之间写 1454–1534 token,56–58% 的查询转移是在旧查询上加消歧上下文。
规模上,4B-Think+Embed 全量 83.7%,和 8B-Instr 的 83.5% 持平,参数一半,token 大约 2.8 倍。稀有实体上这个小推理模型反而领先 5 到 7 个点。2B-Think 在 97% 的样本上只做那一次被强制的搜索,工具用不起来。把检索结果硬拼给 Pangea,81.1% 会被拉到 74.5%。
残差 841 个错误里,72% 是检索根本没把正确实体搜出来;另有 23.5% 推理里碰到了正确答案又否掉。稀有实体错误率 31.1%,头部只有 8.4%。
给做多语言实体链接和带工具的 VLM 三件能直接用的判断。
流行度不是稀有。文化上很局部、跨语言条目很少的实体,和「没人点开」不是一类失败。评估长尾至少要带上 Wikidata 结构指标。论文放出了 MERLIN-Rare 切片,专门卡这一段。
推理模型不会凭空补知识。稀有实体要的是外部分块证据;推理的用处是少搜、改查询、把噪声滤掉。Instruct 乱搜会伤害头部准确率。默认给所有模型接上搜索,会把常见实体打坏。
4B 带检索在稀有实体上打得过 8B 不带检索。账单是推理 token。附录里 8B-Think 不检索已经能拿到最好系统 96% 的全量准确率,token 只有 45%。全量场景未必值得开满检索。
析因实验几乎全在 Qwen3-VL 一家。GLM-4.6V-Flash 的 thinking 模式加检索,15 个稀有切片全涨,全量却从 84.5 掉到 81.8。它的 non-thinking 模式撑不住检索循环,大约 15% 样本陷入重复生成。跨模型家族只能说稀有实体上检索有用,不能说「推理乘检索」的交互一定成立。
知识库锁死英文维基。MERLIN 的实体按构造都有英文条目。没有英文页的实体、以及维基更瘦的非洲语言,这篇没有测。跨语言检索仍是主瓶颈:日文报纸把美国写成「米」,模型当成姓氏去搜 Mi surname,正确答案从未进过候选。
评测是 exact-match,重定向和合法简称按全错算。和先前 MERLIN 工作可比,也会把部分「实体对了、标题字符串不对」算成错。