Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun
cs.CL
2026-08-29
从低曝光网页挖出 1,094 道闭卷多答案题。Kimi-K3 完整回忆率 52.38%,其余几乎都是只记住一边。少数派文档曝光比多数派更能预测两边是否都记得。
常规事实问答默认只有一个标准答案。模型报出一个常见说法就算对,测不出来它是否把同一件事的另一份有出处的说法也记在参数里。长尾问答仍按单答案打分;知识冲突基准又多半是开卷,把互相打架的段落直接塞给模型,考的是阅读而不是记忆。
ElephantBench 问的是闭卷条件下的两件事:低曝光事实能不能被召回,以及同一主谓上两份都核过的说法能不能同时被召回。母题例子是特蕾莎修女的出生日期,IMDb 写 1910 年 8 月 26 日,另一来源写 27 日,两份都有公开依据。
语料先用 DCLM fastText 质量分类器切成高分和低分。基准挖的是被滤掉的低分文档,因为罕见事实更可能藏在这里。文档做成图:支持边连同一事实的一致说法,冲突边连同一主谓上不相容的说法。为了避免两两过一遍大模型,先按知识点聚类,再用实体倒排索引补跨簇候选,只对候选对做 support / conflict / none 分类。
每条冲突边扩成局部子图,生成一道命名实体题和一道线索题,答案集合相同。校验分三道门:大模型核对源文档是否撑得住每个答案,联网 agent 再找独立权威来源,最后人工丢掉实体错配、答案泄漏和题实不符。4,127 个子图生成 8,254 道候选,滤完剩 1,094 道,覆盖 22 个领域。
评测完全闭卷,无检索、无工具。GPT-5.6-Sol 按完整 / 部分 / 失败三档打分,并报告条件完整率 K(在至少召回一边的题目里两边都召回的比例)。与人类标注的完全一致率 90.13%–93.36%,Cohen's κ 0.815–0.877。
32 个配置里,最强的开源模型 Kimi-K3 完整回忆 52.38%,部分回忆 45.25%,失败 2.38%。Gemini-3.1-Pro 50.37%,GPT-5.5 50.18%。前三名几乎总能召回至少一边,失败率只有 2.19%–2.65%。主病灶是不完整,不是空白。
开源模型按规模看,小于 10B 的平均完整回忆只有 5.48%,最大的开源系统到 52.38%。Qwen3.5 从 2B 到 397B,完整率 1.65% 升到 32.27%,失败率 81.35% 降到 8.50%,部分回忆却升到 59.23%:更大的模型更常「记得这件事」,仍常只记主流说法。推理模式给 GPT-5.6-Sol 和 GPT-OSS-120B 分别加 13.99 和 12.89 个点,Qwen3.5 的 2B/4B 开推理反而掉 0.64 和 0.37 个点。
语料里多数派文档数加一标准差,部分回忆升 14.18 个点、失败降 10.17 个点;少数派同样加一标准差,完整回忆升 15.13 个点、部分回忆降 15.41 个点。人、组织、事件完整率 38.7%,消费品和服务只有 6.2%。32 个配置的预言机完整率从 52.4% 升到 81.2%,仍有 206 道题(18.8%)没有任何配置召回两边。
单答案事实榜会把「只记住主流说法」记成正确。如果产品要处理有争议的日期、价格、判决结果,完整回忆比准确率更接近真实风险。数据侧的含义也很硬:要补全记忆,加少数派来源比再给多数派加曝光更对症。图挖掘管线可以复用到别的低曝光语料上,代码和数据按 Apache 2.0 发布。
这是诊断基准,不是新训练方法。它告诉你记忆缺哪一块,并不直接给出补上的算法。
预训练数据不公开,文中的曝光统计来自一份公开网页语料,只能当相关,不能当某模型真见过什么。1,094 道题覆盖 22 个领域,远谈不上穷尽长尾,分歧类型也偏「同一槽位两个值」。32 个模型是截稿时的快照。每条保留说法都经独立公开来源核对,仍可能继承源站错误;基准声明只用于事实回忆研究。