五个幻觉引用检测工具实测:抓得最全的,误报了一半真文献

Detecting Hallucinated and Suspicious Citations: What Current Tools Can and Cannot Do

Fidan Badalova, Philipp Mayr

cs.DL

2026-07-18

在 104 条人工标注的测试集上实测 5 个开源引用检测工具:抓得最全的工具会把约一半真实文献误报成可疑,高召回与低误报无法兼得。

这篇在解决什么

ChatGPT 这类大模型帮忙写论文时,会一本正经地编出根本不存在的参考文献:DOI 是错的、作者对不上、甚至整条引用是捏造的。这不是个别技术故障,它正在系统性地污染学术文献。

The Lancet 2026 年的一篇审计(Topaz 等)在 250 万篇生物医学论文里找到 4046 条捏造引用,频率从 2023 年的「每 2828 篇出现 1 条」涨到 2026 年初的「每 277 篇 1 条」,两年多里恶化了约 10 倍。另一篇多语料库研究(Zhao 等)估计 2025 年四个预印本平台合计出现约 14.7 万条幻觉引用,SSRN 的比例最高,达 1.91%。会议也未能幸免:ACL 2026 在终稿检查时发现 100 多篇已录用论文引用了不存在的文献。

问题有多严重已经被反复记录,缺的是一个诚实的回答:那些专门检测幻觉引用的工具到底靠不靠谱。这篇 position paper 就是来补这个缺口的,一边汇总严重程度的证据,一边拿 5 个开源工具做了一次受控实测。

方法

这篇不提出新算法,做的是一次受控评估。作者手工构建测试集:从三篇学术论文里抽出 104 条参考文献,逐条人工核验,标出 33 条有问题(标题错、作者或期刊对不上、DOI 解析不了或指向别的文章、根本查无此文),71 条真实有效。

测试集构成是 P1 有 24 条(其中 3 条有问题)、P2 有 15 条(4 条)、P3 有 65 条(26 条),问题集中在长文里。

然后拿五个工具逐个跑:CheckIfExist、HalluCiteChecker、Hallucinator、HalRef、RefChecker。思路大同小异,都是从 PDF 或 BibTeX 里把参考文献解析出来(标题、作者、年份、DOI),再去 Crossref、Semantic Scholar、OpenAlex、DBLP、PubMed 这些学术数据库里查这条引用是不是真实存在、字段对不对得上。差别在解析的鲁棒性、查的数据库多寡,以及匹配只看标题还是综合 DOI 加元数据。

每条引用对每个工具都有四种结果:真有问题被抓到、真没问题被正确放过、没问题却被误报、有问题却漏掉。

结果

工具抓到的假引用(TP/33)漏掉的假引用(FN)误报的真文献(FP/71)
RefChecker32(约 97%)136(约 51%)
CheckIfExist31(约 94%)234(约 48%)
Hallucinator29(约 88%)428(约 39%)
HalRef24(约 73%)953(约 75%)
HalluCiteChecker18(约 55%)1520(约 28%)

召回率和误报率由论文给出的 TP/FP 绝对数换算,原文只列绝对数。

规律清楚:召回率和误报率是绑在一起的。RefChecker 和 CheckIfExist 抓假引用最狠,33 条问题引用只漏掉 1 到 2 条,代价是 71 条真文献里有近一半被误报成可疑。HalluCiteChecker 走另一个极端,误报最少(约 28%),却漏掉了将近一半的假引用。Hallucinator 最均衡,两头都不算差。HalRef 输出最花哨,给每条引用算一个幻觉评分,但 75% 的真文献被误报,基本没法直接拿来用。

作者反复强调一句话:这些工具的输出不能当成最终判定。

为什么重要

对用大模型辅助写作的人,这篇给出两个可操作结论。第一,别指望单一工具一锤定音,把它当粗筛,凡是报可疑的条目都人工去核 DOI、标题、作者、期刊。第二,选工具看你在意哪头:宁可漏报选 HalluCiteChecker,宁可错杀选 RefChecker 或 CheckIfExist,要均衡选 Hallucinator。

对做工具的人,这篇把瓶颈定位在匹配算法的上游。从 PDF 里把参考文献干净解析出来这一步就经常出错,BibTeX 格式稍变就抓瞎,数据库覆盖不全会让真实但未被收录的引用被误判。改进空间在更鲁棒的解析(比如 GROBID 这类结构化抽取)和更多数据源联查,而不是把单个匹配算法调得更狠。

还有个被点名的坑:像 Pangram 这种通用 AI 文本检测器不能拿来查引用幻觉,它们只判断这段话像不像 AI 写的,根本不验证参考文献是否存在、字段是否正确。

局限与存疑

最大的局限是测试集太小:104 条引用、33 条有问题、只有 3 篇文档。按这个规模算出来的 97% 召回率或 75% 误报率只能说明趋势,不能当成稳定指标,换一批学科或 PDF 排版,排序就可能变。

这次实测是作者在自己机器上跑的一次性结果,没有报告重复性;不同版本、不同配置(比如 Hallucinator 装没装 GROBID)会给出不同数字。P3 那篇 65 条里就占了 26 条问题引用,单篇文档对汇总数字的影响被放大了。

多数工具的判定逻辑是黑箱。HalRef 的幻觉评分怎么算没公开,RefChecker 里 LLM 辅助联网核查这一步也难复现。要真正相信某个工具,需要论文结尾呼吁的那种多源、可复现的验证体系,这次实测离那一步还远。

作者自己也承认,The Lancet 和 Zhao 等的大规模研究不能证明每条捏造引用都直接来自 LLM,论文工厂和蓄意操纵也是可能来源。这篇把幻觉引用当成统一框架来谈,一定程度上模糊了成因。

术语

原文与代码

社区讨论

相关论文

全部论文解读