动态事实核查基准也不干净:17%–29% 的「新声明」模型其实已经知道

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

cs.CL, cs.AI, cs.MM

2026-07-26

这篇实测发现,知识截断后发布的声明仍有 17%–29% 被模型记住,污染最多抬高 11.34 分 Macro-F1,还会翻转模型排名。

这篇在解决什么

多模态自动事实核查(MAFC)系统让大模型去网上检索证据,判断一条说法的真假。要给它打分,先得有一批「说法」(claim)当考题。问题就出在考题本身。主流的静态基准 AVeriTeC 收集的是 2020 年 10 月之前的说法,这些事如今的模型在预训练里早就见过,不用上网、靠脑子里的知识就能答对,分数被白白抬高。这是评测圈老生常谈的数据污染(contamination)。

近来的解法是「动态基准」:只用模型知识截断日之后发布的说法,假定模型没见过、天然干净。这篇 ACM MM 2026 论文质疑的正是这个假定。截断之后才发生的事,模型就真的一点都不知道吗?答案远没有想象中干净。

方法

作者建了一个新基准 ClaimReview2025Q4,901 条来自国际事实核查网络(IFCN)认证机构、2025 年第四季度发布的英文说法,去重清洗后作为动态测试集。静态那侧沿用 AVeriTeC 的 491 条说法,最新一条停在 2020 年 10 月。

判断一条说法「有没有被污染」,思路很直接:既然污染是指模型用脑子里的知识代替了检索证据,那就让模型在断网状态下针对这条说法自己写一篇核查文章,看它凭记忆吐出来的证据,和人类核查员实际依据的证据有多像。具体三步:

匹配度高,就说明模型脑子里已经装了够解题的证据,这条声明对它不算「新」。这套方法本身也能反过来当工具用,给现成基准做去污。

作者测了六个模型:GPT-5.2、GPT-4o-Mini、Gemini-3.0-Pro/Flash、DeepSeek-V3.2、Qwen3.5-122B-A10B。事实核查系统统一用 DEFAME(ICML 2025),检索走 Google 网页与图片搜索,取前 3 页。

结果

核心结论一句话:动态基准确实比静态干净,但远没到「干净」的程度。

污染残留是全文最抓人的数字。在 ClaimReview2025Q4 上,即便只用了知识截断后的说法,仍有 17.09%–29.30% 被判为可能已污染(六个模型、三种指标取交集,Qwen3.5-122B-A10B 最严重)。动态采集只比静态平均减少了 2.92–11.16 个百分点的污染。

为什么截断后的事模型也知道?作者归纳出两条路径。一是声明直接挂在截断之前的事实上:核查的是美国 1986 年通过的 EMTALA 医疗法案、2022 年英国斯卡伯勒取消的跨年烟花、2020 年的电视牌照政策,这些「新声明」套的是老事实。二是可由多个旧事实拼出来:有一条核查 Barron Trump 2028 年够不够格选参议员,只要把「参议员需满 30 岁」和「他 2006 年出生」两个截断前就公开的事实一拼,答案就出来了。

污染对分数的抬升,各模型差异很大。把同源同时段的声明拆成「已污染」和「未污染」两份子集对比(同一个 DEFAME 系统):

模型已污染 Macro-F1未污染 Macro-F1下降
Gemini-3.0-Flash61.22%49.88%−11.34
Qwen3.5-122B-A10B57.48%47.16%−10.31
Gemini-3.0-Pro61.07%52.50%−8.57
GPT-4o-Mini56.41%46.82%−9.59
GPT-5.257.68%52.81%−4.87
DeepSeek-V3.254.79%52.57%−2.22

星号是 bootstrap 检验 p<0.05 显著。GPT-5.2 和 DeepSeek-V3.2 没有显著下滑,其余四个模型都中招。准确率下降最大的是 Qwen3.5,掉了 10.88 个百分点。

污染还翻转了排名。在已污染子集上,Macro-F1 第一是 Gemini-3.0-Flash(61.22%);到了未污染子集,第一换成了 GPT-5.2(52.81%)。换句话说,你以为最强的系统,可能只是最会背的那一个。

更细的机制证据:污染让模型偷懒。Table 6 里 Qwen3.5 在未污染声明上的「探索式」改写检索平均 1.24 次,已污染的只有 0.89 次。它省掉了反复换词检索的过程,直接用记忆里的答案交差。

作者最后取了 154 条对六个模型、三种指标都未污染的声明,做了一份严格控污评测。结果所有模型 Macro-F1 都没过 56%,最高是 DeepSeek-V3.2 的 55.93%。事实核查离「做完了」还远得很。

为什么重要

对做评测、做 benchmark 的人来说,这是一记实在的提醒:光靠时间戳筛掉截断前的声明不够,「动态等于干净」是个站不住的假设。任何用 post-cutoff 声明、LiveBench 思路搭的事实核查或检索增强评测,都可能把能力高估 5 到 11 个 Macro-F1 分,甚至改变模型座次。

对做事实核查系统的人,结论更冷静。把数据污染洗掉之后,最强模型也只有约 56% 的 Macro-F1,而且数据里近七成是「被驳回」类,标签严重偏斜。这个任务还有大量空间。

附带的产出物也实用。那套「让模型离线生成证据、再和人类证据比对」的污染检测流水线,可以直接拿去给现成基准去污,不是只为这篇论文服务。

局限与存疑

作者自己承认的:相似度匹配只能抓证据层面的显式重叠,对更隐蔽的潜在污染(latent contamination)估计偏保守;只测了英文声明;开源模型 DeepSeek、Qwen 的知识截断日本就无从知晓,污染判断只能基于显式证据。阈值是在 180 条声明(动态集的 20%)上定的,证据抽取默认用 GPT-4o-Mini,他们用 GPT-5-Nano 复核过,结果稳定。

读完还有一处存疑。整个下游性能对比固定用 DEFAME 这一个系统,而污染是通过「模型能否离线生成匹配证据」判定的,这套判定本身又依赖 GPT-4o-Mini 的证据抽取质量,两层 LLM 判断叠在一起,误差如何叠加没有充分量化。另外 154 条控污集偏小,且 68% 是 Refuted 类,模型在这个集上的座次(DeepSeek-V3.2 第一)未必稳。

术语

原文与代码

社区讨论

相关论文

全部论文解读