Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li
cs.CL, cs.AI, cs.MM
2026-07-26
这篇实测发现,知识截断后发布的声明仍有 17%–29% 被模型记住,污染最多抬高 11.34 分 Macro-F1,还会翻转模型排名。
多模态自动事实核查(MAFC)系统让大模型去网上检索证据,判断一条说法的真假。要给它打分,先得有一批「说法」(claim)当考题。问题就出在考题本身。主流的静态基准 AVeriTeC 收集的是 2020 年 10 月之前的说法,这些事如今的模型在预训练里早就见过,不用上网、靠脑子里的知识就能答对,分数被白白抬高。这是评测圈老生常谈的数据污染(contamination)。
近来的解法是「动态基准」:只用模型知识截断日之后发布的说法,假定模型没见过、天然干净。这篇 ACM MM 2026 论文质疑的正是这个假定。截断之后才发生的事,模型就真的一点都不知道吗?答案远没有想象中干净。
作者建了一个新基准 ClaimReview2025Q4,901 条来自国际事实核查网络(IFCN)认证机构、2025 年第四季度发布的英文说法,去重清洗后作为动态测试集。静态那侧沿用 AVeriTeC 的 491 条说法,最新一条停在 2020 年 10 月。
判断一条说法「有没有被污染」,思路很直接:既然污染是指模型用脑子里的知识代替了检索证据,那就让模型在断网状态下针对这条说法自己写一篇核查文章,看它凭记忆吐出来的证据,和人类核查员实际依据的证据有多像。具体三步:
匹配度高,就说明模型脑子里已经装了够解题的证据,这条声明对它不算「新」。这套方法本身也能反过来当工具用,给现成基准做去污。
作者测了六个模型:GPT-5.2、GPT-4o-Mini、Gemini-3.0-Pro/Flash、DeepSeek-V3.2、Qwen3.5-122B-A10B。事实核查系统统一用 DEFAME(ICML 2025),检索走 Google 网页与图片搜索,取前 3 页。
核心结论一句话:动态基准确实比静态干净,但远没到「干净」的程度。
污染残留是全文最抓人的数字。在 ClaimReview2025Q4 上,即便只用了知识截断后的说法,仍有 17.09%–29.30% 被判为可能已污染(六个模型、三种指标取交集,Qwen3.5-122B-A10B 最严重)。动态采集只比静态平均减少了 2.92–11.16 个百分点的污染。
为什么截断后的事模型也知道?作者归纳出两条路径。一是声明直接挂在截断之前的事实上:核查的是美国 1986 年通过的 EMTALA 医疗法案、2022 年英国斯卡伯勒取消的跨年烟花、2020 年的电视牌照政策,这些「新声明」套的是老事实。二是可由多个旧事实拼出来:有一条核查 Barron Trump 2028 年够不够格选参议员,只要把「参议员需满 30 岁」和「他 2006 年出生」两个截断前就公开的事实一拼,答案就出来了。
污染对分数的抬升,各模型差异很大。把同源同时段的声明拆成「已污染」和「未污染」两份子集对比(同一个 DEFAME 系统):
| 模型 | 已污染 Macro-F1 | 未污染 Macro-F1 | 下降 |
| Gemini-3.0-Flash | 61.22% | 49.88% | −11.34 |
| Qwen3.5-122B-A10B | 57.48% | 47.16% | −10.31 |
| Gemini-3.0-Pro | 61.07% | 52.50% | −8.57 |
| GPT-4o-Mini | 56.41% | 46.82% | −9.59 |
| GPT-5.2 | 57.68% | 52.81% | −4.87 |
| DeepSeek-V3.2 | 54.79% | 52.57% | −2.22 |
星号是 bootstrap 检验 p<0.05 显著。GPT-5.2 和 DeepSeek-V3.2 没有显著下滑,其余四个模型都中招。准确率下降最大的是 Qwen3.5,掉了 10.88 个百分点。
污染还翻转了排名。在已污染子集上,Macro-F1 第一是 Gemini-3.0-Flash(61.22%);到了未污染子集,第一换成了 GPT-5.2(52.81%)。换句话说,你以为最强的系统,可能只是最会背的那一个。
更细的机制证据:污染让模型偷懒。Table 6 里 Qwen3.5 在未污染声明上的「探索式」改写检索平均 1.24 次,已污染的只有 0.89 次。它省掉了反复换词检索的过程,直接用记忆里的答案交差。
作者最后取了 154 条对六个模型、三种指标都未污染的声明,做了一份严格控污评测。结果所有模型 Macro-F1 都没过 56%,最高是 DeepSeek-V3.2 的 55.93%。事实核查离「做完了」还远得很。
对做评测、做 benchmark 的人来说,这是一记实在的提醒:光靠时间戳筛掉截断前的声明不够,「动态等于干净」是个站不住的假设。任何用 post-cutoff 声明、LiveBench 思路搭的事实核查或检索增强评测,都可能把能力高估 5 到 11 个 Macro-F1 分,甚至改变模型座次。
对做事实核查系统的人,结论更冷静。把数据污染洗掉之后,最强模型也只有约 56% 的 Macro-F1,而且数据里近七成是「被驳回」类,标签严重偏斜。这个任务还有大量空间。
附带的产出物也实用。那套「让模型离线生成证据、再和人类证据比对」的污染检测流水线,可以直接拿去给现成基准去污,不是只为这篇论文服务。
作者自己承认的:相似度匹配只能抓证据层面的显式重叠,对更隐蔽的潜在污染(latent contamination)估计偏保守;只测了英文声明;开源模型 DeepSeek、Qwen 的知识截断日本就无从知晓,污染判断只能基于显式证据。阈值是在 180 条声明(动态集的 20%)上定的,证据抽取默认用 GPT-4o-Mini,他们用 GPT-5-Nano 复核过,结果稳定。
读完还有一处存疑。整个下游性能对比固定用 DEFAME 这一个系统,而污染是通过「模型能否离线生成匹配证据」判定的,这套判定本身又依赖 GPT-4o-Mini 的证据抽取质量,两层 LLM 判断叠在一起,误差如何叠加没有充分量化。另外 154 条控污集偏小,且 68% 是 Refuted 类,模型在这个集上的座次(DeepSeek-V3.2 第一)未必稳。