动态多模态事实核查基准仍有 17%–29% 污染风险
Haorui He · hf · 2026-07-29
这篇论文在质疑一个常见前提
作者重新审视了多模态自动事实核查(MAFC)里一个很常见的假设:只要把测试样本换成“模型知识截止日期之后”发布的声明,就能得到“无污染”的动态评测。
他们同时检查了静态基准 AVeriTeC 和新构建的动态基准 ClaimReview2025Q4,发现:
- 即便是截止日期之后的声明,仍有 17.09%–29.30% 可能存在污染风险;
- 很多“新声明”其实可以仅凭截止日期之前已有的公开知识直接验证,或者通过拼接多条旧信息推导出来;
- 污染会显著抬高评测成绩,Macro-F1 最多虚高 11.34 分,还会扭曲系统排名。
论文最后在更严格的去污染设置下重新评估了 SOTA 模型,并给出了一套更可信的多模态事实核查评测建议。
「多模态」频道最新
- GPT Image 2 九宫格分镜把喝茶到机甲大战压成一张图 — Practical_Low29 · 2026-07-29
- 改一段提示词,图像就变成了更浓的沙特文化风 — aziz4ai · 2026-07-29
- Twelve Labs 发布面向视频检索、记忆和智能体的技术栈 — qdrant_engine · 2026-07-29
- 同事做了个把歌曲自动变沙雕 MV 的 AI skill — oran_ge · 2026-07-29
- Magnific 把 AI 套件原生接进 Photoshop 和 Premiere — aziz4ai · 2026-07-29
- PrunaAI 开源 LTX-2.3 视频解码器,显存减半还更快 — linoy_tsaban · 2026-07-29