动态评测也防不住数据污染:研究称最高近30%题目形同虚设
青稞AI · wechat · 2026-08-04
香港浸会大学等机构的研究团队发现,即便采用专门收集模型知识截止日期之后新题的动态评测,也无法完全消除数据污染。
污染的隐蔽性
- 新题藏旧知识:部分新发布的问题可能探讨的是旧事实,或者答案可以由模型已知的旧知识简单推导拼凑得出。
- 污染比例极高:在多模态事实核查的动态基准测试中,仍有 17.09%–29.30% 的样本存在潜在污染风险。
评测机制失真
- 分数虚高:污染样本会显著抬高模型成绩,最高可使 Macro-F1 虚高 11.34 个百分点。
- 排行榜错位:污染不仅导致绝对分数偏高,还会改变模型间的相对排名。在剔除污染样本后,榜首模型易主。
- 搜索轨迹暴露捷径:面对污染样本,模型无需充分探索,发出的搜索查询更加精准,仿佛提前拿到了线索。
彻底去污后的真实表现
研究构建了严格的无污染测试集,结果显示,当前主流多模态事实核查系统的 Macro-F1 均未超过 56%。这表明系统在处理真正未知的新事件时能力依然受限。
「研究」频道最新
- 研究员热议:超置等新论文让人梦回 2019 年的黄金时代 — _xjdr · 2026-08-24
- Biomni:可自主执行生物医学研究工作流的通用 AI Agent — bravo_abad · 2026-08-24
- 数据过滤是零权重混合特例,分布基础待解 — SinclairWang1 · 2026-08-24
- Anthropic 公开 2026 智能体对齐失败案例研究 — voooooogel · 2026-08-24
- Hugging Face 用夜间 Agent 自动挖掘 arXiv 上的失传开源模型 — NielsRogge · 2026-08-24
- Daedalus-150M:混合架构小模型优化 CPU 推理 — Christos Koutsiaris · 2026-08-24