动态评测也防不住数据污染:研究称最高近30%题目形同虚设

青稞AI · wechat · 2026-08-04

香港浸会大学等机构的研究团队发现,即便采用专门收集模型知识截止日期之后新题的动态评测,也无法完全消除数据污染。

污染的隐蔽性

评测机制失真

彻底去污后的真实表现

研究构建了严格的无污染测试集,结果显示,当前主流多模态事实核查系统的 Macro-F1 均未超过 56%。这表明系统在处理真正未知的新事件时能力依然受限。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →