MMTEB榜单受训练集污染

antoine_chaffin · x · 2026-07-15

这条帖子的核心是在说:按 SpartQA 和 MIRACL 排序会得到很有意思但也很“危险”的结果。

回复里补充了背景:这两项其实是 MMTEB leaderboard 的官方任务之一。当前没有模型能在这些任务上自然地拿到漂亮分数,除非模型在训练时直接用了这些特定数据集的训练集。也就是说,榜单上的一些高分更多反映了数据泄漏/记忆,而不是真正的泛化能力;有些“全局第一”的模型,在其他任务上甚至可能整体更差。

所属事件:MMTEB排行榜陷训练集数据污染争议(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →