MMTEB榜单疑有训练集污染

antoine_chaffin · x · 2026-07-15

这条回复补充了一个关于 MMTEB leaderboard 的重要观察:其中有两个官方任务,很多模型在这些任务上表现并不理想。

作者指出,表现“看起来很好”的少数模型,往往是因为直接使用了对应数据集的训练集,而不是因为真正的泛化能力。这意味着榜单结果可能被数据泄漏/训练集污染显著影响;也就是说,有些顶尖排名并不代表模型在更广泛任务上真的更强。

所属事件:MMTEB排行榜陷训练集数据污染争议(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →