MMTEB榜单受训练集污染
antoine_chaffin · x · 2026-07-15
这条帖子的核心是在说:按 SpartQA 和 MIRACL 排序会得到很有意思但也很“危险”的结果。
回复里补充了背景:这两项其实是 MMTEB leaderboard 的官方任务之一。当前没有模型能在这些任务上自然地拿到漂亮分数,除非模型在训练时直接用了这些特定数据集的训练集。也就是说,榜单上的一些高分更多反映了数据泄漏/记忆,而不是真正的泛化能力;有些“全局第一”的模型,在其他任务上甚至可能整体更差。
所属事件:MMTEB排行榜陷训练集数据污染争议(3 条相关)→
「研究」频道最新
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 用果蝇大脑连接组造了个 LLM,作者放出在线 demo — ngxson · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11