稠密检索器不敌BM25?MIRIAD数据集查询来源成关键

tomaarsen · x · 2026-08-26

针对「同数据集上训练的稠密检索器在哪」的质疑,tomaarsen 给出两个模型链接,分别得分 67.04 和 61.42,承认它们确实表现不佳。但他指出这些模型在 MIRIAD 上跑不过 BM25 的根本原因在于:该数据集的查询是由文档生成的,这给 BM25 带来了巨大优势(词汇重合度高)。附带的 HF 模型卡显示其 embeddinggemma-300m 微调版在检索任务上 Cosine Recall@10 接近 0.99。

所属事件:MIRIAD 检索评测引热议,BM25 反超部分 LLM 检索器(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →