长文本优势减弱?BM25 在合成查询检索中反超 LLM

tomaarsen · x · 2026-08-26

在 MIRIAD 数据集上的评测显示,部分 LLM 的表现未能超越传统的 BM25 算法。主要原因在于该数据集的查询直接基于文档生成,这对关键词匹配方法(BM25)极为有利。此外,该数据集的平均序列长度约为 984 tokens,这对支持长上下文的模型或对上下文长度不敏感的模型(如 BM25)更为有利。

所属事件:MIRIAD 检索评测引热议,BM25 反超部分 LLM 检索器(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →