MIRIAD 检索评测引热议,BM25 反超部分 LLM 检索器

围绕 MIRIAD 数据集的检索评测引发讨论。tomaarsen 承认同数据集上训练的稠密检索器表现不佳(得分 67.04 与 61.42),部分 LLM 也未能超越传统 BM25,原因是该数据集查询直接基于文档生成,对关键词匹配极为有利。但他同时指出,针对任务微调的多向量(MVE)模型非常强,能击败其找到的所有稠密或稀疏检索模型。

2026-08-26 ~ 2026-08-26 · 3 条相关