IBM 用交叉编码器扩展 BM25,提升语义检索召回
_reachsumit · x · 2026-08-04
IBM 这篇论文提出 CE-QE(Cross-Encoder Query Expansion),用交叉编码器从语义检索结果里找出关键术语,再把这些词扩展到 BM25 查询中,专门缓解“查询词和文档表述不一致”的词汇鸿沟问题。
- 它不是用 BM25 自己的结果做伪相关反馈,而是先从语义检索结果出发,减少错误结果带来的自我强化漂移。
- 它也不同于 HyDE、Query2doc 这类生成式扩展:新增词必须逐字来自已检索到的段落,不会凭空“编”出语料里没有的词。
- 在 7 个 BEIR 数据集上,作者称方法在词汇不一致场景下提升明显,例如 NQ Recall@100 从 0.32 提升到 0.47;其 score-fusion 变体 SESF 的召回率也比交叉编码器分数融合高 2.5%。
所属事件:IBM推交叉编码器查询扩展法提升搜索召回率(3 条相关)→
「研究」频道最新
- 南大提出 AVE-Compass:专测音视频协同编辑的全新基准 — NJU-LINK · 2026-08-06
- Kimi K3 架构深度解析:2.8T 参数与 LatentMoE 细节揭秘 — AxSaucedo · 2026-08-06
- NBER论文:近两成职场人篡改履历,AI技能提及激增 — steverathje2 · 2026-08-06
- Nature 重磅:绘制人类转录因子 DNA 结合特异性扩展图谱 — anshulkundaje · 2026-08-06
- 《百页语言模型书》发布:用PyTorch从零构建LLM — burkov · 2026-08-06
- 《百页语言模型书》暗黑版发布,手把手教你构建LLM — burkov · 2026-08-06