论文:LLM 重排被检索召回封顶,实测打不过简单协同过滤基线
_reachsumit · x · 2026-09-24
单作者论文揭示 LLM 推荐重排的评估陷阱与"召回天花板"效应。
- 核心发现:许多 LLM 重排器在 oracle 协议(保证真值物品在候选集内)下评估,会把真实 NDCG@10 高估 92–95%。
- 召回天花板:在三个领域八个数据集上,K=100 时现实检索只覆盖 2–19% 的相关物品,对任何封闭候选重排器的 top-k NDCG 构成确定性上界(leave-one-out 下 E[NDCG@k] ≤ Recall@|候选窗口|)。
- 实测结果:现实检索条件下,提示工程、168 倍参数规模缩放、序列模型、监督神经重排器、LoRA 微调、混合检索、分数感知提示、LLM+CF 融合等策略都显著不如简单协同过滤基线;提供上游 CF 分数主要让 LLM 复现 CF 的排序。
- 建议:提出 Recall-Aware Evaluation Protocol(RAEP)——先判断检索召回区间,再在 ceilings 允许区分的地方评估重排;低召回场景下,改进检索比改进重排更重要。
「研究」频道最新
- Anthropic 酶设计研究用上 AlphaFold,印证通用与专用模型互补 — JMateosGarcia · 2026-09-24
- Claude 携手 AlphaFold 研究新型酶系统,展现 LLM 与专用模型互补性 — JMateosGarcia · 2026-09-24
- ECCV 2026 论文:x0-prediction 破解 RAE 高维潜空间扩散难题 — serrjoa · 2026-09-24
- RecCAR 正则化弥合联合视频生成的跨模态注意力差距 — barilan · 2026-09-24
- 伯克利新法 Do as I Do:用普通人视频训练灵巧机械手操作 — micoolcho · 2026-09-24
- 学者提出:编织技艺直接贡献了数学的概念词汇与认知操作 — abenitezburraco · 2026-09-24