RELER:在嵌入空间用强化学习训练检索模型,直接优化检索指标
_reachsumit · x · 2026-10-07
arXiv 论文提出 RELER,让现有 embedding 模型通过 RL 在嵌入空间直接学习检索并对齐任务奖励。
- 方法:从以归一化编码器输出为中心的 vMF 分布采样单位长度 query/document 嵌入作为动作,以检索或下游结果为奖励,用 RLOO 更新编码器
- 针对高维探索噪声提出条件均值投影(CMP),将采样嵌入投影到编码器输出与候选嵌入张成的低维子空间,降低策略梯度噪声
- 在推理密集型基准 BRIGHT 上,后训练 BGE-M3 与 Qwen3-Embedding 时平均 nDCG@10 一致超过 InfoNCE 和 LambdaLoss
- 在 RAG 下游任务上同样验证了实用性
「研究」频道最新
- Fractal Frontier:AI 或将证明世界远比人类偏好更有序 — IgorCarron · 2026-10-07
- BVB 基准:让 Agent 用 Blender 程序化重建真实视频来检验理解力 — RexDouglass · 2026-10-07
- DeepMind 发布 AlphaProtein Novo,可从零设计全新酶催化自然界没有的反应 — Scobleizer · 2026-10-07
- 安全研究者翻出 2025 年演讲旧预测:竟提前命中 ExploitGym 及其问题 — moyix · 2026-10-07
- OpenAI 新数学仓库或夯实磁等离子体研究,候选成果瞄准 Vlasov-Maxwell 方程 — johnseach · 2026-10-07
- 数学外包给 OpenAI 后,经济学研究格局将如何重排 — RexDouglass · 2026-10-07