查询时局部改文档向量,编辑反馈下DL-Hard的nDCG@10相对涨60%

Embedding Surgery: Localized Updates for Adaptive Ranking Correction in Dense Retrieval

Maddalena Amendola, Antonio Mallia, Raffaele Perego

cs.IR

2026-09-04

把排序纠错写成凸二次规划,查询时只微移相关文档向量。编辑反馈下TAS-B在DL-Hard上nDCG@10从0.376到0.604,ANN索引可原地覆盖、不必重建。

这篇在解决什么

稠密检索把文档向量离线算好、放进静态索引。查询编码是在线的,文档那一侧基本冻住。用户反馈、编辑纠错、意图漂移来了,常见办法是微调编码器再全量重嵌,贵,也来不及修单条查询的排名错误。在线学习排序改的是排序函数,查询侧适应(如 CoRocchio)改的是查询向量。文档向量本身的局部修补,几乎没人做。

方法

Embedding surgery 把纠错写成带约束的凸二次规划。给定查询向量 q 和 top-k 文档,反馈提供成对偏好:相关文档 dᵣ 的内积应高于不相关 dₙ,并留出间隔 ε。目标是最小化所有被改向量的 L2 位移。问题凸、有唯一最优。单对约束有闭式解,一批约束交给 CVXPY。

三种改法:对称(正负样本都动,默认)、降权(只动不相关)、提权(只动相关)。对称在多数数据集上增益最大。

反馈来源三条。编辑判断把金标排序当目标,用 Kendall Tau 距离把当前排序变成目标排序所需的相邻交换,每交换一条约束。点击用反事实模型模拟 Perfect / Noisy / Near-Random 三种用户,一次点击产生一对「这一条好过上一条」。没有日志时,用 Qwen3-Reranker-8B 或 bge-reranker-v2-gemma 重排 top-20,把 LLM 排序当目标。ε 取成对分差与 0.01 的较小值。更新后不重新归一化,分数用原始内积。

实验覆盖 Contriever、TAS-B、E5、Snowflake-Arctic Embed,以及 TREC DL 2019/2020、DL-Hard、Robust 04(零样本域外)、CAsT 2019、QSharedRel、MS MARCO Dev 约 5.6 万查询。检索截断 top-20。

结果

编辑反馈是上限。Contriever 的 nDCG@10:DL'19 从 0.674 到 0.845(+25.37%),DL'20 从 0.672 到 0.878(+30.65%),DL-Hard 从 0.377 到 0.591(+56.76%),Robust'04 从 0.466 到 0.687(+47.42%)。最大相对涨幅是 TAS-B 在 DL-Hard 上 +60.64%(0.376→0.604)。交换约束满足率普遍 99% 以上。

点击反馈弱一档。Perfect 用户 1000 次点击后,Contriever 在 DL'19 只到 0.702(+4.15%),DL-Hard 到 0.454(+20.42%)。Noisy 接近 Perfect。Near-Random 几乎不涨,Robust'04 上有一次不显著的小跌。LLM 反馈介于两者之间,Snowflake 在 DL'19 最小 +3.59%,E5 在 Robust'04 最大 +24.56%。难查询上的相对增益最大。

向量位移的归一化 L2 多数低于 0.05。用 Dev 全部 5.6 万查询做大规模编辑手术后,Dev 的 nDCG@10 从 0.407 涨到 0.716,留出的 DL'19/20/Hard 几乎不动(0.674→0.669 这类变化,配对 t 检验不显著)。CAsT 上只改会话首问,后续轮次 nDCG@20 基本不变;QSharedRel 上共享相关段落的配对查询多数 RR 不降。HNSW 原地覆盖 185006 条向量不改边,IVF 改 183106 条、仅 0.38% 会换簇。ANN 上留出集指标变化同样不显著。

和 CoRocchio 可叠加。Perfect 用户:基线 0.674,CoRocchio 0.799,手术 0.702,合用 0.809。Noisy 合用 0.720,两边单独约 0.70。Near-Random 时 CoRocchio 掉到 0.632,手术留在 0.680。单条约束约 8 毫秒。

为什么重要

搜索、推荐、RAG 都有「这一条排错了、今晚就要改」的需求。这篇给出一个可以塞进现成 FAISS 管线的补丁:不重训、不重建索引,按反馈微移几条文档向量。编辑介入、公平性约束、业务规则这类明确指令,比嘈杂点击更对口。点击噪声下它比查询侧适应更稳,但幅度也小得多。

局限与存疑

+60% 是编辑金标喂给优化器的预言机数字,不是线上点击能复现的涨幅。点击实验是模拟日志,位置偏置被关掉,真实 SERP 行为更脏。LLM 当评估者,作者自己引用 Clarke 和 Dietz 的警告:生成标签有系统偏差,不能当成人判。约束由单一目标排序导出,保证无环、问题总可行;真实反馈互相打架时怎么松弛,只写在未来工作里。没有和在线 LTR 的直接对照。ε 和手术截断的敏感性也没系统扫。

术语

原文与代码

社区讨论

相关论文

全部论文解读