换换候选顺序,LLM 重排器排名就变:位置偏置破坏偏好一致性

Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking

Ethan Bito, Yongli Ren, Estrid He

cs.IR

2026-08-04

推荐场景里候选集是无序的,LLM 重排器却会因输入顺序不同给出不同排名。这篇不只看最终列表变化,还把不同排列下的排名当成一个「诱导偏好系统」,在成对、全局、列表三层量位置敏感度。实验发现这三层高度一致,却和推荐效果、边际曝光偏置背离:效果最好的方法偏好最不稳。

这篇在解决什么

推荐系统的两阶段管线里,LLM 常被拿来当 listwise 重排器:召回出一批候选,LLM 结合用户历史和物品元数据重排。但这里有个被忽视的可靠性问题——候选集本质是无序的,把同一批候选用不同顺序喂给 LLM,它给出的排名可能不一样。这违反了「排名不该依赖任意输入序列」的基本假设。

之前的工作把这个现象叫位置偏置,也给了缓解办法(排列聚合、校准、序列化选择)。但评估大多只看最终排序列表的变化,或者看各输入位置的边际曝光,没深究候选顺序敏感在 LLM 诱导出的「偏好结构」里长什么样。这篇要回答的是:换候选顺序时,局部的成对偏好稳不稳?全局偏好能不能被一个统一排序解释?这些和最终的列表一致性、推荐效果、边际曝光又是什么关系?

方法

作者把同一候选集在不同排列下产生的多个排名,看作对一个「诱导偏好系统」的多次观测。在这个系统上定义三个一致性度量,分别从局部、全局、输出三个层次刻画候选顺序敏感。

成对偏好不稳定度(PPI):一对候选的相对偏好,会不会随它们落在哪个位置桶(头部/中部/尾部)而翻转?对每对候选算其在各桶组合下偏好概率的最大差,再对所有候选对平均。全局偏好不一致度(GPI):诱导出的成对偏好系统能不能用一个全局排序解释?用加权 Kemeny 排序聚合找最小冲突排序,GPI 就是这个最小冲突占的比重。列表输出一致度(LOC):不同排列产出的完整排名之间的一致性,用 Kendall's τ 衡量。另外还有边际位置曝光偏置:每个输入位置进入 top-k 的概率,理想是均匀的(k/K)。

PPI、GPI、LOC 是同一现象的三层刻画,并非互相独立:局部、全局、可观测输出。

结果

MovieLens-32M 和 Amazon Books 两个数据集,三个模型(Llama-3.2-3B、Mistral-7B、Qwen2.5-7B),K∈{15,25,50},每个查询采 20 个排列,排名从 token 对数似然提取(确定性)。对比零样本重排和三种缓解法:bootstrapping(Borda 聚合)、SGS(逐个贪心选择)、STELLALW(校准式)。

核心发现:PPI、GPI、LOC 三者高度一致,在所有「模型×数据集」组合里给出相同的方法排序。但它们和推荐效果、边际曝光偏置背离。

指标(MovieLens-32M, Llama-3B, K=25)零样本STELLALWSGS
HR@5 ↑0.5560.592(最高)0.563
PPI ↓0.4780.833(最差)0.197(最好)
GPI ↓0.1150.365(最差)0.059(最好)
LOC ↑0.6360.118(最差)0.827(最好)

最反直觉的一点:STELLALW 拿到最高 HR@5,却同时是 PPI/GPI 最高、LOC 最低——推荐效果最好的方法,偏好结构最不稳。它把各位置的边际曝光压平了,却没换来稳定的成对偏好或一致的全局排序。SGS 在一致性和曝光上都最好,但要 K 次序列化推理(K=25 时 25 次),最贵;bootstrapping 一致性中等(3 次推理),STELLALW 要最多 10 次推理加 150 个探针集的离线校准。

结论很直接:只修边际曝光偏置,不足以让 LLM 重排获得稳定的成对偏好和一致的排名。评 LLM 重排器得把效果、置换一致性、边际曝光、推理成本一起看。

为什么重要

这篇对「用 LLM 做推荐重排」是个清醒的可靠性提醒。很多人盯着 HR/nDCG,以为指标上去就稳了,但同一个候选集换个顺序就变排名,意味着排序函数本身不 well-defined。三个度量(PPI/GPI/LOC)给了可操作的诊断工具,代码开源(InvariRank)。对线上系统,它点出一个实操权衡:最准的方法(STELLALW)恰恰最不稳,而最稳的方法(SGS)最贵,没有免费午餐。

局限与存疑

这是一篇 5 页的 RecSys 短文,贡献是评估框架和诊断结论,不提新模型。三个度量都建立在「采样若干排列」之上,排列数(M=20)和桶划分会影响数值;PPI 用桶而非精确位置,是稀疏下的妥协。全局排序的求解是近似的(local search),不是精确 Kemeny 最优。缓解法的效果只在两个数据集、三个模型上验证,泛化面有限。它没给出「怎么修才能同时高效果又高一致性」的解法,只指出这是开放问题。

术语

原文与代码

社区讨论

相关论文

全部论文解读