Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It
Jonghyun Song, Haewon Park, Jeonghoon Shim, Woojung Song, Yohan Jo
cs.CL
2026-10-02
12个Agent在三类检索中,需求与位置对齐后仍按站点选品,少一项的偏好源中位入选68%,反向仅2%。
Agent 替用户勾选商品、酒店和论文。来源偏好指的是:需求满足得一样多,模型仍更常选某些站,例如留下 Booking.com、放过 Expedia。
同文换源的实验已经看到偏向。真实检索对不上那个设置:各站条目内容不同,达标程度和位置也不同。选得更多,可能只是货更好,或更常排在前面。要分开的是四件事。自己搜、自己选时,偏好还在不在。URL 和站名改不改选择。训练把更好的回答反复绑到某个站上,会不会把来源学成达标捷径。摘要缺价格时,成见会不会把空填上。
首尔大学让 12 个模型走 ReAct(推理和动作交替):需求收成短关键词,用 Tavily 检索,最多 10 条,平均 8.83 条。模型只看标题、摘要和 URL,不能打开网页,可多选或再搜,一集最多三次。请求 4,822 条,购物 1,500,住宿 786(572 条为换城市变体),学术 2,536。模型含 GPT-5.4-nano、GPT-5.6-Luna、Gemini-3.7-Flash、GLM-5.3-Flash、DeepSeek-v4-Flash、Llama-4 两款、Llama-3.1-8B、Tulu-3-8B 与三款 Qwen。
达标交给 Qwen3.8-27B,只看标题和摘要,URL 与站名去掉。对人工的一致性 α 为 0.65-0.75,标注员彼此 0.67-0.72。不同来源、条件集合相同的两条配成一对。列表循环轮转,使每条出现在每个位次,再比该位次的选中与否,以去掉靠前更容易被选的优势。
对手构成不同,选中率不能横比。带平局的 Bradley-Terry 把两两胜负合成评分 β,τ 表示相对平均来源多出的选中率百分点。显著为正是偏好(SOURCE+),显著为负是回避(SOURCE−),不显著只是证据不够,不能当成零偏好。检验按请求重抽样,模型和域内的错误发现率控制在 5%。
三个域里,12 个模型都兼有偏好源和回避源。最常见的 4 个来源约占该域结果的四分之一。144 组里 110 组为偏好或回避,τ 中位数是 +15 与 -18 个百分点。
方向大体一致。12 个来源里有 10 个,不会出现一个模型偏好、另一个回避。Amazon 和 eBay 是例外:多数偏好,GPT-5.4-nano 回避。Walmart 被 12 个模型全部偏好,Target 只有 2 个;Booking.com 有 10 个偏好,Expedia 有一半回避。arXiv 的 τ 从 +16 到 +34,且全部为正;Medium 从 -5 到 -26,且全部为负;Facebook 从 -19 到 -52。频率前 20 的来源里,32 个有多数标签的站中,27 个符号在所有模型上一致。学术多偏好(14/17),购物与住宿多回避(6/8、6/7)。Qwen 与 Llama 家族里,较新模型的平均绝对值更大。
少一个条件时,较差条来自偏好源、较好条来自回避源,较差条中位入选 68%;对调后是 2%;中性来源互比是 19%。每个点大约 2,000 次只选中其一的比较。回避源一侧的拖累更大。
从隐藏到来源复原,偏好源 τ 平均 +5.8 个百分点,回避源 -5.9。11 个模型中有 9 个,差距拉大的八成以上发生在只恢复 URL 时。正文不变、只换标签,偏好标签一律更高,购物上 Llama-4-Maverick 为 +64.7 个百分点。三个 8B-9B 模型做直接偏好优化(DPO),各 5,000 对:假来源在 80% 的对里绑着更好商品时,达标相同的测试选中率到 70.1%-75.1%,此前约 50%;绑 20% 时降到 24.5%-28.5%。Amazon 相对 eBay、Etsy、AliExpress 的 53.7%-62.7%,配平后回到 49.7%-51.9%。补上同一合规价格,偏好源选中率下降 2.8 到 28.3 个百分点。提示只说网址与价格无关,变动在 -1.1 到 +1.3;写成回避源通常更便宜,最多降 22.5。
| 对照 | 指标 | 结果 |
| 少一项的偏好源 vs 反向 | 较差条中位入选率 | 68% vs 2%,中性对 19% |
| 高频来源 vs 平均来源 | τ 中位数 | +15 / -18 个百分点 |
| 恢复来源 vs 完全隐藏 | τ 平均变化 | 偏好 +5.8,回避 -5.9 |
| 同一正文换上偏好标签 | 购物选中率差 | Llama-4-Maverick +64.7 |
| 假来源 80% 绑更好回答 | 达标相同的选中率 | 70.1%-75.1%,训练前约 50% |
只看达不达标,站点造成的曝光差会被记成零。少一个条件、且较差条来自偏好源时,回避源上更好的那条在 68% 的比较里被放过,反向只有 2%。补价格后五个模型都下降,幅度从 2.8 到 28.3 个百分点,并不整齐。配平训练里的来源绑定,Amazon 可回到约 50%。声明网址与价格无关几乎无效。点名回避源、写上相反的价格印象才有效,还要预知压谁。相对同文换源的旧实验,多出来的是真实检索和位置轮转。上线可用的去偏组件还没有。
模型打不开网页,只凭标题、片段和 URL 做决定,没有详情页。缺价格时用来源填空,会比用户点进去更重。住宿请求里 572/786 是换城市写成的,不宜当成自然搜索。价格还可标成未知,匹配和翻转都靠这套评判,评判和人的 α 只有 0.65-0.75。API 即使温度为 0 也不保证可复现,GPT-5.6-Luna 还得用温度 1。
DPO 停在 8B-9B。绑定比例足以制造或反转偏好,没有证明那 12 个模型的 Booking.com、arXiv 偏向来自同一机制。点名提示得先知道回避源,而且只是对冲,成见本身还在。隐藏实验的分母是 11 个模型,缺的一个没有解释。达标更好的来源,τ 也更高。站名和历史质量在野外各占多少,没有分开。