汤森路透研究:排名质量相近的 LLM 评分器决策重排后仅 0.66-0.84 重合
thomsonreuters · hf · 2026-10-05
汤森路透团队研究 LLM 评分器(用于段落重排、回复排序、多文档问答)的顺序依赖问题:候选内容共享同一 prompt 时,调换顺序会改变各自得分,而得分又决定阈值保留集、阅读器答案与偏好训练数据。
关键发现:
- 五个 nDCG@10 差距仅 0.010 以内的训练评分器,在候选重排后保留集重叠度只有 0.66-0.84——排名质量相近不等于决策一致
- 测试的所有 prompt 层面干预都无法解决该依赖,唯一能提升排名质量的方法对决策稳定性无改善
- 提出顺序一致性 SFT(OC-SFT),通过惩罚候选在不同顺序下得分的不一致,在三个任务上所有训练评分器中决策稳定性指标全面领先
- OC-SFT 单次排列的稳定性超过十个现成评分器排列取平均的蒸馏方法,且在 12 个基座模型上更稳定
作者建议:比较此类评分器时应报告阈值保留了什么、阅读器答了什么,而非只看排名质量。代码已开源。
「模型」频道最新
- 开源安全模型 Security-One 发布:27B 权重,专为智能体安全决策设计 — huggingface · 2026-10-05
- Red Hat AI 上架 Qwen3.8-Flash-Next NVFP4 量化版,MoE 专家 FP4、vLLM 即用 — huggingface · 2026-10-05
- GPT-6.1 Sol 实测:xhigh 档性价比最佳,medium 退化明显 — aitrendz_xyz · 2026-10-05
- 浏览器里梳毛毛的章鱼玩偶:Opus 5.5 对比 Sol,更蓬松还更便宜 — aitrendz_xyz · 2026-10-05
- Claude 对话全面受审查引恐慌,开发者呼吁本地 AI 必要性 — zacharynado · 2026-10-05
- OpenAI 推出 textGrain 文本水印,API 可选、欧盟 ChatGPT 强制 — btibor91 · 2026-10-05