汤森路透研究:排名质量相近的 LLM 评分器决策重排后仅 0.66-0.84 重合

thomsonreuters · hf · 2026-10-05

汤森路透团队研究 LLM 评分器(用于段落重排、回复排序、多文档问答)的顺序依赖问题:候选内容共享同一 prompt 时,调换顺序会改变各自得分,而得分又决定阈值保留集、阅读器答案与偏好训练数据。

关键发现:

作者建议:比较此类评分器时应报告阈值保留了什么、阅读器答了什么,而非只看排名质量。代码已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →