Think Thrice Before Reranking: Multi-perspective Evidence and Reasoning Integration for Text Reranking
Lijun Liu, Zhengzong Chen, Wenyan Li, Yuanyuan Zhao, Fei Huang
cs.IR, cs.CL
2026-09-17
荣耀提出MERIT-Rank:同一模型从语义对齐、意图满足、证据落地三条轨迹推理并合成最终排序。4B在BRIGHT上NDCG@10达到36.6,超过ReasonRank-7B的35.7与ERANK-4B的30.5。
现有基于LLM的listwise重排,Rank-R1、REARANK、ReasonRank这一路,几乎都是先写一条推理链,再按这条链输出排序。排序条件于推理,局部错误会顺着自回归传到最终名次。真实相关性也不是单面的:语义贴不贴、有没有答到用户真正想问的、文档里有没有可核验的证据,三条经常打架。单轨迹只能抓住其中一部分。
荣耀(Honor Device)把问题收成两件:怎么在一个模型里同时走多条互补轨迹,以及怎么把这种更长的生成训稳。
MERIT-Rank先建一个多轨迹推理空间(MTRS),固定三条视角:
模型按视角依次写出「推理加中间排序」,再用一段合成推理把三条证据收成最终排序。全程一个模型、一次自回归,不走多模型ensemble。
训练数据用DeepSeek-R1当老师,从MS MARCO和已有重排数据的3.1万查询出发,生成多视角轨迹和合成金标,格式坏了再用GPT修补。双重过滤:合成排序的NDCG@10必须超过任一单视角,且相关文档必须排在最前。滤完剩21,032条,1万条做SFT、1.1万条做RL。
直接上长链容易塌成「跳过多视角、直接给排序」。PRPO用课程式目标扛这件事。先SFT把格式学住,再分两段GRPO:第一段奖励多级标签(<multithink>、<synthesisthink>、<answer>),以及相对初检的NDCG/MRR提升、和金标的RBO重合;第二段再叠绝对MRR和NDCG。相对改进先稳住,绝对指标再往上推。
BRIGHT上重排ReasonIR召回的top-100,指标是NDCG@10:
| 方法 | 平均 |
| ERANK-4B | 30.5 |
| Rank-K-32B | 32.6 |
| ReasonRank-7B | 35.7 |
| MERIT-Rank-4B | 36.6 |
| MERIT-Rank-7B | 37.1 |
| MERIT-Rank-32B | 40.3 |
4B比同尺寸ERANK高6.1分,也略超ReasonRank-7B。传统TREC上,MERIT-Rank-7B的DL19/DL20为74.1/75.3,ReasonRank-7B是69.8/71.8;BEIR七数据集平均60.0对55.4。
7B在BRIGHT上的消融:去掉合成推理掉到35.29(-1.84),三条全去掉掉到32.18(-4.95),去掉P-GRPO掉到34.78。无约束的四条「通用」轨迹只有29.0,显式三视角加合成到34.1。滑窗设置下,3个窗口就能打到35.81,ReasonRank用9个窗口才35.74,总生成token更少。
对要上推理重排、又不想默认上32B的人,这是一条把视角写进格式、再用课程RL训稳的路线。4B能压过多数更大的竞品,说明增益主要来自结构化多视角,不完全来自参数量。单模型内部融合也避开了多模型ensemble的部署成本。候选集很长、滑窗次数会爆炸时,少窗口是实际收益。
这仍是渐进改进:老师还是DeepSeek-R1,数据还是MS MARCO系,评测协议跟ReasonRank/REARANK同一套滑窗。
论文没有独立的局限节。能看到的缺口包括:合成数据依赖强老师,复现成本不低;单步生成更长,只是靠更少滑窗把总延迟压下来;4B在定理子集TheoT上只有33.0,低于Rank-K-32B的41.0和ReasonRank-7B的41.8,多视角对形式化内容不一定加分。BRIGHT初检用了GPT-4扩展查询,跟先前工作对齐,但会抬高重排器的绝对分。训练查询声称排除了评测集,交叉污染风险仍取决于那批「已有重排数据」的来源是否干净。