美团团队让检索模型的隐式推理真正对齐排名收益,而不只是学个样子

Retrieval Grounding Latent Reasoning for Dense Retrieval

Gang Zhou, Xiongxi Yu, Hu Tian, Yang Wei, Lu Pan, Ke Zeng, Shibiao Xu, Xiaolong Zheng

cs.AI

2026-08-14

美团团队提出 RGLT,让隐藏态推理链每步对齐显式 CoT 的排名增益,BRIGHT nDCG@10 超此前最强隐式推理方法 14.4%。

这篇在解决什么

需要推理才能判断相关性的检索任务(比如判断一段代码是不是能解决某个数学题的思路)不能只靠语义相似度匹配,查询和目标文档字面上可能毫不相关,只有经过多步推理才能看出它们有关联。此前的做法是让模型先生成一段显式的 Chain-of-Thought,再把扩写后的文本编码去检索,但这样会引入自回归解码的延迟,而且检索质量对生成的 CoT 措辞很敏感。后来的做法把推理挪到隐藏空间里做(用一串不用解码成文字的「沉默 token」代表推理步骤),省了生成开销,但监督信号基本只盯着最终检索效果,或者只要求隐藏态和显式 CoT 的状态长得像。问题是,状态像不像和这一步推理有没有真正带来检索增益是两回事:模型完全可能学出一条看起来在推理、实际上每一步都没有提升排名效果的「捷径」轨迹。

方法

RGLT 在编码器里固定加一串 K 个「沉默 token」T₁...TK,让它们的隐藏态逐层演化,组成一条非自回归的隐式推理轨迹,最后直接把最后一个 token 的隐藏态当作查询向量,不需要额外的池化层。

先用一个专门的 anchor token 把 query 和检索指令压缩成一个统一的上下文向量 a,再通过门控低秩残差,让这个 anchor 在每一层持续调制沉默 token 的 key/value 表征,确保推理轨迹自始至终跟着检索意图走,不会跑偏到通用语义理解上。

训练目标由三部分组成:

结果

基准指标RGLT此前最强隐式推理方法 LaSER提升幅度
BRIGHT(12 个技术/科学领域,1384 条查询)nDCG@1034.2029.90+14.4%
BRIGHTRecall@1039.9734.27+16.6%
FollowIR(平均任务分)Avg. Score13.7012.50
BrowseComp-PlusRecall@100070.8366.90

RGLT 在 BRIGHT 的 12 个领域里有 9 个超过 LaSER,在 AoPS、心理学、机器人和两个 TheoremQA 子集上领先明显,只在生物学、地球科学、StackOverflow 三个领域略逊于 LaSER 且差距不大,整体是全面小幅领先,不是靠个别领域拉高平均分。

消融实验证明检索效应迁移这个设计是关键:如果把它换成传统的「状态对齐」监督,nDCG@10 从 34.20 掉到 30.64;去掉检索效应迁移这一项,掉到 31.26。只用一个终点隐藏态、不分阶段监督也只能到 30.87,说明「分阶段监督」和「监督排名效果而非状态相似度」两个设计都各自贡献了增量。

推理阶段的表征也确实在逐步变强:四个阶段终点状态的 nDCG@10 依次是 32.25(ST4)→32.48(ST8)→33.56(ST12)→34.20(ST16),从基础查询表征的 26.39 起步一路爬升,说明检索能力是在推理链上累积出来的,不是只在最后一步凭空跳变。

效率上,RGLT 单次查询推理延迟 24.0ms,只比不做任何推理的基础检索器(21.5ms)多 12%;相比之下,显式生成 CoT 再检索的 Rewrite-then-Retrieve 延迟是基础检索器的 186 倍(4000ms),同为隐式推理的 LaSER 因为要一次性暴露全部 K 个沉默位置,延迟也有 1.51 倍。

为什么重要

对做检索增强生成(RAG)或需要多步推理判断相关性的检索场景(法律、代码、数学、复杂问答)的团队,这提供了一个不需要在推理阶段自回归生成文字、单次前向传播就能拿到融合了推理信息的查询向量的方案,延迟几乎不受影响。更重要的是方法论层面的启发:当你想用隐藏空间推理去替代显式 CoT 时,只对齐中间状态的表征相似度是不够的,监督信号需要直接绑定在「这一步推理有没有真正带来可衡量的下游收益」上,这个思路对隐式推理的其他应用场景(不限于检索)也有参考价值。

局限与存疑

实验只在一个骨干模型 Qwen3-8B 上验证,论文没有报告在更小或更大规模模型上是否保持同样的提升幅度。K(沉默 token 数)在 K=16 时效果最好,K=24 时反而下降,论文只给出「过大的 K 会让优化变复杂」这一句解释,没有深入分析为什么会出现这个非单调的拐点,这类超参数敏感性通常意味着方法在别的数据分布上不一定能直接复用同一个 K 值。训练依赖外部 LLM 生成的显式 CoT 作为监督信号来源,这条链路的成本和对 CoT 质量的敏感度没有详细讨论。消融实验的部分变体(比如门控检索-credit 融合变体)是独立训练的架构变体而非严格的单因素消融,论文自己也标注了这一点,结论的因果归因力度打了折扣。

术语

原文与代码

社区讨论

相关论文

全部论文解读