阿里CoFree挡住推理坍塌,4B嵌入在22集上平均再涨2.8 nDCG

Reasoning Quality Matters: Combating Reasoning Collapse in LLM-based Embedding Learning

Zihan Gong, Xiaohan Ye, Jiangchao Yao, Jinsong Lan, Xiaoyong Zhu, Xu Chen

cs.IR

2026-09-17

把LLM训成嵌入时,推理会空转或跑题。阿里CoFree用参考锚定SFT加双奖励RL压住这两类坍塌,4B在MTEB与BRIGHT共22个数据集上比Qwen3-Embedding-4B平均高2.8 nDCG@10。

这篇在解决什么

用LLM做稠密嵌入,常见两条路:把生成模型当编码器直接压向量,或先让它写一段「推理文本」再拼到原文上取embedding。后一条听起来合理,但专攻嵌入目标时会出现两类退化。生成坍塌:输出空白、死循环复读、语无伦次。语义坍塌:句子还通顺,内容却跟检索无关,比如把coral reefs和Coral Reef Casino搅在一起。论文把这两类统称reasoning collapse。塌掉的推理会污染向量,有时还不如不推理。

阿里(淘宝检索团队)要回答的是:怎么把推理能力找回来,同时不把已经训好的嵌入几何冲掉;找回来之后,怎么让这段话真的帮正负例分开。

方法

CoFree接在现成的LLM嵌入模型上,分两阶段。4B从Qwen3-Embedding-4B初始化,1.5B从gte-Qwen2-1.5B-instruct初始化。

第一阶段叫推理恢复学习。模型先写推理再在<eos>处取向量。损失三块一起走:因果语言建模把推理写出来;InfoNCE对比损失(正例、难负例、batch内query当负例)保住检索几何;参考引导损失把「原文加推理」的向量拉向冻结backbone在原文上的向量,防止灾难遗忘。三者加权合成SFT目标。

第二阶段用GRPO做推理增强RL,双奖励。嵌入奖励看query推理后,正例与负例的余弦间隔。推理奖励用独立的Qwen3-Reranker-4B当相关性模型,对「query加推理 / 文档加推理」打分,同样取正负间隔。用间隔而不是绝对分,是为了挡住「一段正确但空洞的套话把正负例一起抬高」这种reward hacking。GRPO的KL管生成漂移,另外再加一项embedding空间的MSE,把策略向量钉在SFT后的参考模型上。

数据侧从约700万原始query-doc做成RTED:用Qwen3-235B-A22B写query侧和文档侧推理,再过滤,留下约360万条。SFT学这些教师文本,RL按原tuple重新采样推理。

结果

22个数据集(MTEB英文检索10个加BRIGHT 12个)上,overall nDCG@10:

模型OverallMTEBBRIGHT
Qwen3-Embedding-4B38.064.116.3
Contrastive FT-4B32.650.917.3
CoFree-4B40.866.419.4
stella 1.5B31.452.214.0
CoFree-1.5B34.658.514.7

同数据只做对比学习,4B只有32.6;CoFree的SFT单独已经到39.9,RL再加0.9到40.8。去掉参考引导损失,SFT从39.9掉到37.1。SFT前生成退化率按三个LLM评委接近100%,SFT后降到4%以下,seq-rep-4从99.37%降到3.32%。1.5B上,三个独立reranker的 pairwise 正确率从SFT后的51.30%升到完整RL的64.00%,拿掉推理奖励则停在50.90%。

电商搜索线上A/B里,CoFree作为额外召回通道:CTR绝对+0.02、CVR绝对+0.12,订单相对+13.56%,GMV相对+8.15%,2026年1月起全量。1.5B端到端吞吐是Search-R3-Small的4.4到5.4倍,MTEB上平均只生成39.4个token。

为什么重要

「先想再编码」已经有TTE、Search-R3、UME-R1在做。这篇把失败模式写清楚了:会生成不等于对检索有用,有时还更差。参考锚定加双奖励是一套能直接接到Qwen3-Embedding上的补丁,SFT贡献了大部分分,RL主要修推理质量。对已经部署Qwen3-Embedding、愿意付一段短生成的检索系统,这是可跟进的增量。RTED计划公开,复现门槛会低一些。

BRIGHT代码子集是例外:CoFree-4B从11.5掉到9.9,代码推理覆盖不够。

局限与存疑

作者自己写了训练开销:两阶段、教师生成、reward model打分,4B的SFT约24小时、RL约48小时,32张GPU。代码检索退步没有做完因果分析,只看到CodeSearchNet和CoSQA合计约占保留数据的5.5%。线上A/B的CTR/CVR是绝对值0.02/0.12,基线分母没给,行业解读时要把相对订单和GMV一并看。推理质量评委和训练用的reranker声明不是同一套,但仍是模型评模型。冻结编码器上的迁移实验说明推理文本本身有用,没有证明任意新backbone微调后都能保住同样增益。

术语

原文与代码

社区讨论

相关论文

全部论文解读