CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation
Jianzhi Yan, Le Liu, Buzhou Tang, Yang Xiang, Dongning Sun, Zhiming Li
cs.AI
2026-04-21
目标域没有 CoT 标注时,CoDA 用残差 adapter 把源域推理状态蒸馏到目标隐空间。Gemma-3-27B 八组迁移平均 85.0%,比零样本高 7.8 点,LoRA 同期掉到零样本以下。
目标域请不到专家写逐步推理演示时,常规做法是去别的领域捞例子塞进 prompt。同一组人稍早的 DIN-Retrieval 已经说明,捞到结构相近的跨域样本能补一点分,但增益有限:表面语义差太远,模型很难从字面提示里抽出共用的推理骨架。
参数微调更不稳。LoRA 在源域上学完再拿去目标域,经常塌成源域风格,准确率掉到零样本以下。问题不在要不要迁移,而在迁移该发生在文本层、权重层,还是中间表示层。
CoDA 把冻结的 LLM 从第 l 层切开:前段抽出隐状态 h,后段负责生成。源域有问题、逐步推理轨迹和答案;目标域只有问题。一个残差 adapter Aθ 加在 h 上,得到增强状态 z = h + Aθ(h)。
监督信号来自源域。把「问题拼接 CoT」再过一遍前段,得到教师状态 h。adapter 用均方误差把源域增强状态往 h 上贴,等于把逐步推理压进隐空间,省掉再生成一长串中间 token。同时用最大均值差异(MMD,一种核方法上的分布距离)把源域和目标域的增强状态拉到同一个流形上,让没见过 CoT 的目标样本也落到「像带了推理轨迹」的区域。
推理时模型全冻,只把训好的 adapter 接到新样本的隐状态上。默认干预强度 1.5,MMD 权重 1.0。干预层卡在中后段:Qwen-2.5-32B 用第 34 层(共 64 层),Gemma-3-27B 同样第 34 层(共 62 层)。浅层还在编码表面特征,末层已经偏向源域词表,两边都拧不动推理骨架。
相对 CAA、CoT-Vectors 那种加一个固定向量的做法,非线性 adapter 能做点对点校正。t-SNE 上,加向量之后两域经常还是两坨;adapter 训练完才并到一起。
评测覆盖 ProofWriter、LogicalDeduction、FOLIO、GSM8K、CommonSenseQA 之间的八组迁移,骨干从 Qwen-2.5-3B 到 32B、Gemma-3-4B 到 27B。
| 骨干 | 零样本 | ConE | DIN | CoDA |
| Qwen-2.5-14B | 73.7 | 76.3 | 77.5 | 78.1 |
| Qwen-2.5-32B | 76.7 | 79.5 | 79.7 | 80.7 |
| Gemma-3-12B | 73.6 | 78.4 | 80.1 | 81.3 |
| Gemma-3-27B | 77.2 | 82.4 | 83.7 | 85.0 |
Gemma-3-27B 上 CoDA 比零样本高 7.8 点。单方向 ProofWriter→LogicalDeduction 从 77.7 拉到 91.6。LoRA 在 Qwen-2.5-14B 上只有 64.1,比零样本低 9.6 点,源域过拟合坐实了。可训练 CoT-Vectors 在 Gemma-3-27B 上掉到 27.7%,加向量这条路跨域时很脆。
隐空间对齐:对齐前 Silhouette 0.5998、k-NN mixing 0.12%、MMD 0.0492;CoDA 之后分别是 0.0321、12.92%、0.0354。CAA 能把 mixing 提到 9.08%,但 Silhouette 还剩 0.1117,宏观上两坨没并完。
参数账:12B 规模上 CoDA 用 7.4M 可训练参数,效率图里 OOD 准确率 80.3%;同规模 LoRA 用 32.7M 只到 64.0%。27B 上是 14.5M / 82.9% 对 LoRA 的 56.8M / 76.0%。消融掉均方误差,Qwen-2.5-32B 从 80.7 掉到 74.8;去掉 MMD 掉到 77.1。Gemma-3-27B 在第 34 层干预时,ProofWriter→LogicalDeduction 到 90.0%,浅层或末层都会掉。
检索型跨域 ICL 把例子塞进上下文,CoDA 选择拧中间表示。目标域只要有无标注问题就能训 adapter,不需要目标域逐步解答。对没有专家标注的垂直域,这比在源域上 LoRA 再硬迁更不容易把模型训歪。
增益相对最强检索基线大约两到三点,相对 DIN 大约一点。真正拉开差距的是 LoRA 对照,以及隐空间确实并上了。把它当成检索方案的补丁可以,当成推理能力的跳跃不行。
论文没有单独的 Limitations 节。能看到的硬约束:MMD 需要一批目标域无标注样本,不是对单个新问题即插即用;干预层要按架构搜,3B 到 32B 从第 15 层换到第 34 层;评测几乎全是数学和形式逻辑,CommonSenseQA 也只当源域往 LogicalDeduction 迁。adapter 到底拧了哪些逻辑特征,作者自己也说要留到 Sparse AutoEncoder 和注意力归因再解。引言写「最高提升 12.3%」,主表里 Gemma-3-27B 的 ProofWriter→LogicalDeduction 相对零样本是 +13.9 点,口径没有对齐。