跨域 ICL 有吸收门槛:27B 才吃进演示,4B 经常负迁移

Reason Analogically via Cross-domain Prior Knowledge: An Empirical Study of Cross-domain Knowledge Transfer for In-Context Learning

Le Liu, Zhiming Li, Jianzhi Yan, Zike Yuan, Shiwei Chen, Youcheng Pan, Buzhou Tang, Qingcai Chen, Yang Xiang, Danny Dongning Sun

cs.AI

2026-04-07

在 25 组源-目标迁移上测 BM25、embedding 和 ConE,发现只有够大的模型能吸收跨域演示。Gemma-3-27B 上 ProofWriter→逻辑演绎最高 +12.3 点,4B 和 12B 经常加 shot 反而掉点。

这篇在解决什么

ICL 默认假设手里有同域、专家写过的演示。低资源学科、新出现的生物医学子领域、小众法域,这种演示经常不存在。一个直觉是:不同任务尽管用词不同,解题骨架可能一样,能不能拿源域例子帮目标域推理?

既往 ICL 工作几乎都在同域里挑例子,最多讨论轻度分布偏移。这篇把设定拧到硬跨域:源域演示和目标域问题来自不同基准,模型冻结,只改检索和 shot 数。哈工大深圳和鹏城实验室后面两篇 DIN-Retrieval、CoDA,都把这篇当可行性前提来引。

方法

流程很直。源域题库用同一种度量函数编进检索库;目标查询用同一度量取 top-k 源域样本,拼进 prompt,冻结 LLM 做逐步推理。度量试了三种:BM25 词面匹配、bge-large-en-v1.5 稠密向量、TopK+ConE(用条件熵再排一次,挑对模型更「有信息」的例子)。

骨干覆盖 Qwen-2.5(3B–32B)、Qwen-3(4B–32B)、Gemma-3(4B/12B/27B)和 Llama-3.1-8B。六个基准:GSM8K、ProntoQA、LogicalDeduction、FOLIO、ProofWriter、AR-LSAT,凑出 25 组源-目标方向。指标是 Exact Match,以及相对零样本的升降。四个问题按顺序问:跨域 ICL 总体有没有正迁移、模型规模怎么改变这件事、加 shot 是不是单调变好、分是从哪来的。

最后一问用 DeepSeek-V3 给修对的样本打结构标签,分成 L 型链、Y 型分叉、带阻断条件的链,以及其他。看的是检索回来的演示,骨架是否和目标查询同类。

结果

规模一上来,故事就分叉。Gemma-3-27B 只有五组源-目标对出现负迁移;4B 和 12B 失败组明显更多。Embedding 检索在 Gemma-3-27B 上,ProofWriter→LogicalDeduction +12.3 点,ProntoQA→LogicalDeduction +10.3 点。同一方向换小模型,BM25 经常大面积掉点:Gemma-3-4B 从 ProntoQA 迁到 LogicalDeduction,BM25 相对零样本 −19.7。

Shot 数和工作规模绑在一起。27B 在正迁移方向上,1 到 4 shot 基本单调向上。4B 和 12B 加例子常常收益递减,碰到 GSM8K、AR-LSAT 这种结构对不上的目标域还会往下走。小模型上 shot 数和成绩的 Spearman 相关接近零,甚至为负:多给的演示没有被「吸收」,变成干扰。

修对零样本错误的比例,高度依赖检索器和查询类型。Embedding 下 L 型查询的修复率 52.6%–65.8%,BM25 掉到 18.4%–26.3%。杂类查询最低可到 5.3%。检索器还偏向少数链型,Y 型和阻断型演示很少被捞到。分不是语义近邻给的,是结构对上的那一小撮例子把断掉的推理链补上了。

为什么重要

给「没同域标注就放弃 ICL」留了一条缝:源域例子可以当推理脚手架,前提是模型过了吸收门槛,检索还得对上骨架。对 7B 以下,跨域乱塞 shot 是在买负迁移。对 27B 以上,embedding 检索在逻辑演绎这类目标上,两位数的增益是真的。

它把后续工作的靶子写清楚了:别再只比语义相似度,去比结构相似度。DIN-Retrieval 用域不变神经元做检索键,CoDA 干脆离开 prompt 去拧隐状态,两条线都从这篇的失败案例长出来。

局限与存疑

作者自己列了四条。任务和检索器都限于这一组推理基准,换到代码、医疗、法律没有证据。「修复」靠 DeepSeek-V3 启发式分类,没有形式化的结构度量。解码策略固定,检索效果和 sampling 怎么纠缠没测。三种检索器各有所长,论文没有把它们合起来优化。

另外,主表是相对零样本的着色热力图,不少格子是空白或「—」,跨模型直接比绝对值要小心。AR-LSAT 全程偏低,法律分析推理并没有被跨域演示救起来。

术语

原文与代码

社区讨论

相关论文

全部论文解读