Towards Effective In-context Cross-domain Knowledge Transfer via Domain-invariant-neurons-based Retrieval
Jianzhi Yan, Zhiming Li, Le Liu, Zike Yuan, Shiwei Chen, Youcheng Pan, Buzhou Tang, Yang Xiang, Danny Dongning Sun
ACL 2026 Findings
cs.AI
2026-04-07
用源域和目标域激活极性都过阈值的神经元拼 DIN 向量,再按这个子空间检索跨域演示。九个 7B–32B 模型上平均比最强基线高约 1.8 点,GSM8K→FOLIO 上 LLaMA-3.1-8B 相对零样本 +7.0。
零样本 LLM 做数学和形式逻辑时,会漏掉中间蕴含、合不拢分叉、忽略阻断条件。跨域演示如果拓扑同构,可以把这些骨架补回去。问题是人工对着拓扑挑例子不现实,语义检索又容易被表面用词带走。
同一组人的实证研究已经看到条件性正迁移:模型够大、例子骨架对上,跨域 ICL 才加分。这篇要给「怎么自动捞到骨架相近的源域例子」一个可算的答案,投稿 ACL 2026 Findings。
域不变神经元(DIN)按层定义。每个输入在一层上对 token 隐状态取平均,得到该样本的神经元激活向量。源域、目标域各自算每个神经元的 z 分数(相对两域合在一起的均值和方差)。同时大于阈值 τ、或同时小于 −τ 的维度,极性跨域一致,收进候选集。候选太多就按 |zS| + |zT| 取 top-K,K 由隐藏维度乘一个比例。
每条样本的 DIN 向量,是各层在这些不变维度上的激活拼起来。目标查询和源域库做余弦相似度,再用 Maximal Marginal Relevance 压重复,取 k=2 条源域演示拼进 prompt。模型仍然冻结,只换检索键。
为什么信这些神经元:在 LLaMA-3.1-8B 最后六层上,剪掉 DIN 相对剪掉同等数量的随机维度,困惑度升得更狠。源域相对升幅 5.2%–8.1%。第 −6 层剪 DIN 升 7.99%,随机剪只升 0.07%(p=0.0332)。
四个方向:FOLIO↔GSM8K、GSM8K↔PrOntoQA,模型从 Qwen-2.5-7B 到 Gemma-3-27B、LLaMA-3.1-8B。对照是零样本、X-ICL(用模型自己写的自然语言解释当演示)、Set-BSR(按双向相似度覆盖 query 语义)。
| 模型 | 方向 | 零样本 | DIN-ICL |
| Qwen-2.5-14B | GSM8K→FOLIO | 67.4 | 70.4(+3.0) |
| Qwen-3-8B | GSM8K→FOLIO | 81.7 | 85.8(+4.1) |
| Gemma-3-12B | GSM8K→FOLIO | 61.0 | 65.5(+4.5) |
| LLaMA-3.1-8B | GSM8K→FOLIO | 56.3 | 63.3(+7.0) |
相对零样本,多数 Qwen / Gemma 平均 +0.5 到 +2.0 点。大模型基线已经很高,Qwen-3-32B 平均只再 +0.7。X-ICL 并不稳:LLaMA-3.1-8B 在 GSM8K→PrOntoQA 上掉 7.8 点,DIN 基本贴着零样本。相对 Set-BSR,DIN 平均高 0.8–1.5 点,高偏移方向可到约 3 点;LLaMA-3.1-8B 平均 +4.1。摘要里「平均比 SOTA 高 1.8」对的是这条检索对照。
案例上,DIN 捞回的 GSM8K 题分别对应线性链、二分叉和阻断条件,FOLIO 零样本缺哪一环,演示就补哪一环。用 DIN 选中的神经元做 ICL,也显著好过随机抽同样数量的神经元(GSM8K→FOLIO 上 Qwen-2.5-7B 为 62.8 对 59.5)。
检索键从「句子像不像」换成「哪些神经元跨域极性不变」。工程上可复现:过一遍源域和目标域无标注激活,就能切出子空间,不改权重。对 7B–14B、零样本逻辑题不稳的模型,GSM8K→FOLIO 这种高偏移方向是主要赚头。32B 以上基线已经强,再抠 1 点要看值不值那次激活统计。
它是前一篇实证的检索答卷,也是后一篇 CoDA 的对照:DIN 仍在 prompt 里塞跨域例子,CoDA 认为文本层增益见顶,改去拧隐状态。两条线解决同一件事,手段差一层。
作者写得很直。DIN 识别是固定阈值的极性规则,更复杂的不变性抓不到。实验停在 GSM8K、PrOntoQA、FOLIO,没有常识或代码。神经元的因果地位仍是初步的:剪掉会痛,不等于它们编码了可迁移的拓扑。增益整体偏小,k 固定为 2,没有扫 shot 数。
一个方法细节:识别 DIN 要用目标域样本的激活统计,严格说不是「目标域零样本」。新域来了要先过一批无标注题才能切子空间。和 CoDA 的 MMD 一样,都默认手里有目标域题池。