极性一致的神经元当检索键,DIN-ICL 跨域平均比 SOTA 高 1.8 点

Towards Effective In-context Cross-domain Knowledge Transfer via Domain-invariant-neurons-based Retrieval

Jianzhi Yan, Zhiming Li, Le Liu, Zike Yuan, Shiwei Chen, Youcheng Pan, Buzhou Tang, Yang Xiang, Danny Dongning Sun

ACL 2026 Findings

cs.AI

2026-04-07

用源域和目标域激活极性都过阈值的神经元拼 DIN 向量,再按这个子空间检索跨域演示。九个 7B–32B 模型上平均比最强基线高约 1.8 点,GSM8K→FOLIO 上 LLaMA-3.1-8B 相对零样本 +7.0。

这篇在解决什么

零样本 LLM 做数学和形式逻辑时,会漏掉中间蕴含、合不拢分叉、忽略阻断条件。跨域演示如果拓扑同构,可以把这些骨架补回去。问题是人工对着拓扑挑例子不现实,语义检索又容易被表面用词带走。

同一组人的实证研究已经看到条件性正迁移:模型够大、例子骨架对上,跨域 ICL 才加分。这篇要给「怎么自动捞到骨架相近的源域例子」一个可算的答案,投稿 ACL 2026 Findings。

方法

域不变神经元(DIN)按层定义。每个输入在一层上对 token 隐状态取平均,得到该样本的神经元激活向量。源域、目标域各自算每个神经元的 z 分数(相对两域合在一起的均值和方差)。同时大于阈值 τ、或同时小于 −τ 的维度,极性跨域一致,收进候选集。候选太多就按 |zS| + |zT| 取 top-K,K 由隐藏维度乘一个比例。

每条样本的 DIN 向量,是各层在这些不变维度上的激活拼起来。目标查询和源域库做余弦相似度,再用 Maximal Marginal Relevance 压重复,取 k=2 条源域演示拼进 prompt。模型仍然冻结,只换检索键。

为什么信这些神经元:在 LLaMA-3.1-8B 最后六层上,剪掉 DIN 相对剪掉同等数量的随机维度,困惑度升得更狠。源域相对升幅 5.2%–8.1%。第 −6 层剪 DIN 升 7.99%,随机剪只升 0.07%(p=0.0332)。

结果

四个方向:FOLIO↔GSM8K、GSM8K↔PrOntoQA,模型从 Qwen-2.5-7B 到 Gemma-3-27B、LLaMA-3.1-8B。对照是零样本、X-ICL(用模型自己写的自然语言解释当演示)、Set-BSR(按双向相似度覆盖 query 语义)。

模型方向零样本DIN-ICL
Qwen-2.5-14BGSM8K→FOLIO67.470.4(+3.0)
Qwen-3-8BGSM8K→FOLIO81.785.8(+4.1)
Gemma-3-12BGSM8K→FOLIO61.065.5(+4.5)
LLaMA-3.1-8BGSM8K→FOLIO56.363.3(+7.0)

相对零样本,多数 Qwen / Gemma 平均 +0.5 到 +2.0 点。大模型基线已经很高,Qwen-3-32B 平均只再 +0.7。X-ICL 并不稳:LLaMA-3.1-8B 在 GSM8K→PrOntoQA 上掉 7.8 点,DIN 基本贴着零样本。相对 Set-BSR,DIN 平均高 0.8–1.5 点,高偏移方向可到约 3 点;LLaMA-3.1-8B 平均 +4.1。摘要里「平均比 SOTA 高 1.8」对的是这条检索对照。

案例上,DIN 捞回的 GSM8K 题分别对应线性链、二分叉和阻断条件,FOLIO 零样本缺哪一环,演示就补哪一环。用 DIN 选中的神经元做 ICL,也显著好过随机抽同样数量的神经元(GSM8K→FOLIO 上 Qwen-2.5-7B 为 62.8 对 59.5)。

为什么重要

检索键从「句子像不像」换成「哪些神经元跨域极性不变」。工程上可复现:过一遍源域和目标域无标注激活,就能切出子空间,不改权重。对 7B–14B、零样本逻辑题不稳的模型,GSM8K→FOLIO 这种高偏移方向是主要赚头。32B 以上基线已经强,再抠 1 点要看值不值那次激活统计。

它是前一篇实证的检索答卷,也是后一篇 CoDA 的对照:DIN 仍在 prompt 里塞跨域例子,CoDA 认为文本层增益见顶,改去拧隐状态。两条线解决同一件事,手段差一层。

局限与存疑

作者写得很直。DIN 识别是固定阈值的极性规则,更复杂的不变性抓不到。实验停在 GSM8K、PrOntoQA、FOLIO,没有常识或代码。神经元的因果地位仍是初步的:剪掉会痛,不等于它们编码了可迁移的拓扑。增益整体偏小,k 固定为 2,没有扫 shot 数。

一个方法细节:识别 DIN 要用目标域样本的激活统计,严格说不是「目标域零样本」。新域来了要先过一批无标注题才能切子空间。和 CoDA 的 MMD 一样,都默认手里有目标域题池。

术语

原文与代码

社区讨论

相关论文

全部论文解读