CAROT 词级对齐语言无关表示,多语言精度最高涨 11.2 点

Cross-Lingual Representation Alignment by Token-Level Optimal Transport in a Language-Agnostic Space

Taisei Yamamoto, Ryoma Kumon, Danushka Bollegala, Hitomi Yanaka

EMNLP 2026 main

cs.CL

2026-09-06

CAROT 用 LEACE 拆出语言无关表示,再以不平衡最优传输做词级对齐。推理干预最高涨 11.2 点;训练内化后 18 组设置赢 11 组。

这篇在解决什么

多语言模型处理非英语输入时,中间层表示越接近英语,任务就越好做。这条经验催生了一类跨语言对齐(cross-lingual alignment, CLA):把各语言的隐状态往主导语言上拉。

现有做法有两处硬伤。训练侧多数把平行句的整句表示一锅拉近,语言身份一起被抹掉,模型容易用英语回答日语问题。干预侧常用一个全局偏移向量,不管两种语言词序差多远,也不管日语里的「は」「が」在英语里根本没有对应物。

对齐该动哪一部分、该动到多细,这两件事一直没分开做。

方法

CAROT 分两步。先用 LEACE(一种闭式线性概念擦除)把每个 token 的隐状态拆成语言无关成分 A 和语言特定成分 S。LEACE 在句级加权平均上按语言标签训练,再作用到每个 token。擦掉的部分按语言成团,同语言内部余弦相似度接近 1;剩下的部分跨语言比同语言更像,语义主导。

然后只在 A 上做词级对齐。代价是马氏距离(Mahalanobis),用来对付 LLM 隐状态常见的各向异性。序列长度不同、并非每个 token 都有对应物,所以用不平衡最优传输,Sinkhorn 求解,熵正则 εOT=0.05。传输计划再按行/列困惑度过滤,散的匹配直接清零。目标语言每个 token 按收到的质量做软插值,最后把原来的 S 加回去。

源语言固定为英语。得到的新隐状态有两种用法。

结果

三套模型:Llama3.1-8B、gemma3-4b、Qwen3-4B。对照是不干预、Lang Vec(均值差偏移)、MLRS(先压后加语言成分)。任务覆盖 GMMLU、KLAR、BELEBELE、XQuAD。

模型任务不干预CAROT
Llama3.1-8BGMMLU48.449.8
Llama3.1-8BKLAR68.473.3
Llama3.1-8BBELEBELE74.781.9
Llama3.1-8BXQuAD35.041.2
gemma3-4bKLAR67.575.8
Qwen3-4BGMMLU56.859.6
Qwen3-4BKLAR56.868.0

最大涨幅是 Qwen3-4B 在 KLAR 上的 11.2 点。语言保真度大体不掉;Lang Vec 在不少层会把输出语言拧向英语。Qwen3-4B 的 BELEBELE 是例外:CAROT 62.5,不干预 62.3,MLRS 到了 64.9。

消融里,去掉传输过滤,Qwen3-4B/KLAR 从 68.0 掉到 54.0,比不干预还差。只换最后一个 token 的语言无关成分,多数设置弱于全序列 OT。去掉 LEACE 并不处处更差:Llama 的 GMMLU 上 No LEACE 是 55.7,高于完整 CAROT 的 49.8。论文写「多数情况变差」,Llama 这一格是反例。

训练侧,CAROT 在 18 组(3 模型 × 3 任务 × ID/OOD)里拿下 11 组最高均值。Llama 的 BELEBELE OOD:SFT 46.3、MidAlign 42.3、CAROT 51.5。涨幅整体小于干预。训练后重拟合 LEACE,前 50 个特征向量的主夹角平均 40.3°(最大 75.1°),协方差矩阵 32.8°(最大 87.1°),表示已经漂了,冻结的擦除器越来越不准。

干预的预填充大约翻倍:Llama 上西班牙语样本,原模型 28.1 ms,CAROT 要再跑一遍英语前向加 OT,合计约 53.9 ms。只在预填充做一次,生成阶段摊薄。

为什么重要

如果要验证「对齐目标该长什么样」,这篇把两件事拆开了:只动语义、保留语言身份,并且对齐粒度下到 token。干预数字说明这样的目标有效;训练数字说明能内化,但还没追上当场替换。

从业者能直接抄的是训练版:平行语料训练时要,推理时不要。干预版必须有英语对照,更适合离线造蒸馏数据。这是渐进改进,还不够拿来换掉现有 SFT 流程,尤其推理任务上训练增益更薄。

局限与存疑

作者自己列了几条:实验停在 4–8B;LEACE 只擦线性特征,非线性语言信息可能还在;训练是 SFT,没接 GRPO 这类 RL;LEACE 和协方差训练中冻结;没测文化特定问题。

另外几处论文没强调。干预需要英语译文,低资源场景这个假设本身就重。超参按 GMMLU dev 搜,再报到四个任务上,有过拟合网格的风险。Qwen 的阅读理解干预几乎没动,训练侧 gemma 在 GMMLU 和 BELEBELE 上还不如 MidAlign。文化能力没测,保留 S 是否真能挡住「对齐伤文化」,目前没有证据。

术语

原文与代码

社区讨论

相关论文

全部论文解读