Cross-Lingual Representation Alignment by Token-Level Optimal Transport in a Language-Agnostic Space
Taisei Yamamoto, Ryoma Kumon, Danushka Bollegala, Hitomi Yanaka
EMNLP 2026 main
cs.CL
2026-09-06
CAROT 用 LEACE 拆出语言无关表示,再以不平衡最优传输做词级对齐。推理干预最高涨 11.2 点;训练内化后 18 组设置赢 11 组。
多语言模型处理非英语输入时,中间层表示越接近英语,任务就越好做。这条经验催生了一类跨语言对齐(cross-lingual alignment, CLA):把各语言的隐状态往主导语言上拉。
现有做法有两处硬伤。训练侧多数把平行句的整句表示一锅拉近,语言身份一起被抹掉,模型容易用英语回答日语问题。干预侧常用一个全局偏移向量,不管两种语言词序差多远,也不管日语里的「は」「が」在英语里根本没有对应物。
对齐该动哪一部分、该动到多细,这两件事一直没分开做。
CAROT 分两步。先用 LEACE(一种闭式线性概念擦除)把每个 token 的隐状态拆成语言无关成分 A 和语言特定成分 S。LEACE 在句级加权平均上按语言标签训练,再作用到每个 token。擦掉的部分按语言成团,同语言内部余弦相似度接近 1;剩下的部分跨语言比同语言更像,语义主导。
然后只在 A 上做词级对齐。代价是马氏距离(Mahalanobis),用来对付 LLM 隐状态常见的各向异性。序列长度不同、并非每个 token 都有对应物,所以用不平衡最优传输,Sinkhorn 求解,熵正则 εOT=0.05。传输计划再按行/列困惑度过滤,散的匹配直接清零。目标语言每个 token 按收到的质量做软插值,最后把原来的 S 加回去。
源语言固定为英语。得到的新隐状态有两种用法。
三套模型:Llama3.1-8B、gemma3-4b、Qwen3-4B。对照是不干预、Lang Vec(均值差偏移)、MLRS(先压后加语言成分)。任务覆盖 GMMLU、KLAR、BELEBELE、XQuAD。
| 模型 | 任务 | 不干预 | CAROT |
| Llama3.1-8B | GMMLU | 48.4 | 49.8 |
| Llama3.1-8B | KLAR | 68.4 | 73.3 |
| Llama3.1-8B | BELEBELE | 74.7 | 81.9 |
| Llama3.1-8B | XQuAD | 35.0 | 41.2 |
| gemma3-4b | KLAR | 67.5 | 75.8 |
| Qwen3-4B | GMMLU | 56.8 | 59.6 |
| Qwen3-4B | KLAR | 56.8 | 68.0 |
最大涨幅是 Qwen3-4B 在 KLAR 上的 11.2 点。语言保真度大体不掉;Lang Vec 在不少层会把输出语言拧向英语。Qwen3-4B 的 BELEBELE 是例外:CAROT 62.5,不干预 62.3,MLRS 到了 64.9。
消融里,去掉传输过滤,Qwen3-4B/KLAR 从 68.0 掉到 54.0,比不干预还差。只换最后一个 token 的语言无关成分,多数设置弱于全序列 OT。去掉 LEACE 并不处处更差:Llama 的 GMMLU 上 No LEACE 是 55.7,高于完整 CAROT 的 49.8。论文写「多数情况变差」,Llama 这一格是反例。
训练侧,CAROT 在 18 组(3 模型 × 3 任务 × ID/OOD)里拿下 11 组最高均值。Llama 的 BELEBELE OOD:SFT 46.3、MidAlign 42.3、CAROT 51.5。涨幅整体小于干预。训练后重拟合 LEACE,前 50 个特征向量的主夹角平均 40.3°(最大 75.1°),协方差矩阵 32.8°(最大 87.1°),表示已经漂了,冻结的擦除器越来越不准。
干预的预填充大约翻倍:Llama 上西班牙语样本,原模型 28.1 ms,CAROT 要再跑一遍英语前向加 OT,合计约 53.9 ms。只在预填充做一次,生成阶段摊薄。
如果要验证「对齐目标该长什么样」,这篇把两件事拆开了:只动语义、保留语言身份,并且对齐粒度下到 token。干预数字说明这样的目标有效;训练数字说明能内化,但还没追上当场替换。
从业者能直接抄的是训练版:平行语料训练时要,推理时不要。干预版必须有英语对照,更适合离线造蒸馏数据。这是渐进改进,还不够拿来换掉现有 SFT 流程,尤其推理任务上训练增益更薄。
作者自己列了几条:实验停在 4–8B;LEACE 只擦线性特征,非线性语言信息可能还在;训练是 SFT,没接 GRPO 这类 RL;LEACE 和协方差训练中冻结;没测文化特定问题。
另外几处论文没强调。干预需要英语译文,低资源场景这个假设本身就重。超参按 GMMLU dev 搜,再报到四个任务上,有过拟合网格的风险。Qwen 的阅读理解干预几乎没动,训练侧 gemma 在 GMMLU 和 BELEBELE 上还不如 MidAlign。文化能力没测,保留 S 是否真能挡住「对齐伤文化」,目前没有证据。