The Geometry of Low-Resource Language Representations
Francois Meyer, Jan Buys
cs.CL
2026-08-24
开普敦大学用9个开源模型和30种语言量出低资源末层表示退化;10种非洲语言CPT上,余弦正则只让4B以上模型比vanilla略涨。
低资源和英语之间的能力差距,行业默认归因是数据不够。开普敦大学的 Meyer 和 Buys 问的是更靠里的一层:模型内部的向量空间,是不是也跟着数据量一起塌了。
几何上的退化有两个常见症状。一个是 token 表示两两太像,余弦相似度偏高,挤在一个窄锥里,方向分不开。另一个是各维度方差不均,IsoScore 偏低,有效维度被掐住。先前这类工作多在 masked LM 和句子相似度上打转,对现在的 decoder LLM、以及「低资源对高资源」这条轴,几乎没人系统量过。
先量、再改。
量的部分覆盖 30 种语言、9 个开源基座。语言按 MADLAD-400 的网页字符数分成五档,从英语、西语(大于 2000 亿字符)到 Wolof、Lingala(小于 1 亿)。模型是 Llama 3.2 1B/3B、Llama 3.1 8B、Qwen 3 1.7B/4B/8B、Gemma 3 1B/4B/12B。每层从 FLORES 平行句里抽 token:1000 对算平均余弦相似度,5000 个点云算 IsoScore。MADLAD 不是这些模型的真实配料表,只是公开网页规模的代理。
改的部分是单语 continued pretraining(CPT),在目标语上按原预训练目标再训一轮。10 种非洲语言,语料用过滤过的 WURA,1 个 epoch,学习率 \(1\times10^{-5}\),序列长度 512,全部打在 base 模型上,不用指令微调版。基线是 vanilla CPT,只最小化语言模型损失。再加两种正则,都只打末层,系数 \(\lambda=1\):
只正则末层,是因为跨语言差异在那里最稳。他们试过打更多层,没有更好;也试过让 I-STAR 反过来鼓励各向异性(\(\lambda<0\)),对 CPT 没有好处。下游用 IrokoBench:AfriXNLI(自然语言推理)、AfriMMLU(多选知识)、AfriMGSM(数学),zero-shot 和 few-shot。
几何侧,假设站住了。数据越少,多数层的余弦相似度越高。末层是唯一一层、两种指标、九个模型都跟数据量同向相关的位置。Amharic 是例外:它用吉兹字母,和其余拉丁文字语言几乎不共享 subword,几何画像从头到尾都像另一个物种。语种覆盖更好的 Gemma,高低资源差距更小,但更深的层里相关性仍在。
正则确实改了它该改的量。相对基座,CosReg 把末层余弦再往下压一截,Qwen3 8B 从 vanilla CPT 的 \(-0.004\) 到 \(-0.691\);I-STAR 把 IsoScore 抬上去,Llama 3.1 8B 约 \(+0.027\)。两个量几乎互不影响,也几乎不渗到别的层。vanilla CPT 自己就会让余弦略降,只是幅度小,Gemma 3 12B 上甚至升了 \(+0.054\)。
下游才是该泼的冷水。3B 及以下,任何 CPT 相对基座都只有零点几个点,正则帮不上。4B 以上,CosReg 相对 vanilla CPT 的平均增益是边缘的:
| 模型 | 基座均分 | vanilla CPT | +CosReg |
| Gemma 3 4B | 24.2 | 25.9(+1.7) | 26.3(+2.1) |
| Llama 3.1 8B | 23.1 | 25.0(+1.9) | 25.1(+2.0) |
| Qwen3 8B | 25.0 | 25.2(+0.2) | 25.3(+0.3) |
| Gemma 3 12B | 33.0 | 36.3(+3.3) | 36.4(+3.4) |
单点亮一点的:Llama 3.1 8B 的 AfriXNLI 5-shot 从 35.3 到 36.1;Gemma 3 4B 的 AfriXNLI 0-shot 从 36.1 到 36.9、AfriMMLU 0-shot 从 31.9 到 32.7。最难的 AfriMGSM 上,CosReg 在较大模型上几乎总比 vanilla 高一点:Qwen3 8B 的 8-shot 从 9.0 到 9.6,Gemma 3 12B 的 0-shot 从 15.6 到 16.5。绝对分数仍然很低。
CosReg 整体优于 I-STAR。拉开 token 方向,比把空间撑圆更管用。
给做低资源 CPT 的人一条便宜的旋钮:不需要平行语料,只在末层加一项余弦惩罚。几何会被推到想要的方向,而且不伤别的层。
但别指望它单独扛起语言适应。4B 以下几乎无效;4B 以上相对 vanilla CPT 多出来的是 0.1 到 0.4 个平均点。这是一篇测量论文顺手验证了干预,不是新的 SOTA 配方。真要跟进,优先复现那条末层退化曲线,正则当成可选的附加项。
作者自己划了三条。分析只盯数据量,Amharic 的文字系统和 Gemma 的架构差异被点出来却没深挖。干预只做了 CPT,从零预训练和指令微调没做成:非洲语言高质量指令数据不够,指令微调本身就抬不动 IrokoBench。下游增益不稳定、绝对值小。
还要加一条他们写得比较轻的:Qwen3 4B 上 vanilla CPT 相对基座是 \(-0.2\),CosReg 是 \(-0.3\)。几何正则「不伤性能」在部分模型上并不成立。IrokoBench 均分把三个任务、多种 shot 糊在一起,AfriMGSM 个位数的涨跌会在相对百分比里被放大。MADLAD 只是公开网页规模的代理,不是这些模型真实的预训练配比。