GigaAM Multilingual: Foundation Model for Underrepresented Languages
Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin
eess.AS, cs.CL
2026-07-11
GigaAM Multilingual 用 2M 小时音频预训练 600M Conformer,靠聚类级数据均衡和领域感知采样,把哈萨克、吉尔吉斯、乌兹别克的 WER 压到约 10-16%,远低于 Whisper Large v3 和 Omnilingual-1B。
多语种语音识别扩到一定规模后,头部语言(英语、俄语)识别已经很好,但长尾语言依然很差,错误率高到没法用于下游。这篇盯的是中亚的哈萨克语、吉尔吉斯语、乌兹别克语,数据极少。难点不只是数据少:头部语言数据太多,直接按原始比例训练,模型几乎被英语俄语主导,长尾语种学不动。简单按语言做等权重均衡又难,因为长尾语种的权重估不准。
预训练一个 600M 参数的 Conformer 编码器,用 HuBERT 风格的掩码单元预测目标,在 2M 小时音频上训练(24 层、隐维 1024、旋转位置编码、25Hz 帧率)。离散标签用 k-means 聚 1000 类。
两个关键的数据策略专门治头部主导。预训练阶段做「聚类级均衡」:不按语言均衡,先用加权共现图把 70 多种语言聚成 5 个簇,再调簇的采样权重。选定的配置把中亚语种所在簇的权重从 0.08 提到 0.25,而把英语簇从 0.60 降到 0.50。按簇调比按单语言调稳,因为簇内共现强、权重好估。
微调阶段做「领域感知采样」,用 CTC 目标、5 种语言共享字符词表,每种语言内部再按领域分层采样,防止合成的子集主导训练。微调数据总共约 5.48 万小时,其中哈萨克、吉尔吉斯大量依赖合成数据(哈萨克 7896 小时、吉尔吉斯 6415 小时)。
在内部测试集上和三个强基线正面对比(WER,越低越好):
| 语种 | GigaAM | Whisper v3 | Omnilingual-1B |
| 哈萨克 | 15.8 | 65.2 | 32.2 |
| 吉尔吉斯 | 9.8 | 102.2 | 25.0 |
| 乌兹别克 | 12.7 | 120.6 | 30.2 |
| 俄语 | 6.0 | 10.1 | 14.6 |
Whisper Large v3 在吉尔吉斯和乌兹别克上的 WER 超过 100%,基本是坏的;GigaAM 把它们压到 10% 上下。英语上 Whisper 略好(20.0 对 21.5),这是用头部算力换长尾的代价。
为了排除「只是微调数据多」的解释,作者做了编码器对齐消融:同样的 CTC 微调下,GigaAM 600M 五语种平均 WER 10.2,Whisper Large v3 是 14.1,Omnilingual-1B 是 16.6。预训练的均衡策略确实有用。迁移到训练时几乎没见过的语种效果也明显:格鲁吉亚语(93 小时)GigaAM 3.8 对 Omnilingual 7.8、Whisper 13.4;巴什基尔语(143 小时)3.6 对 8.2、11.1。
对要做低资源语种 ASR 的人,这篇给了一套可复用的配方:大模型不是问题,问题是怎么在大规模多语种预训练里不让头部语言淹没长尾。聚类级均衡加领域感知采样,把「数据少」从死结变成可控工程问题。模型和编码器都开源(GitHub salute-developers/GigaAM),能直接拿来微调自己的低资源语种。
代价摆在结果里:为了抬长尾,英语 WER 从 14.4 升到 15.4。直接对 70 多种语言逐个估权重仍然不现实,所以只能按簇调,粒度有限。乌兹别克语是个例外,领域感知采样对它没有明显好处,作者猜测是它的数据集较小、又没有合成增强。另外,所有长尾语种的对照用的是作者内部测试集,不是公开 benchmark,严格可比性要打折。