GigaAM 多语种 ASR:600M Conformer 加聚类均衡,中亚三语 WER 压到 10% 上下

GigaAM Multilingual: Foundation Model for Underrepresented Languages

Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

eess.AS, cs.CL

2026-07-11

GigaAM Multilingual 用 2M 小时音频预训练 600M Conformer,靠聚类级数据均衡和领域感知采样,把哈萨克、吉尔吉斯、乌兹别克的 WER 压到约 10-16%,远低于 Whisper Large v3 和 Omnilingual-1B。

这篇在解决什么

多语种语音识别扩到一定规模后,头部语言(英语、俄语)识别已经很好,但长尾语言依然很差,错误率高到没法用于下游。这篇盯的是中亚的哈萨克语、吉尔吉斯语、乌兹别克语,数据极少。难点不只是数据少:头部语言数据太多,直接按原始比例训练,模型几乎被英语俄语主导,长尾语种学不动。简单按语言做等权重均衡又难,因为长尾语种的权重估不准。

方法

预训练一个 600M 参数的 Conformer 编码器,用 HuBERT 风格的掩码单元预测目标,在 2M 小时音频上训练(24 层、隐维 1024、旋转位置编码、25Hz 帧率)。离散标签用 k-means 聚 1000 类。

两个关键的数据策略专门治头部主导。预训练阶段做「聚类级均衡」:不按语言均衡,先用加权共现图把 70 多种语言聚成 5 个簇,再调簇的采样权重。选定的配置把中亚语种所在簇的权重从 0.08 提到 0.25,而把英语簇从 0.60 降到 0.50。按簇调比按单语言调稳,因为簇内共现强、权重好估。

微调阶段做「领域感知采样」,用 CTC 目标、5 种语言共享字符词表,每种语言内部再按领域分层采样,防止合成的子集主导训练。微调数据总共约 5.48 万小时,其中哈萨克、吉尔吉斯大量依赖合成数据(哈萨克 7896 小时、吉尔吉斯 6415 小时)。

结果

在内部测试集上和三个强基线正面对比(WER,越低越好):

语种GigaAMWhisper v3Omnilingual-1B
哈萨克15.865.232.2
吉尔吉斯9.8102.225.0
乌兹别克12.7120.630.2
俄语6.010.114.6

Whisper Large v3 在吉尔吉斯和乌兹别克上的 WER 超过 100%,基本是坏的;GigaAM 把它们压到 10% 上下。英语上 Whisper 略好(20.0 对 21.5),这是用头部算力换长尾的代价。

为了排除「只是微调数据多」的解释,作者做了编码器对齐消融:同样的 CTC 微调下,GigaAM 600M 五语种平均 WER 10.2,Whisper Large v3 是 14.1,Omnilingual-1B 是 16.6。预训练的均衡策略确实有用。迁移到训练时几乎没见过的语种效果也明显:格鲁吉亚语(93 小时)GigaAM 3.8 对 Omnilingual 7.8、Whisper 13.4;巴什基尔语(143 小时)3.6 对 8.2、11.1。

为什么重要

对要做低资源语种 ASR 的人,这篇给了一套可复用的配方:大模型不是问题,问题是怎么在大规模多语种预训练里不让头部语言淹没长尾。聚类级均衡加领域感知采样,把「数据少」从死结变成可控工程问题。模型和编码器都开源(GitHub salute-developers/GigaAM),能直接拿来微调自己的低资源语种。

局限与存疑

代价摆在结果里:为了抬长尾,英语 WER 从 14.4 升到 15.4。直接对 70 多种语言逐个估权重仍然不现实,所以只能按簇调,粒度有限。乌兹别克语是个例外,领域感知采样对它没有明显好处,作者猜测是它的数据集较小、又没有合成增强。另外,所有长尾语种的对照用的是作者内部测试集,不是公开 benchmark,严格可比性要打折。

术语

原文与代码

相关论文

全部论文解读