GigaAM Multilingual 用 200 万小时音频攻低资源语音识别
ai-sage · hf · 2026-07-21
- 这篇工作提出 GigaAM Multilingual,面向 哈萨克语、吉尔吉斯语、乌兹别克语等低资源中亚语言的语音识别基础模型。
- 模型采用 Conformer 编码器,并用类似 HuBERT 的目标在 200 万小时音频上预训练。
- 作者重点引入两项训练策略:预训练阶段的 cluster-level 数据平衡,以及微调阶段的 domain-aware sampling,用来缓解高资源语言的主导效应。
- 对比结果显示,它在目标语言上优于 Whisper Large v3、Omnilingual-1B 等强基线,尤其在自然口语场景上提升明显。
- 作者还释放了基础编码器和 ASR 模型,为严重数据不均衡条件下的多语适配提供了可复用方案。
「研究」频道最新
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21
- 论文研究线性二次 graphon 均值场控制的长期行为 — chaumian · 2026-07-21
- 一个 Zarr 交互讲解器展示 AI 正在改变技术教育 — MaxLenormand · 2026-07-21