Pruned CTC 内存降5.1倍,让LLM词表直接做语音识别
X-LANCE · hf · 2026-09-29
X-LANCE 发布 Pruned CTC,解决 CTC 训练在原生 LLM 词表下内存爆炸的问题。
核心观察与方法
- CTC 的每个合法对齐只使用目标 token 和 blank,其并集通常只占全词表的一小部分;将 对齐计算限制在该子集并保留全词表归一化,可数学证明与全词表 CTC 的损失和梯度完全等价
- 激活内存不再随词表大小线性增长,另引入有限束对齐剪枝
LLM-CTC
- 将预训练 LLM 适配为非自回归 ASR,保留因果注意力与原生词表,并扩展到有界历史流式识别,免去 chunk 级语音-文本对齐
实验结果
- Zipformer-M 编码器 + 180K 词表下,全步内存降 5.1 倍,仅 17% 步时开销,精度与标准 CTC 持平
- GigaSpeech 上 0.6B–32B 六个 Qwen3 规模的 LLM-CTC 与 LLM-CE 相对 WER 差距在 7% 内,识别快 7–10 倍
- 微调 Qwen3-ASR 做流式时,与匹配的离线模型 WER 差距在 3% 内
「多模态」频道最新
- Dreamina 时间戳提示词加单图参考的实测玩法展示 — gen_ericai · 2026-09-29
- 用 C++ 自制管线测试时间戳提示词生成「盲女巫」图像 — gen_ericai · 2026-09-29
- Kling 4.0 多参考生成实测:一次合成角色、场景、物件,还能多语言复用 — SarahAnnabels · 2026-09-29
- BananaStudio:跑在 Gemini Canvas 里的全分辨率图像生成工作台 — Z3ROCOOL22 · 2026-09-29
- Suno Studio 演示:录一段人声即可转成电吉他等任意音色 — suno · 2026-09-29
- Qwen 2.1 图像默认工作流被吐槽,改 CFG=3、12 步后细节超 Krea 2 — Dear-Spend-2865 · 2026-09-29