非自回归扩散 TTS 刷新四榜:CER 0.73、41.6 毫秒首块延迟

Luna-TTS Family Technical Report

Feng Yin, Shuai Shi, Junjie Zheng, Kechenying Zhou, Yiqiu Wang, Chenyang He, Qiuhua Jiang, Mengxiao Bi, Yanmin Qian, Mingxin Chen, Xun Gong, Tianteng Gu, Bing Han, Peng Jiang, Chenda Li, Haiyang Sun, Han Wang, Wei Wang, Yi Wang, Leying Zhang, Wangyou Zhang, Chushu Zhou

cs.SD, eess.AS

2026-08-12

VUI Labs 用 100 万小时语音训练的扩散语言模型 TTS,在 Seed-TTS-Eval 四项指标全部第一,流式版本首块延迟仅 41.6 毫秒。

这篇在解决什么

现在主流的 TTS(文本转语音)系统几乎都是自回归(AR)编解码器语言模型:像生成文字一样一步步从左往右生成语音 token。这个路子继承了 LLM 的训练基础设施和 scaling 经验,效果也确实好,但天生带着几个毛病。生成延迟随语音长度线性增长,一步错步步错的曝光偏差会导致漏词、重复,而且 RVQ(残差矢量量化)把每一帧语音编码成一摞 codebook token,这些 token 之间本来没有先后顺序,AR 模型却硬要给它们排一个从左到右的生成顺序,业界为此发明了各种打补丁的方案(交错编码、分层自回归等)。VUI Labs 的这份报告想验证的是另一条路:能不能用扩散语言模型(diffusion language model)来做 TTS,绕开这些结构性问题。

方法

Luna-TTS Family 由两个共享同一套 tokenizer、数据管线和 0.6B 参数骨干的模型组成,都是从一个预训练好的自回归文本 LLM(Qwen3-0.6B)逐步改造而来:先从因果注意力改成双向注意力,再改成块因果(block-causal)注意力。

Luna-TTS 是完全非自回归的掩码扩散模型:一次性对整段语音的 RVQ token 网格做随机掩码训练,推理时用固定步数的并行迭代去噪生成整段网格,配合一个基于 Qwen3-0.6B 的独立时长预测器决定目标长度。因为生成过程本质是任意顺序的补全(infilling),零样本音色克隆和语音编辑是这个框架原生自带的能力,不需要额外机制。

Luna-TTS Realtime 是在 Luna-TTS 基础上继续训练得到的,用的是块扩散(block-diffusion)目标:跨块之间保持自回归(每 32 帧、1.28 秒一块),块内所有帧和 codebook 并行去噪,支持 KV 缓存的分块流式生成,第一块提交后就能开始增量播放音频。

预训练之后还有一个退火微调阶段,给模型加上情感和非语言发声(比如笑声、叹气)的显式控制;再叠加一个强化学习阶段,用 GRPO 优化,不同于以往在自回归 TTS 上用的策略比,这里的策略比是在实际发生的去噪轨迹上计算的,而不是按从左到右的分解方式。

结果

在 Seed-TTS-Eval 上,Luna-TTS 四项指标全部第一:中文 CER 0.73(领先 MiniMax-Speech 的 0.83)、英文 WER 1.49(领先 Qwen-Audio-3.0-TTS 的 1.54)、中英文说话人相似度分别是 79.7 和 76.8,均为最高。在更难的 in-the-wild 基准 CV3-Eval 上,Luna-TTS 拿到最低的中英文错误率(英文 WER 3.18,中文 3.17),韩语是四种语言里表现最弱的一档(CER 5.93)。流式版 Luna-TTS Realtime 在保持大部分质量的前提下实现了真正的流式:预热本地服务下端到端 RTF 0.0240,提交第一个 1.28 秒音频块只要 41.6 毫秒,相当于 40 倍以上实时速度;它在常规文本上只比离线版 Luna-TTS 多损失约 0.3 个 CER/WER 点和 3 个相似度点,但在语言不规范、参考音频质量差的困难子集上差距明显拉大(中文 hard 子集 CER 从 6.90 涨到 12.56),原因是块自回归一旦某个块判断错误就无法像离线版那样在后续的全局去噪里修正。表达力控制(情感、非语言发声)的评测里,Luna-TTS 对比 MiniMax Speech 2.8 HD、ElevenLabs Eleven v3、Fish Audio S2.1 Pro 三个商业系统,在大多数客观、模型评估和人工评分指标上都拿到最好成绩。

为什么重要

这是目前已知规模最大的扩散语言模型 TTS 预训练(100 万小时语音),也是第一个把这套架构做到中英日韩四语言、并在权威榜单上追平甚至超过主流商业 AR 系统的工作。更实际的是,Luna-TTS 和 Luna-TTS Realtime 出自同一套 tokenizer、数据管线和骨干网络,选哪个纯粹是部署场景的取舍:要吞吐量选完全并行版,要低延迟流式交互选块自回归版,不需要换一套系统。这给了一个信号:扩散语言模型不再只是 AR TTS 的一个实验性替代品,在生产规模的数据和评测下已经能打平甚至反超。

局限与存疑

论文自己承认:四种语言里韩语表现最弱,可能和训练数据里韩语占比只有 6.9% 有关;语言覆盖只有四种,比一些大规模多语言 TTS 系统窄得多。Luna-TTS 依赖一个独立的外部时长预测器决定生成长度,而 Luna-TTS Realtime 用固定 1.28 秒的块大小,这个块大小是为流式效率选的,并不会根据内容动态调整,也是它在困难子集上掉分更多的原因之一。另外,流式版本的质量差距集中体现在“文本不规则+参考音频质量差”的场景,常规场景下差距很小,评估这个权衡时要看具体应用场景对尾部质量的容忍度。

术语

原文与代码

社区讨论

相关论文

全部论文解读