NVIDIA 流式 TTS 每帧 9.6ms 可随时打断,模块化路线拿下 duplex 语音对话

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

Edresson Casanova, Jaehyeon Kim, Mariana Graterol Fuenmayor, Shehzeen Hussain, Viacheslav Klimkov, Valentin Mendelev, Mikyas Desta, Paarth Neekhara, Piotr Zelasko, Chen Chen, Elena Rastorgueva, Ke Hu, Ankita Pasad, Xuesong Yang, Aya Alja'fari, Rajarshi Roy, Rohan Badlani, Jason Roche, Jason Li, Zhehuai Chen

eess.AS, cs.CL

2026-08-14

NVIDIA 开源 977M 流式 TTS,直接吃 LLM token 流持续合成,插话后 89.9ms 停止且不重置 KV cache,单帧延迟比 Qwen3-TTS 快 2.1 倍。

这篇在解决什么

语音对话要自然,卡点不在「说得好」,在「接得上」。主流语音语言模型仍是轮次制的:用户说完、模型想、模型说,中间是一段尴尬的静默;用户想插话(barge-in),系统也得等当前轮跑完。近两年的 duplex 端到端语音模型把 ASR、理解、合成揉进一个网络,延迟确实降了,但三个目标要联合优化,音质往往被牺牲。

NVIDIA 这篇的思路是退回模块化:保留流水线架构,但让 TTS 这一级本身变成持续在线的流式模型,直接吃 LLM 吐出的 token 流,不再等整句文本凑齐。

方法

模型总参数 977M:778M 的流式 TTS 主干(基于 Gemma 3)加 199M 的音频编解码器。声学侧每秒 12.5 帧,每帧对应 80ms 音频,用 31 本 RVQ 码本。

几个关键设计:

结果

与 Qwen3-TTS-12Hz-1.7B、Audio Flamingo 3-Chat、Chatterbox-TTS 的对照(unseen speakers,单轮):

模型WER (%)↓Squim-MOS↑
Chatterbox-TTS(离线)1.244.27
Qwen3-TTS-12Hz-1.7B1.014.45
Audio Flamingo 3-Chat4.513.60
VoiceChat-TTS2.004.38

单轮可懂度略输 Qwen3-TTS,明显好于同为流式的 Audio Flamingo 3-Chat。多轮稳定性是重点:1 到 4 轮 WER 只从 2.00% 漂到 2.20%。

打断实验(Full-Duplex-Bench 的 200 个受控插话样本):开启 Force Silence 后 IOR@320ms 达 100%,平均停止延迟 89.9ms,打断后 1 秒内的语音泄漏 55.8ms,打断后下一轮的 CER 0.095%——不重置 KV cache 也能干净恢复。

延迟(RTX A6000,并发 1):每音频帧总耗时 9.62ms,Qwen3-TTS-12Hz 为 20.34ms,快 2.1 倍。一帧只对应 80ms 音频,9.62ms 的单帧开销意味着合成远跑得过播放。

另一组对照把 PersonaPlex 预测的文本 token 流固定不变、只换合成器:CER 从 4.06% 降到 2.05%,WER 从 5.00% 降到 2.42%,Squim-MOS 从 4.094 升到 4.292。同文本不同嗓子的差就这么多。

为什么重要

语音 agent 的延迟堆在链路上,每一级都在等上一级凑够输入。这篇证明 TTS 级可以做到「输入是流、输出是流、随时可打断、打断了不丢上下文」,而音质不塌。对做语音助手、陪伴类 agent 的团队,这是一条不用上端到端 S2S 也能拿到 duplex 体验的路径。模型权重已随 NVIDIA-NemotronLabs-VoiceChat-11B 开源,工程上可直接取用。

局限与存疑

论文自己列的:没有 user-audio conditioning,听不到用户的声学线索,韵律没法跟着对方语气调整;架构各组件缺系统性消融,改动是互补堆叠、没逐项量化。评测方面,连续 duplex TTS 还没有标准化 benchmark,长时程生成、反复打断后的恢复都缺直接测量——论文承认这点并列为后续工作。

数字上有一处要留意:unseen speaker 的 SECS(说话人相似度)从第 1 轮的 0.757 掉到第 4 轮的 0.685,零样本音色在长时程连续生成里会漂。Squim-MOS 是非侵入式估计,不是真人打分,绝对值别当 MOS 直接引用。

术语

原文与代码

社区讨论

相关论文

全部论文解读