网易有道 Confucius4-TTS:参考音频免转写,14 语零样本跨语种克隆 CV3-Eval 六向平均 WER 3.73%

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan

cs.SD, cs.CL

2026-08-12

网易有道开源 14 语零样本 TTS,用与 T2S 联训的可学习说话人编码器从参考音频直接提音色,推理不需要参考转写;CV3-Eval 跨语种六向平均 WER 3.73%,内部跨语种人评综合排名第一。

这篇在解决什么

零样本 TTS 的标准玩法是给模型一段参考音频加它的转写文本,模型把参考的语音 token 当前缀续写出目标语句。这个设计在真实场景里卡住:野外抓来的参考音频(播客、采访、方言、低资源语言)大多没有转写,而转写质量差会直接拖垮克隆效果。视频配音、有声书、无障碍工具这些最需要跨语种克隆的场景,恰好是转写最缺的地方。

已有几条去转写路线:Cross-lingual F5-TTS 靠 MMS 强制对齐,X-Voice 靠合成音频 prompt 微调。Confucius4-TTS(网易有道)选择把这些辅助结构整个去掉,只用一个与生成模型联训的说话人编码器。

方法

整体是两段式。T2S(text-to-semantic)是一个 24 层 decoder-only Transformer,把目标文本自回归地预测成语义 token,token 来自冻结的 MaskGCT 语义 codec。S2A(semantic-to-acoustic)用条件流匹配加 DiT 骨干把语义 token 渲染成 80 维 mel 谱,最后 BigVGAN 声码器出波形。

去转写的关键在说话人条件的给法:

同一份模型支持双模式推理:默认参考克隆只要说话人嵌入加目标文本,不受参考韵律约束,韵律风格更自由;有转写时可以切换续写克隆,把参考转写和参考语义 token 都拼进前缀,换来更高说话人相似度。S2A 侧还把 T2S 的隐状态(而非只有离散 token)作为条件传入,减少离散量化的信息瓶颈;训练时对条件做联合 dropout 以支持推理时的 classifier-free guidance。

训练数据约 50 万小时真实加合成语音,覆盖 14 语(中英日韩德法西印尼意泰葡俄马来越),经分离降噪、多系统 ASR 交叉过滤(错误率须低于 2.5%)、说话人聚类的清洗管线,32 张 A40 训练。

结果

基准指标Confucius4-TTS对照
CV3-Eval 跨语种(六向)平均 WER/CER3.73%CosyVoice 2 为 48.10(ja→zh 单向)
CV3-Eval 单向最佳ja→zh CER4.87%CosyVoice 2 48.10,OmniVoice 52.64
X-Voice 跨语种(七向)最低 CER 方向数4/7其余三向距最佳 ≤0.3 个绝对点
Seed-TTS-eval 英语WER / SIM1.49 / 0.700Qwen3-TTS 1.24 / 0.714(带转写)
Seed-TTS-eval 中文CER / SIM0.94 / 0.765Seed-TTS 1.12 / 0.796(带转写)
内部跨语种人评综合排名四个方向三个第一VoxCPM2 拿下 zh→en

表里多数基线(VoxCPM2、Qwen3-TTS、MiniMax 之外的开源对照)都带 † 标,即推理时用了参考转写;Confucius4-TTS 的数字在无转写条件下取得。人评盲测里它在音色相似度和自然度两个维度四个方向全部前二,ElevenLabs(Eleven v3)在 zh→ko、zh→ja 的发音维度仍是第一。

为什么重要

跨语种配音和全球化内容生产的实际瓶颈不在音质在数据:能拿到的参考音频经常没有转写。这条路线把「必须先跑一遍 ASR」从推理链路里去掉,且续写模式保留在同一份模型里,有转写时还能再换一档相似度。代码、权重、demo 都放了 GitHub(netease-youdao/Confucius4-TTS),是目前开源侧少数在 14 语跨度上做完整客观加主观双评测的系统。

对应用开发者,直接可用的是它的多语种覆盖和零依赖推理链;对研究者,双模式条件的消融(续写换相似度但 WER 变差,英语 0.700→0.715、1.49→1.68)是一个干净的参考点。

局限与存疑

作者承认的:情感表达和细粒度风格保持还不够强(人评里 emotion 维度四个方向只有一个第一);长尾语言数据和中文方言覆盖待补;流式低延迟推理和推理成本优化是后续工作。

读下来需要留意的地方。训练数据 50 万小时里合成部分的具体占比没有给出,只说「小部分」,而 MiniMax-MLS-Test 上 ElevenLabs 的数字引自 MiniMax 论文而非自测,评测条件是否完全对齐存疑。人评的内部测试集不公开,无法复现。俄语 WER 4.64 在所有对照里排中后段,论文没有解释这个短板。SIM 指标整体低于 Seed-TTS 和 VoxCPM2(带转写配置),说明无转写模式在音色保真上仍有结构性代价,续写模式正是为补这个洞存在的。另外推理要 25 步 Euler 加 CFG,延迟和成本对比没有数字。

术语

原文与代码

社区讨论

相关论文

全部论文解读