网易发布 Confucius4-TTS,支持 14 语言跨语种零样本克隆
_akhaliq · x · 2026-08-18
网易有道在 arXiv 发布 Confucius4-TTS 论文,并开源了升级版模型。这是一个多语言、跨语种的零样本语音生成系统,支持 14 种语言。其核心特点是不需要参考音频的文字转录(Transcript-Free),解决了野外音频通常无字幕的问题。模型采用两阶段架构:基于 LLM 的文本到语义(T2S)模块配合可学习的说话人编码器,以及基于条件流匹配的语义到声学(S2A)模块。在 CV3-Eval 跨语种基准测试中,平均 WER 仅为 3.73%,并在内部测试中取得了最佳的人声相似度排名。
「多模态」频道最新
- 西湖大学等提出三体散射算法,单步生成图像达 SOTA — jiqizhixin · 2026-08-18
- 寻找逼真产品测评 AI 数字人工具 — Mysterious_Level852 · 2026-08-18
- 实战:用 Midjourney 与 GPT IMG 2 生成角色场景 — aziz4ai · 2026-08-18
- Karate Warrior:Midjourney 与 GPT 图像生成视频 — aziz4ai · 2026-08-18
- MOSS-VL:支持实时交互的开源视觉语言模型 — OpenMOSS-Team · 2026-08-18
- 完整 Prompt 分享:玻璃与铜丝之手下的裁缝日常 — tisch_eins · 2026-08-18