字节 SwanTale 统一多角色语音与音效生成,零样本音色一致性 0.95

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang

eess.AS, cs.SD

2026-08-03

字节 SwanTale 用一个 2B 模型统一多角色语音、音效、歌声与音乐生成,支持文字描述与参考音频两种控制,零样本音色一致性达 0.95。

这篇在解决什么

动画配音、广播剧、游戏、短视频里,创作者经常要凭空设计声音:既要按文字描述捏出说话人的音色和环境音效,又要能照着一段参考音频复刻某个声音。过去这两件事是分开的,instruct 类 TTS 只管出语音不带环境音,zero-shot 语音克隆又没法用自然语言精细控制风格;而且多数系统只出语音,歌声、音乐、通用音效得靠下游混音管线拼接,时延、响度、混响常常和语音对不上。字节跳动的 SwanTale 想把这些能力塞进一个模型。

方法

SwanTale 是一套端到端的语音与音频生成系统,核心分几块。

结果

SwanVAE 重建在语音上 PESQ 4.1683、STOI 0.9680、MCD 0.9638、ViSQOL 4.1248,PESQ 和 MCD 是所有基线里最好的;歌声上 PESQ 3.9821、STOI 0.9001。零样本独白上,Timbre Consistency 0.95、SpeechJudge 4.01、Content Error 0.046、Expressive Richness 3.50,在所有对比系统里全部指标第一。评测集是自建的 SwanBench-Speech(独白/对话)、SwanBench-Scene(180 条指令,4 维 1–5 分)、SwanBench-Caption(64 例)和公开的 InstructTTSEval。

为什么重要

对做语音和音频生成的人来说,把 instruct 和 zero-shot 统一、并且一个模型同时出语音、音效、歌声、音乐,是工程上很省事的方向:下游不用再拼多条管线,混响和时延对不齐的问题在模型内部就解决了。caption 的三层结构(环境、说话人、内容)也给出了一种可迁移的「如何描述一段音频」的格式。代价是系统很重(2B 激活、64 卡 A100 训练),数据标注成本高,更适合大厂复现而不是个人跟进。

局限与存疑

论文没有独立的 Limitations 节。通读下来,通用音频和音乐的重建并非全面最好(ViSQOL 上音乐排第二、通用音频 LSD 第三),非语音模态还有提升空间;GRPO 后训练主要针对单说话人,多说话人和音频能力是靠锚定回放保住的而非直接优化;潜在帧率只有 25Hz(每帧 40ms),细节波形全靠解码器补;Unified MoE 的容量控制需要小心调,文中给了 z-loss 和空专家坍缩惩罚。另外评测集 SwanBench 大量自建,和公开系统比较时公平性需要自己掂量。

术语

原文与代码

相关论文

全部论文解读