字节 SwanTale 统一多角色语音与音效生成,零样本音色一致性 0.95
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang
eess.AS, cs.SD
2026-08-03
字节 SwanTale 用一个 2B 模型统一多角色语音、音效、歌声与音乐生成,支持文字描述与参考音频两种控制,零样本音色一致性达 0.95。
这篇在解决什么
动画配音、广播剧、游戏、短视频里,创作者经常要凭空设计声音:既要按文字描述捏出说话人的音色和环境音效,又要能照着一段参考音频复刻某个声音。过去这两件事是分开的,instruct 类 TTS 只管出语音不带环境音,zero-shot 语音克隆又没法用自然语言精细控制风格;而且多数系统只出语音,歌声、音乐、通用音效得靠下游混音管线拼接,时延、响度、混响常常和语音对不上。字节跳动的 SwanTale 想把这些能力塞进一个模型。
方法
SwanTale 是一套端到端的语音与音频生成系统,核心分几块。
- SwanVAE(音频 tokenizer):把 48kHz 单声道音频压成 96 维、25Hz(每帧 40ms)的表示,编码器感受野约 0.95 秒、端到端约 3.23 秒,407M 参数。重建用多分辨率 STFT 损失 + 多带 Mel 损失 + 帧能量损失,加 KL 正则和 MPD/MRD/MBCSD 判别器。在语音、歌声、通用音频、音乐四类上都做了重建评测。
- 数据(SwanData-Caption):约 7000 万条带 caption 的记录。caption 不只是「男声朗读」,而是分环境(地点、声场、混响、持续背景音)、说话人(性别、年龄、人设、音色、响度、语速、口音、习惯风格)、内容(带 <S1> 说话人标签和 <Audio> 音效标签的时间线)三层。用 Seed2.0 Lite 标注,配了面向动画/短剧/广告的风格人设库。
- Flow-matching DiT:用 Qwen 系文本编码器把 caption 经 cross-attention 注入所有 DiT 层,文本走 CosyVoice 2.0 的 tokenizer。质量分(STOI/SI-SDR/PESQ/MOS)转成 caption 标签,推理时强制用 high。
- Unified MoE:每隔一层 DiT 的 FFN 换成动态 Top-PP MoE,按帧路由音频专家、按样本路由任务共享专家,还有一个空专家(null expert)兜底。关键设计是时间感知的专家预算:越靠近生成末端,激活的专家数越多,因为精细波形需要更多算力;容量和空专家偏置也随时间变。SwanTale 激活参数约 2B。
- 训练流程:四阶段课程。先在 2300 万小时单说话人 + 170 万小时双说话人上训 zero-shot 基座,再做稠密 caption 适配,然后上全 caption 混合加 Unified MoE(1000 万样本),最后高质量高表现力 SFT(100 万样本)。
- GRPO 后训练:用保边界的随机流策略做组相对策略优化,K=8 条轨迹。奖励分共享项(音素核心、音素长度、停顿标点、边缘能量、质量)和任务专属项(instruct 看属性一致性,zero-shot 看说话人相似度),KL 约束加锚定回放防止崩。推理时用两阶段分解 CFG,文本和全条件引导权重分别在 [1.5, 3.0]。
结果
SwanVAE 重建在语音上 PESQ 4.1683、STOI 0.9680、MCD 0.9638、ViSQOL 4.1248,PESQ 和 MCD 是所有基线里最好的;歌声上 PESQ 3.9821、STOI 0.9001。零样本独白上,Timbre Consistency 0.95、SpeechJudge 4.01、Content Error 0.046、Expressive Richness 3.50,在所有对比系统里全部指标第一。评测集是自建的 SwanBench-Speech(独白/对话)、SwanBench-Scene(180 条指令,4 维 1–5 分)、SwanBench-Caption(64 例)和公开的 InstructTTSEval。
为什么重要
对做语音和音频生成的人来说,把 instruct 和 zero-shot 统一、并且一个模型同时出语音、音效、歌声、音乐,是工程上很省事的方向:下游不用再拼多条管线,混响和时延对不齐的问题在模型内部就解决了。caption 的三层结构(环境、说话人、内容)也给出了一种可迁移的「如何描述一段音频」的格式。代价是系统很重(2B 激活、64 卡 A100 训练),数据标注成本高,更适合大厂复现而不是个人跟进。
局限与存疑
论文没有独立的 Limitations 节。通读下来,通用音频和音乐的重建并非全面最好(ViSQOL 上音乐排第二、通用音频 LSD 第三),非语音模态还有提升空间;GRPO 后训练主要针对单说话人,多说话人和音频能力是靠锚定回放保住的而非直接优化;潜在帧率只有 25Hz(每帧 40ms),细节波形全靠解码器补;Unified MoE 的容量控制需要小心调,文中给了 z-loss 和空专家坍缩惩罚。另外评测集 SwanBench 大量自建,和公开系统比较时公平性需要自己掂量。
术语
- instruct / zero-shot:instruct 是用文字描述生成,zero-shot 是给一段参考音频复刻音色。
- PESQ / STOI / MCD:语音质量的客观指标,PESQ 评感知质量(满分约 4.5)、STOI 评可懂度(0–1)、MCD 评 Mel 频谱距离(越小越好)。
- flow matching:一种训练连续生成模型的方法,学一条把噪声流到数据的向量场,类似扩散但推理更直接。
- CFG(classifier-free guidance):推理时放大条件信号、压制无条件信号以提升遵循度的技巧。
- MoE(Mixture of Experts):把一个大网络拆成多个专家子网络,每次只激活一部分,用更少算力撑起更大容量。
原文与代码
相关论文
全部论文解读