字节跳动 SwanTale 主攻多说话人语音音频生成
ByteDance · hf · 2026-08-04
字节跳动开源 SwanTale:面向多说话人的语音与音频生成
这篇工作聚焦两类需求:一类是 instruct 生成,用户用自然语言描述环境、说话人风格和内容;另一类是 zero-shot 生成,直接给参考音频并保持同样的细粒度内容控制。
- 论文同时提出了 SwanData-Caption 数据方案:清洗原始语音/音频数据、补充合成覆盖,并生成多层级、较准确的标注。
- 模型侧引入 SwanVAE,并结合 reward-conditioned quality control、Engram conditioning 和 Unified MoE。
- 训练上使用 curriculum learning 和 GRPO 后训练,让模型逐步强化能力。
- 作者称,SwanTale 在多个 zero-shot 与 instruct 指标上领先,尤其在表达性和复杂多说话人生成上表现最好。
帖子还附了 demo 链接。
「多模态」频道最新
- Codex 通过 MCP 把图片和视频生成外包给 GlobalGPT — SarahAnnabels · 2026-08-04
- Codex 把多模态生成交给 GlobalGPT 再回填工作区 — SarahAnnabels · 2026-08-04
- 普通电脑上做视频生成,FL2VA 20B 是默认首选 — cocktailpeanut · 2026-08-04
- Wan2GP 推出 AMD GPU 一键本地生成启动器 — cocktailpeanut · 2026-08-04
- MiniMax H3 生成动漫风格仍被吐槽不够稳 — Dangerous-Map-429 · 2026-08-04
- MiniMax H3 生成阿滕伯勒式电鳗纪录片旁白 — katattack1983 · 2026-08-04