Fish Audio 开源 S2:用 1000 万小时音频训练的可控 TTS

alex_verem · x · 2026-07-29

Fish Audio 开源了 S2,这是一款强调 语音情绪与韵律细粒度控制 的 TTS 模型。

它支持在文本中插入自然语言式控制指令,例如 [laugh]、[whispers],也可以用类似 [professional broadcast tone] 这样的开放式描述,把控制放到具体词或短语位置。官方称该系统在约 50 种语言、超过 1000 万小时 音频上训练,并结合了强化学习对齐与双自回归架构。发布内容还包括模型权重、微调代码和基于 SGLang 的流式推理引擎;文中给出的基准结果显示,它在若干评测上超过 Seed-TTS、MiniMax-Speech 以及 gpt-4o-mini-tts。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →