Fish Audio 开源 S2:用 1000 万小时音频训练的可控 TTS
alex_verem · x · 2026-07-29
Fish Audio 开源了 S2,这是一款强调 语音情绪与韵律细粒度控制 的 TTS 模型。
它支持在文本中插入自然语言式控制指令,例如 [laugh]、[whispers],也可以用类似 [professional broadcast tone] 这样的开放式描述,把控制放到具体词或短语位置。官方称该系统在约 50 种语言、超过 1000 万小时 音频上训练,并结合了强化学习对齐与双自回归架构。发布内容还包括模型权重、微调代码和基于 SGLang 的流式推理引擎;文中给出的基准结果显示,它在若干评测上超过 Seed-TTS、MiniMax-Speech 以及 gpt-4o-mini-tts。
「多模态」频道最新
- Claude 5 Opus 独立生成无纹理土路赛车 demo — ChrisGPT · 2026-07-29
- TILT 用模型内生奖励提升文生图组合一致性 — Debottam Dutta · 2026-07-29
- Claude 5 Opus 把无贴图越野车 demo 直接做成游戏画面 — ChrisGPT · 2026-07-29
- Stream3D 用有界记忆把冻结 3D 生成器变成流式模型 — pliang279 · 2026-07-29
- 创作者用 Agent One 做出 90 秒电影感恐怖预告 — LudovicCreator · 2026-07-29
- AI 生成图从写实改到丝网印刷,因摩尔纹被迫收手 — emollick · 2026-07-29