Fish Audio 说 S2.1 Pro 可在 90ms 内起声,覆盖 83 种语言
testingcatalog · x · 2026-07-29
Fish Audio 在推它的 S2.1 Pro 语音模型,主打实时、可控、覆盖面广。
- 官方给出的指标包括约 90ms 的首音延迟。
- 支持 83 种语言,并且可以用类似 [whispers sweetly]、[laughing nervously] 这样的自由格式标签做情绪控制,而不是只靠固定预设。
- 还有一个免费层,可以用同一模型做测试。
- 页面主要强调它适合配音、音频书、客服、旁白等需要更强表现力的音频场景。
所属事件:Fish Audio 发布 S2.1 Pro 语音模型主打低延迟(4 条相关)→
「多模态」频道最新
- Claude 5 Opus 生成无纹理游戏风格汽车画面 — ChrisGPT · 2026-07-29
- TILT 用模型内生奖励提升文生图组合一致性 — Debottam Dutta · 2026-07-29
- Claude 5 Opus 把无贴图越野车 demo 直接做成游戏画面 — ChrisGPT · 2026-07-29
- Stream3D 用有界记忆把冻结 3D 生成器变成流式模型 — pliang279 · 2026-07-29
- 创作者用 Agent One 做出 90 秒电影感恐怖预告 — LudovicCreator · 2026-07-29
- AI 生成图从写实改到丝网印刷,因摩尔纹被迫收手 — emollick · 2026-07-29