专题 · FULL STORY
Fish Audio S2.1 Pro发布及免费API开放
Fish Audio发布面向生产环境的S2.1 Pro语音模型并获5200万美元融资,随后宣布将该模型作为免费API开放,凭借单卡H200的极致推理优化支持83种语言。
2026-07-29 ~ 2026-07-30 · 2 集 · 13 条
第 1 集 · Fish Audio发布S2.1 Pro语音模型并获5200万美元融资(2026-07-29,11 条)
Fish Audio正式发布了面向生产环境的语音克隆模型S2.1 Pro,并宣布完成5200万美元的种子轮融资。该模型主打实时对话与情绪表达,仅需极少量的音频样本即可完成高保真声音克隆,并在生成速度与成本上对竞品发起了直接挑战。
已确认
- 融资与发布:Fish Audio官方宣布完成5200万美元种子轮融资,并同步公开发布S2.1 Pro语音模型。据@davidyin44转述,公司累计用户已超800万,年经常性收入(ARR)达到2100万美元。
- 克隆门槛:根据多位博主的转述,该模型仅需5到15秒的音频样本即可克隆声音,并能保留原说话人的语调、节奏、情绪和口音。
- 性能指标:官方披露S2.1 Pro的首音延迟约为90ms,足以支撑流畅的实时语音对话;模型支持覆盖83种语言,且允许通过类似[whispers sweetly]的标签进行实时情绪与风格控制,并支持发音和停顿的词级控制。
- 限时免费:据@rohanpaulai补充,该模型目前正限时免费开放一个月。
- 竞品对比:Fish Audio官方宣称,S2.1 Pro的生成速度是Cartesia的2倍,而使用成本仅为ElevenLabs的六分之一。
为什么重要
- 降低开发门槛:秒级别的克隆样本需求与90ms的超低延迟,大幅降低了实时语音助手、交互式游戏NPC等应用场景的开发和集成门槛。
- 加剧市场竞争:官方直接对标Cartesia与ElevenLabs并在速度和成本上给出具体倍数差异,预示着语音合成(TTS)与语音克隆市场的价格与性能战将进一步升级。
- Fish Audio 推出 5 秒克隆声音模型,称价格仅为 ElevenLabs 的六分之一 — JafarNajafov · 2026-07-29
- Fish Audio 说 S2.1 Pro 可在 90ms 内起声,覆盖 83 种语言 — testingcatalog · 2026-07-29
- Fish Audio发布S2.1 Pro:90ms低延迟支持83种语言 — testingcatalog · 2026-07-29
- Fish Audio 语音克隆只需 10 秒样本 — aryanXmahajan · 2026-07-29
- Fish Audio获5200万美元融资,推出S2.1 Pro语音克隆模型 — thisdudelikesAI · 2026-07-29
- Fish Audio 推出 S2.1 Pro 语音模型并披露 5200 万融资 — LinusEkenstam · 2026-07-29
- Fish Audio 融资 5200 万美元,AI 语音模型年收入达 2100 万 — davidyin44 · 2026-07-29
- Fish Audio 融资 5200 万美元并公开上线语音模型 S2.1 Pro — thisdudelikesAI · 2026-07-29
- Fish Audio 成立一年发布 S2.1 Pro 语音模型 — JafarNajafov · 2026-07-29
- Fish Audio 融资 5200 万美元,发布开源语音模型 S2.1 Pro — udmrzn · 2026-07-30
- Fish Audio 语音模型 S2.1 Pro 限时全免,成本仅竞品六分之一 — rohanpaul_ai · 2026-07-30
第 2 集 · Fish Audio 开放免费 TTS API,单卡 H200 榨干推理性能(2026-07-30,2 条)
Fish Audio 宣布将其最先进的 S2.1 Pro 语音模型作为免费文本转语音 API 开放,支持 83 种语言及合理使用下的无限调用。实现免费背后的核心逻辑在于极致的推理优化:通过自研软件栈,每个请求在单张 NVIDIA H200 GPU 上即可运行,实现了 0.17 RTF 和每秒 125 个音频 token 的高吞吐量,成功打破了高成本壁垒。
- 单张 H200 跑出 0.17 RTF,Fish Audio 拆解免费背后的推理账本 — rohanpaul_ai · 2026-07-30
- Fish Audio推出免费TTS API:单卡H200榨干125音频token/秒 — rohanpaul_ai · 2026-07-30