专题 · FULL STORY

Fish Audio S2.1 Pro发布及免费API开放

Fish Audio发布面向生产环境的S2.1 Pro语音模型并获5200万美元融资,随后宣布将该模型作为免费API开放,凭借单卡H200的极致推理优化支持83种语言。

2026-07-29 ~ 2026-07-30 · 2 集 · 13 条

第 1 集 · Fish Audio发布S2.1 Pro语音模型并获5200万美元融资(2026-07-29,11 条)

Fish Audio正式发布了面向生产环境的语音克隆模型S2.1 Pro,并宣布完成5200万美元的种子轮融资。该模型主打实时对话与情绪表达,仅需极少量的音频样本即可完成高保真声音克隆,并在生成速度与成本上对竞品发起了直接挑战。

已确认

  • 融资与发布:Fish Audio官方宣布完成5200万美元种子轮融资,并同步公开发布S2.1 Pro语音模型。据@davidyin44转述,公司累计用户已超800万,年经常性收入(ARR)达到2100万美元。
  • 克隆门槛:根据多位博主的转述,该模型仅需5到15秒的音频样本即可克隆声音,并能保留原说话人的语调、节奏、情绪和口音。
  • 性能指标:官方披露S2.1 Pro的首音延迟约为90ms,足以支撑流畅的实时语音对话;模型支持覆盖83种语言,且允许通过类似[whispers sweetly]的标签进行实时情绪与风格控制,并支持发音和停顿的词级控制。
  • 限时免费:据@rohanpaulai补充,该模型目前正限时免费开放一个月。
  • 竞品对比:Fish Audio官方宣称,S2.1 Pro的生成速度是Cartesia的2倍,而使用成本仅为ElevenLabs的六分之一。

为什么重要

  • 降低开发门槛:秒级别的克隆样本需求与90ms的超低延迟,大幅降低了实时语音助手、交互式游戏NPC等应用场景的开发和集成门槛。
  • 加剧市场竞争:官方直接对标Cartesia与ElevenLabs并在速度和成本上给出具体倍数差异,预示着语音合成(TTS)与语音克隆市场的价格与性能战将进一步升级。

第 2 集 · Fish Audio 开放免费 TTS API,单卡 H200 榨干推理性能(2026-07-30,2 条)

Fish Audio 宣布将其最先进的 S2.1 Pro 语音模型作为免费文本转语音 API 开放,支持 83 种语言及合理使用下的无限调用。实现免费背后的核心逻辑在于极致的推理优化:通过自研软件栈,每个请求在单张 NVIDIA H200 GPU 上即可运行,实现了 0.17 RTF 和每秒 125 个音频 token 的高吞吐量,成功打破了高成本壁垒。