单张 H200 跑出 0.17 RTF,Fish Audio 拆解免费背后的推理账本

rohanpaul_ai · x · 2026-07-30

Fish Audio 透露了其语音模型能够免费提供的底层逻辑:极致的推理优化。

硬件与推理栈:每个请求在单张 NVIDIA H200 GPU 上运行,结合自研软件栈(用于快速 FP8 运算的 fish-scales-ops 以及避免芯片闲置的 pingpong 调度器)。

性能指标:该方案实现了 0.17 的实时率(RTF),即生成速度是真实时间的 6 倍,每秒可输出 125 个音频 token,首音延迟约 70ms。这种极高的单卡吞吐量大幅压低了单次请求成本,使得免费策略在商业账本上变得可行。

所属事件:Fish Audio 开放免费 TTS API,单卡 H200 榨干推理性能(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →