单张 H200 跑出 0.17 RTF,Fish Audio 拆解免费背后的推理账本
rohanpaul_ai · x · 2026-07-30
Fish Audio 透露了其语音模型能够免费提供的底层逻辑:极致的推理优化。
硬件与推理栈:每个请求在单张 NVIDIA H200 GPU 上运行,结合自研软件栈(用于快速 FP8 运算的 fish-scales-ops 以及避免芯片闲置的 pingpong 调度器)。
性能指标:该方案实现了 0.17 的实时率(RTF),即生成速度是真实时间的 6 倍,每秒可输出 125 个音频 token,首音延迟约 70ms。这种极高的单卡吞吐量大幅压低了单次请求成本,使得免费策略在商业账本上变得可行。
所属事件:Fish Audio 开放免费 TTS API,单卡 H200 榨干推理性能(2 条相关)→
「Infra」频道最新
- 专家称 AI 需求增速远超供给,基础设施成核心瓶颈 — NinaDSchick · 2026-07-30
- 法国火情监测站实拍:开源小模型如何搞定边缘 AI — import_jmr · 2026-07-30
- 后训练痛点调查:并行实验混乱、依赖管理、GPU 成本高 — Pitiful-Minute-2818 · 2026-07-30
- Nscale 收购 Anyscale,打造全栈 AI 算力服务 — TechCrunch AI · 2026-07-30
- llama.cpp使用MTP推测解码时内存占用异常排查 — xornullvoid · 2026-07-30
- Hugging Face:闲置 GPU 就像停飞的客机,算力管理需新思路 — Hugging Face Blog · 2026-07-30