单张H100跑Qwen3-TTS:每百万字符仅2美元,碾压商业API
bibryam · x · 2026-08-31
Nari Labs 发布 Qwen3-TTS 1.7B CustomVoice 的自研推理实现与基准:在单张 NVIDIA H100 SXM 上达到 10 RPS、p95 首音频延迟(TTFA)低于 50ms,实时播放无 underrun。
- 与 vLLM-Omni、SGLang-Omni、VoxServe、M 五种实现对比(泊松开放负载、5 分钟),只有他们的实现做到 p95 TTFA < 50ms,且在 20 RPS 时仍低于 100ms。
- 成本:10 RPS 下约 630 字符/秒,按 H100 $4.29/小时折算约 $2/百万字符;对比 ElevenLabs V3 的 $100/百万、Cartesia Sonic 3.5 的 $49/百万,且延迟更低。
- 实现与基准全部开源,并给出了「实时 TTS」的四要素定义:低可听 TTFA、零 underrun、容量随 RPS 保持、输出不畸形。
「Infra」频道最新
- 双卡实战:R9700跑H3视频+3060跑Qwen,详细性能与配置复盘 — Master-Client6682 · 2026-08-31
- a16z 对话 Gavin Baker:算力需求为何持续碾压供给 — a16z Podcast · 2026-08-31
- 三星将 70% 存储产能锁定至 2031 年,拟转厂扩产 — zephyr_z9 · 2026-08-31
- 曝 OpenAI 购数万 Mac mini 训练智能体 — The Decoder · 2026-08-31
- 96GB Mac Studio 跑 Qwen 内存详解 — Mxmtm · 2026-08-31
- 双 RTX 6000 搭建本地开发环境,选什么模型好? — alexp702 · 2026-08-31