Qwen3-TTS 开源实现:H100 上首音 34ms、支持 10 RPS

Forsaken_Goal3692 · reddit · 2026-08-22

Nari Labs 开源了 Qwen3-TTS 1.7B 的高速实现,旨在解决本地模型响应慢的问题。在单张 H100 上,该实现可达 10 RPS(每秒请求数)且 P95 首音时间 (TTFA) 低于 50ms;调整设置后可达 20 RPS(TTFA < 100ms)。在 4090 上也能实现约 50ms 的 P95 TTFA。基准测试显示,其速度显著优于 vLLM-Omni 和 SGLang-Omni。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →