Qwen3-TTS 开源实现:H100 上首音 34ms、支持 10 RPS
Forsaken_Goal3692 · reddit · 2026-08-22
Nari Labs 开源了 Qwen3-TTS 1.7B 的高速实现,旨在解决本地模型响应慢的问题。在单张 H100 上,该实现可达 10 RPS(每秒请求数)且 P95 首音时间 (TTFA) 低于 50ms;调整设置后可达 20 RPS(TTFA < 100ms)。在 4090 上也能实现约 50ms 的 P95 TTFA。基准测试显示,其速度显著优于 vLLM-Omni 和 SGLang-Omni。
「Infra」频道最新
- GitHub 发布 Agent Plugins 1.0 标准,一次构建跨平台通用 — JeremyCMorgan · 2026-08-22
- AWS 揭秘查询感知压缩:降低 RAG 成本的新范式 — AWS ML Blog · 2026-08-22
- DeepSeek-V4-Flash 跑在 64GB Mac 上:小缓存竟胜过大缓存 — cowboy-bebob · 2026-08-22
- 求助:RTX 6000 Blackwell 上运行 Qwen 3.8 的最佳方案 — ApolloPS2 · 2026-08-22
- 超微独立调查洗清 CEO,称未参与 25 亿美元走私案 — fortune · 2026-08-22
- Qwen3.8-27B 优化:长上下文解码提速 3 倍 — stargate425 · 2026-08-22