Qwen3-TTS 97ms 流式无官方代码,社区补全完整复现配方
vllm_project · x · 2026-10-07
开发者 johnrobinsn 打包了复现 Qwen3-TTS 流式推理的端到端配方,vLLM 官方转发。
- Qwen 公布了 97ms 的流式延迟数字,但没有放出复现代码:模型卡只高层面描述了「Dual-Track streaming」,实际的管线接线、部署配置和按请求的参数都没给;
- 真正的配方藏在 vllm-omni 的流式优化里,单阶段 fused profile 已于 2026-10-02 进入 main 分支;
- 作者把这些整理进公开仓库,包含部署配置、环境版本锁定、CUDA 和 Python 的坑位说明。
对需要在本地部署 Qwen3-TTS 低延迟流式的开发者是直接可用的资料。
「Infra」频道最新
- Codex Cloud 默默上线 Tailscale 支持,连 Tailscale 自己都不知情 — pvncher · 2026-10-08
- NVIDIA Vera Rubin 路线图转向:AI 竞赛正变成基础设施竞赛 — mikeflache · 2026-10-08
- Cursor 用户 30 天烧 1.5T token,折算年账单或达 1.32 亿美元 — zeeg · 2026-10-08
- 开源 AI-SQL 引擎 Quail 上线 prefix sharing:token 省 3 倍、提速 2.6 倍 — sh_reya · 2026-10-08
- 从 SSD 流式加载专家:DeepSeek V4.1 在 Mac 上跑到近 40 tps — HankYeomans · 2026-10-08
- Cloudflare 的机器支付豪赌:7500 万笔小额交易瞄准 $2000B 市场 — LexSokolin · 2026-10-08