vLLM-Omni 流式架构首音频块仅 47ms,绕过整段生成等待
vllm_project · x · 2026-10-07
johnrobinsn 剖析了 vLLM-Omni 语音生成低延迟的关键:瓶颈在推理路径而非模型本身。
- 默认 transformers.generate():先生成全部 codec 码,再一次性解码,最后一段音频落地才能出声。
- vLLM-Omni:Talker 把 codec 码流式写入共享内存环形缓冲区,Code2Wav 分块消费并逐块输出 PCM,客户端随解码随收。
结果:首个音频 chunk 的 wall-clock 延迟约 47ms,无需等待完整序列生成。
「Infra」频道最新
- GitHub 全球宕机,工程师吐槽「正在抢修」 — iannuttall · 2026-10-08
- Codex Cloud 默默上线 Tailscale 支持,连 Tailscale 自己都不知情 — pvncher · 2026-10-08
- Marvell 投资者日后分析师上调 2030 年营收预期至 560 亿美元 — BenBajarin · 2026-10-08
- NVIDIA Vera Rubin 路线图转向:AI 竞赛正变成基础设施竞赛 — mikeflache · 2026-10-08
- Cursor 用户 30 天烧 1.5T token,折算年账单或达 1.32 亿美元 — zeeg · 2026-10-08
- 开源 AI-SQL 引擎 Quail 上线 prefix sharing:token 省 3 倍、提速 2.6 倍 — sh_reya · 2026-10-08