单张 RTX 5090 优化 Qwen3-Omni,首包音频延迟从 213ms 降至 23ms
vllm_project · x · 2026-10-05
- Fractalyze 团队在 vLLM-Omni 上优化了 Qwen3-Omni,使其能在单张 RTX 5090 上运行。
- 在 AWQ 4bit 量化、batch-1 文本提示测试中,相比原生 vLLM-Omni,首段音频生成时间从 213ms 降至 23ms。
- 完整工件已发布在 Hugging Face,vLLM 官方呼吁将优化贡献回上游 vLLM-Omni。这对端侧/低算力部署多模态语音模型是显著进展。
「Infra」频道最新
- 从先到先得到拍卖:经济学家用 Tullock 竞赛模型推演 OpenRouter 式算力路由演化 — AccBalanced · 2026-10-05
- PyTorch 加速器工作组统一跨后端支持,降低接入门槛 — PyTorch · 2026-10-05
- 数据中心增长停滞:电网、许可与审批卡死多个 AI 数据中心计划 — DavidLinthicum · 2026-10-05
- 开源工具 RemoveMacAI 可删除 macOS 上 12GB Apple Intelligence 数据 — The Verge AI · 2026-10-05
- 4.89MB 权重跑在 5 美元 ESP32-S3 上:ItoTTS 让本地 LLM 开口说话 — Significant-Price695 · 2026-10-05
- Mac Studio M5 Ultra 256GB 跑 GLM 5.3 Flash 达 68.8 tok/s — cryotic · 2026-10-05