全双工语音推理成本虚高 56 倍,自研引擎实现单卡 H100 并发 56 路

Ok_boss_labrunz · reddit · 2026-10-02

推理引擎团队 DotWave 发布两篇技术长文,指出全双工语音这类「持续推理」模型的服务成本被现有栈严重高估。

为什么贵:全双工语音模型边听边说、可被打断,每 80ms 必须交出一帧输出,静音期间也要运行(停顿时长用于判断话轮结束)。vLLM/SGLang/TensorRT-LLM 等按「请求」设计的假设全部失效:批次不能等待、过载全员迟到、内存不能中途释放、常规指标掩盖丢帧。NVIDIA 参考栈中 GPU 空转约 75%,两个会话就有 8–15% 音频帧迟到——相当于每路对话独占一张 H100。

怎么修:不换 GPU 不改模型,改运行方式:

实测(单张 H100 SXM 80GB):56 路并发 vs 参考栈 1 路,每 160ms beat 的 p99 为 147.4–147.5ms,84,000 个会话-beat 零超时,单路对话 GPU 成本降低约 98%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →