全双工语音推理成本虚高 56 倍,自研引擎实现单卡 H100 并发 56 路
Ok_boss_labrunz · reddit · 2026-10-02
推理引擎团队 DotWave 发布两篇技术长文,指出全双工语音这类「持续推理」模型的服务成本被现有栈严重高估。
为什么贵:全双工语音模型边听边说、可被打断,每 80ms 必须交出一帧输出,静音期间也要运行(停顿时长用于判断话轮结束)。vLLM/SGLang/TensorRT-LLM 等按「请求」设计的假设全部失效:批次不能等待、过载全员迟到、内存不能中途释放、常规指标掩盖丢帧。NVIDIA 参考栈中 GPU 空转约 75%,两个会话就有 8–15% 音频帧迟到——相当于每路对话独占一张 H100。
怎么修:不换 GPU 不改模型,改运行方式:
- 模型编译成常驻 GPU 的单一程序,CPU 只喂数据收结果;
- 同一 tick 到期的所有会话合成一个批次,权重只读一次;
- 编译期固定调度与内存布局,去掉运行时调度器。
实测(单张 H100 SXM 80GB):56 路并发 vs 参考栈 1 路,每 160ms beat 的 p99 为 147.4–147.5ms,84,000 个会话-beat 零超时,单路对话 GPU 成本降低约 98%。
「Infra」频道最新
- Armada 成 Palantir 首家认证模块化数据中心伙伴,主权 AI 可离网运行 — brucemacv · 2026-10-02
- 英伟达市值重回 5.7 万亿美元新高,再增 1500 亿回购 — kimmonismus · 2026-10-02
- 开源 shardr:给本地模型做内容寻址存储与 BT 分发 — Cyb3erDudu · 2026-10-02
- Cloudflare Workers 新增 Analytics SQL 绑定,可直接 SQL 查询分析数据 — ritakozlov · 2026-10-02
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov · 2026-10-02
- 德银首评 FormFactor 买入:Nvidia GPU 探针卡二供,目标价 200 美元 — demian_ai · 2026-10-02