单卡 H100 跑 4800 路并发流式 ASR,成本低至每分钟 $0.00045
Ok_boss_labrunz · reddit · 2026-10-04
团队推出持续推理引擎 .wave,用于服务 NVIDIA Nemotron 3.5 ASR Streaming 0.6B,定价 $0.00045/分钟。
核心技术是 WPK(Wave Persistent Kernel):
- GPU 程序常驻:不再反复在 CPU 与 GPU 之间交接控制,由 GPU worker 执行编译后的各阶段;
- 兼容流协同推进:一个权重 tile 可同时服务多个流,共享权重读取;
- 流式状态常驻:每条流保留自己的缓存,内存布局预先规划,减少动态分配。
实测(H100 SXM 80GB):
- 最高 4800 路并发流,80ms 音频块,p99 最慢流完成间隔 106.3ms(低于 120ms 上限);
- 中位帧端到端延迟 207–211ms(含 80ms 抖动缓冲);
- 相比 NVIDIA 官方公布的 240 路配置,容量比约 20 倍(非同环境对测);
- 对 fp32 参考的转写不一致率平均 0.23%。
托管服务支持 32 种语言,提供 OpenAI Realtime 兼容接口和 Deepgram 兼容端点,可直接配合 LiveKit、Pipecat 现有插件。作者还给出自建优化建议:排查 GPU 操作间空隙、跨流重复计算、并发下的慢流节奏。
「Infra」频道最新
- PrAIvy:把本地 Ollama 组成 P2P 网络互相共享算力 — Matty_za33 · 2026-10-04
- 从 Apple Lisa 到 DGX Spark:万元级计算机的 43 年轮回 — Thionne_WTZ · 2026-10-04
- AMD GPU 通过 vLLM 门控测试超 90%,软件生态可靠性逼近 NVIDIA CUDA — AnushElangovan · 2026-10-04
- 企业级推理盒 Go1 面世:标称 50ms 响应、可扛 8000 并发 — swagonflyyyy · 2026-10-04
- CrowdGPT:号称首个「无数据中心」开源 LLM,靠用户 GPU 众包训练 — Vxtzq1 · 2026-10-04
- 把 AI agent 挂脖子上:Neo4j 工程师用树莓派现场搭建个人智能体 — AI Engineer · 2026-10-04