单机多模型服务:Rust 守护进程省回 79GB 显存,唤醒延迟低于 200ms

ahstanin · reddit · 2026-09-12

Reddit 用户分享单节点多模型服务的内存管理实践。在单机上同时跑 Qwen 27B(FP8)+ Nemotron(STT)+ Chatterbox(TTS)+ OCR,空闲时就占约 122GB 显存,大头是 SGLang 为 KV cache 预分配的内存和各辅助模型的静态缓冲。他们的 agent 循环中语音/视觉模型几乎互斥,LLM 等工具执行时会空闲数秒到数分钟。做法:写了一个 Rust daemon 控制各运行时的休眠/唤醒,模型空闲时冲掉动态内存但保持进程驻留。结果:LLM 空闲显存从 87GB 降到 39GB,整体回收 79.4GB;因为避免磁盘 I/O 和图重建,所有服务唤醒延迟低于 200ms,不影响对话体验。

所属事件:Rust 动态休眠让单机多模型显存占用从 122GB 降至 43GB(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →