单机多模型服务:Rust 守护进程省回 79GB 显存,唤醒延迟低于 200ms
ahstanin · reddit · 2026-09-12
Reddit 用户分享单节点多模型服务的内存管理实践。在单机上同时跑 Qwen 27B(FP8)+ Nemotron(STT)+ Chatterbox(TTS)+ OCR,空闲时就占约 122GB 显存,大头是 SGLang 为 KV cache 预分配的内存和各辅助模型的静态缓冲。他们的 agent 循环中语音/视觉模型几乎互斥,LLM 等工具执行时会空闲数秒到数分钟。做法:写了一个 Rust daemon 控制各运行时的休眠/唤醒,模型空闲时冲掉动态内存但保持进程驻留。结果:LLM 空闲显存从 87GB 降到 39GB,整体回收 79.4GB;因为避免磁盘 I/O 和图重建,所有服务唤醒延迟低于 200ms,不影响对话体验。
所属事件:Rust 动态休眠让单机多模型显存占用从 122GB 降至 43GB(3 条相关)→
「Infra」频道最新
- OpenAI 揭秘存储平台 Habitat:Python 服务峰值每秒超 2000 万请求 — xeophon · 2026-09-12
- 腾讯开源 Agent 沙箱 CubeSandbox v0.7:冷启动 60ms,支持跨节点暂停恢复 — dr_cintas · 2026-09-12
- 32GB 显存跑 Qwen3.8 27B:动态配置让上下文从 17 万扩到 26 万 token — wadeAlexC · 2026-09-12
- DigitalOcean 推 M.A.R.S. 托管 Agent 运行时,首发接入 OpenAI Agents API — OpenAIDevs · 2026-09-12
- 分析师估算:Instinct 类应用每年或烧掉上亿美元 token 成本 — ivan_bezdomny · 2026-09-12
- 17B 模型从 SSD 跑起:单核 33 tokens/s,无 GPU 训练 — Just_Vugg_PolyMCP · 2026-09-12