用 Rust 让模型睡眠,单机省下近 80GB 空闲显存
ahstanin · reddit · 2026-09-12
作者在单工作站上跑多模态 agent 栈(Qwen3.8-27B 做 LLM + Nemotron STT + Chatterbox TTS + OCR),所有运行时同时常驻显存,空闲占用高达约 122GB——主因是 SGLang 等运行时会静态预留大量 KV pool(常达 85% 可用显存),辅助模型也带着满额 scratch buffer。
关键观察是:个人 agent 一次只需要部分模型在线——语音对话用 STT+TTS 不用 OCR;读文档用 OCR+LLM;跑长脚本时 LLM 都可以闲置。于是作者写了一个小型 Rust 控制器,在模型轮次结束时将其「睡眠」:清空执行缓冲和 KV pool,但保留进程和基座权重的内存映射,避免冷重启。
- 睡眠后各模型显存:LLM 从 87,443 MiB 降到 39,092 MiB(即 27B FP8 权重的真实开销);STT 降到 267 MiB;TTS 降到 3,127 MiB;OCR 降到 422 MiB
- 共回收 79,459 MiB(近 80GB)空闲显存
- 唤醒时间全部低于 200ms——因为不读盘、不重建计算图,切换延迟在实际使用中无感
作者最后在社区征集:想同时获得即时语音/工具响应又不想买第二块 GPU 时,大家如何处理多模型显存分配?
所属事件:Rust 动态休眠本地多模型,显存占用从 122GB 降至 43GB(2 条相关)→
「编程与Agent」频道最新
- Hazel 团队用 AI 追踪 Git 仓库,自动生成每周开发摘要 — neurocy · 2026-09-12
- 机器人学家:基座模型焦虑不必,SAM+轻量模型已够用 — chris_j_paxton · 2026-09-12
- Life Recorder 开源:iPhone 全天录音喂给本地 Whisper 做人生上下文 — TheMoonMidas · 2026-09-12
- SurrealDB 3.3.0 beta 联手 GradiumAI 推出带记忆的语音智能体 — mattturck · 2026-09-12
- Scobleizer 推荐开源浏览器 Agent WebBrain:可接本地模型自托管 — Scobleizer · 2026-09-12
- gpu-time:仅 24761 参数的浏览器端小模型,自然语言直接转日期规则 — shuding · 2026-09-12