用 Rust 让模型睡眠,单机省下近 80GB 空闲显存

ahstanin · reddit · 2026-09-12

作者在单工作站上跑多模态 agent 栈(Qwen3.8-27B 做 LLM + Nemotron STT + Chatterbox TTS + OCR),所有运行时同时常驻显存,空闲占用高达约 122GB——主因是 SGLang 等运行时会静态预留大量 KV pool(常达 85% 可用显存),辅助模型也带着满额 scratch buffer。

关键观察是:个人 agent 一次只需要部分模型在线——语音对话用 STT+TTS 不用 OCR;读文档用 OCR+LLM;跑长脚本时 LLM 都可以闲置。于是作者写了一个小型 Rust 控制器,在模型轮次结束时将其「睡眠」:清空执行缓冲和 KV pool,但保留进程和基座权重的内存映射,避免冷重启。

作者最后在社区征集:想同时获得即时语音/工具响应又不想买第二块 GPU 时,大家如何处理多模型显存分配?

所属事件:Rust 动态休眠本地多模型,显存占用从 122GB 降至 43GB(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →