开源 zxLLM 精准预测 LLM 显存与 KV 缓存需求

Capable_Item_5918 · reddit · 2026-08-17

作者发布开源工具 zxLLM,旨在解决本地运行大模型时预估显存占用不准确的问题。该工具支持 vLLM、SGLang 和 llama.cpp,能自动检测模型架构(如 GQA)和配置,结合本地 GPU 状态,精确计算 VRAM 足迹和 KV-Cache 需求。经实测(包括 Llama 3、Qwen 2.5、DeepSeek 架构),预测误差率极低(约 0.04% - 1.8%),且纯 Python 编写,无外部依赖。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →