GGUF 显存计算器走红:读文件头精确判断量化模型能否塞进你的 GPU

asankhs · reddit · 2026-09-17

LocalLLaMA 社区开发者发布 local-model-explorer:输入 GPU/RAM 或 Mac、Strix Halo、DGX Spark 的统一内存,选择上下文长度和 KV cache 类型,即可对约 3000 个热门 GGUF 模型按能否放下排序,并直接给出 llama-server 和 ollama 命令。内存占用通过读取 GGUF 文件头精确计算而非估算,还区分全 GPU、MoE 专家放 CPU、部分 offload 等情况,Mac 有 MLX 版本。

所属事件:LocalLLaMA 开发者推出 GGUF 显存计算器(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →