GGUF 显存计算器走红:读文件头精确判断量化模型能否塞进你的 GPU
asankhs · reddit · 2026-09-17
LocalLLaMA 社区开发者发布 local-model-explorer:输入 GPU/RAM 或 Mac、Strix Halo、DGX Spark 的统一内存,选择上下文长度和 KV cache 类型,即可对约 3000 个热门 GGUF 模型按能否放下排序,并直接给出 llama-server 和 ollama 命令。内存占用通过读取 GGUF 文件头精确计算而非估算,还区分全 GPU、MoE 专家放 CPU、部分 offload 等情况,Mac 有 MLX 版本。
所属事件:LocalLLaMA 开发者推出 GGUF 显存计算器(2 条相关)→
「Infra」频道最新
- 512 块 AMD MI355X 跑出 575 万 tok/s,创 MLPerf 最大规模推理纪录 — wkmyrhang · 2026-09-17
- 钙钛矿或成美国太阳能翻身关键,效率天花板从30%升到45% — kyliebytes · 2026-09-17
- 编译器老兵复盘:移动浪潮终结同构计算,逼出 TPU/NPU 时代 — blelbach · 2026-09-17
- 从 x86 一统天下到架构碎片化:软件人将再度为硬件买单 — blelbach · 2026-09-17
- 低精度挖矿见底,硬件老兵称稀疏计算是 AI 下一个 10x — blelbach · 2026-09-17
- 摩尔定律三阶段:1970 免费午餐到 2015 后的软件地狱 — blelbach · 2026-09-17