开发者做了 GGUF 显存计算器:输入显卡即可知道哪个量化能跑
asankhs · reddit · 2026-09-17
LocalLLaMA 社区开发者发布了 local-model-explorer:输入你的 GPU/RAM 或 Mac、Strix Halo、DGX Spark 的统一内存,选定上下文长度和 KV cache 类型后,它会对约 3000 个热门 GGUF 模型按是否放得下排序。
亮点:
- 内存占用通过读取每个 GGUF 文件头(层数、KV heads、滑动窗口、MoE 专家数)精确计算,而非按参数量估算
- 区分全 GPU 运行、MoE 专家放 CPU、部分 offload、放不下四种情况
- 直接给出可复制的 llama-server -hf repo:quant ... 和 ollama 命令
- 覆盖 4k–262k 上下文的 KV cache 体积,并链接 MLX、AWQ、GPTQ、EXL2/EXL3、FP8 版本
不估算速度,但可以粘贴自己的 llama-bench 结果,数据集公开。Mac 另有 MLX 版本。
所属事件:LocalLLaMA 开发者推出 GGUF 显存计算器(2 条相关)→
「Infra」频道最新
- 512 块 AMD MI355X 跑出 575 万 tok/s,创 MLPerf 最大规模推理纪录 — wkmyrhang · 2026-09-17
- 钙钛矿或成美国太阳能翻身关键,效率天花板从30%升到45% — kyliebytes · 2026-09-17
- 编译器老兵复盘:移动浪潮终结同构计算,逼出 TPU/NPU 时代 — blelbach · 2026-09-17
- 从 x86 一统天下到架构碎片化:软件人将再度为硬件买单 — blelbach · 2026-09-17
- 低精度挖矿见底,硬件老兵称稀疏计算是 AI 下一个 10x — blelbach · 2026-09-17
- 摩尔定律三阶段:1970 免费午餐到 2015 后的软件地狱 — blelbach · 2026-09-17