llama.cpp 的 VRAM 缓存技巧让 Kimi K2.7 Code 跑到 340 pp/s
ylchao · reddit · 2026-07-22
这条帖分享了一种在 llama.cpp 里利用 VRAM 作为 MoE 模型缓存层 的做法:把专家权重尽量留在 CUDA 路径上,减少完整模型常驻显存的压力,从而让大模型在较小显存机器上跑得更快。
作者给出了两组实测:
- 在 DGX Spark 上跑 Kimi K2.7 Code GGUF,最佳配置达到 340 pp/s 预填充、9.6 tg/s 解码;
- 在 3090 + 128GB DDR4 机器上跑 MiniMax-M2.7 GGUF,也比较了不同 offload / unified memory 配置下的吞吐差异。
帖中还列出了可复现的 llama-bench 参数和 -ot regex 规则。核心结论是:如果把 MoE 的活跃专家尽量固定在 GPU 路径上,模型可以在有限硬件上获得明显更好的速度表现。
「Infra」频道最新
- Cloudflare 式基础设施让 agent-first 应用更容易搭建 — threepointone · 2026-07-22
- OpenFPM 的 CUDA 风格内核已可在 Apple GPU 上通过 Metal 运行 — Scobleizer · 2026-07-22
- SkewAdam 将 MoE 优化器显存降 97.4%,6.78B 可放进 40GB GPU — Kooky-Ad-4124 · 2026-07-22
- 三星据称拟以 200 亿欧元估值投资 Mistral 10 亿欧元 — rohanpaul_ai · 2026-07-22
- NVIDIA 与 ETH Zurich 通过删 barrier 降低 AllReduce 延迟 — thoefler · 2026-07-22
- Grok Build 为开发者新增 token 统计与批处理诊断 — elonmusk · 2026-07-22