llama.cpp 的 VRAM 缓存技巧让 Kimi K2.7 Code 跑到 340 pp/s

ylchao · reddit · 2026-07-22

这条帖分享了一种在 llama.cpp 里利用 VRAM 作为 MoE 模型缓存层 的做法:把专家权重尽量留在 CUDA 路径上,减少完整模型常驻显存的压力,从而让大模型在较小显存机器上跑得更快。

作者给出了两组实测:

帖中还列出了可复现的 llama-bench 参数和 -ot regex 规则。核心结论是:如果把 MoE 的活跃专家尽量固定在 GPU 路径上,模型可以在有限硬件上获得明显更好的速度表现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →