本地部署探讨:DeepSeek 模型 KV Cache 精度对性能影响

esw123 · reddit · 2026-08-03

作者发帖探讨了在 Windows 系统上本地运行 DeepSeek 模型时,KV Cache 精度设置对性能和上下文长度的影响。

在 120GB 内存限制下,使用 IQ2M 量化并配合 F16 cache 时,最大上下文只能达到 65-67K。作者希望社区分享测试数据,讨论使用 Q8 级别 cache 的实际表现与具体选择建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →