本地部署探讨:DeepSeek 模型 KV Cache 精度对性能影响
esw123 · reddit · 2026-08-03
作者发帖探讨了在 Windows 系统上本地运行 DeepSeek 模型时,KV Cache 精度设置对性能和上下文长度的影响。
在 120GB 内存限制下,使用 IQ2M 量化并配合 F16 cache 时,最大上下文只能达到 65-67K。作者希望社区分享测试数据,讨论使用 Q8 级别 cache 的实际表现与具体选择建议。
「Infra」频道最新
- Meta 隐秘高性能算子库 MSLK 曝光,Agent 自动生成 API 文档 — giffmana · 2026-08-03
- 苹果 512GB M3 Ultra 仍是 AI 算力孤品,AI 大神苦等 M5 Ultra — jamesdouma · 2026-08-03
- NanoGPT 训练速度创 74.6 秒新纪录,前缀 token 预测立功 — surmenok · 2026-08-03
- AI 公司盈利超预期 71%,GPU 与算力消耗证实非泡沫 — ivan_bezdomny · 2026-08-03
- EdgeRazor:实现 1.88 bit 极低精度的大模型混合蒸馏新框架 — ttkciar · 2026-08-03
- 工程师提醒:部署模型应保持训练时的精度 — andrew_n_carr · 2026-08-03