KV Cache 量化测试:RTX 5090 跑通 17 万上下文

Opening-Broccoli9190 · reddit · 2026-08-15

在 RTX 5090 上测试 Qwen 3.8 27B 模型,对比了不同 KV Cache 量化策略(Q80, Q51, Q40)对最大稳定上下文长度的影响。结果显示,降低 KV Cache 量化精度(至 Q40)能显著扩展上下文窗口(至 169,984 tokens),但需注意可能出现的性能回退问题。文末提供了详细的 llama.cpp 编译标志与运行配置示例。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →