llama.cpp 的 OSCAR2 KV Cache 基准

giveen · reddit · 2026-07-19

OSCAR2 在 llama.cpp 的 KV Cache 基准

作者在 RTX 5090 上测试了 llama.cpp 的 oscar2 KV cache 方案,并与 f16/f16、q20/q20 做对比。对 Qwen3.6-27B 来说,oscar2/oscar2 的生成速度约为 42 t/s,比 q20 快约 35%,同时接近 f16 的性能水平。

他还测试了不同上下文长度下的表现:从 4K 到 1M,oscar2 的生成速度基本保持平坦,没有明显退化;而 f16 在更长上下文下会很快 OOM,oscar2 则还能继续运行。整体结论是:这个 cache 方案在长上下文场景里兼顾了速度和显存占用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →