llama.cpp 的 OSCAR2 KV Cache 基准
giveen · reddit · 2026-07-19
OSCAR2 在 llama.cpp 的 KV Cache 基准
作者在 RTX 5090 上测试了 llama.cpp 的 oscar2 KV cache 方案,并与 f16/f16、q20/q20 做对比。对 Qwen3.6-27B 来说,oscar2/oscar2 的生成速度约为 42 t/s,比 q20 快约 35%,同时接近 f16 的性能水平。
他还测试了不同上下文长度下的表现:从 4K 到 1M,oscar2 的生成速度基本保持平坦,没有明显退化;而 f16 在更长上下文下会很快 OOM,oscar2 则还能继续运行。整体结论是:这个 cache 方案在长上下文场景里兼顾了速度和显存占用。
「Infra」频道最新
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11