实测 KV 缓存混合技术,预填提速 3 倍

maddie-lovelace · reddit · 2026-08-22

作者分享了在 LLM 推理中尝试 KV cache blending 的实测结果。该技术将长 prompt 切分片段独立生成缓存再拼接,原本预期会失败,但在 Ling3-tiny 模型(非 KDA 层)上测试发现,只要片段间保留重叠,模型仍能保持完美的“大海捞针”检索能力,甚至支持跨片段综合。实测显示该方法在 256k 上下文下将预填速度提升 3 倍,达到约 1.3k tps,性能接近 Qwen 38-27B 在 5090 上的表现。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →